3,595 repos GH 3,480 / HF 115 · 11 categories · GitHub上のAI関連OSSを日本語で早見 · 毎日自動更新

#GPU推奨 (100 repos)

「GPU推奨」タグが付いたリポジトリ

← 全リポジトリ

LLM
GitHub
LLMs-from-scratch
このリポジトリは、書籍「Build a Large Language Model (From Scratch)」の公式コードベースです。GPTに似た大規模…
★ 99.0k ⑂ 15.2k NOASSERTION 2026-07-11
ASR / 音声認識
GitHub
voicebox
Voiceboxは、ElevenLabsやWisprFlowの機能を統合した、オープンソースのAI音声スタジオです。数秒の音声サンプルから…
★ 41.0k ⑂ 4.9k MIT 2026-07-13
画像生成
GitHub
InvokeAI
Invokeは、Stable Diffusionモデルを活用し、プロフェッショナルから愛好家まで幅広いユーザーがビジュアルメディア…
★ 27.6k ⑂ 2.9k Apache-2.0 2026-07-13
音声生成 / TTS
GitHub
index-tts
IndexTTS2は、感情豊かで再生時間の厳密な制御が可能な自己回帰型ゼロショットテキスト音声合成(TTS)モデルです。…
★ 21.9k ⑂ 2.7k NOASSERTION 2026-07-14
3D / NeRF
GitHub
Meshroom
Meshroomは、複雑なデータ処理パイプラインを作成、管理、実行するためのオープンソースのノードベースのビジュアル…
★ 12.8k ⑂ 1.2k NOASSERTION 2026-07-13
マルチモーダル
GitHub
X-AnyLabeling
X-AnyLabelingは、Segment Anythingなどの強力なAIモデルを活用し、データラベリングを効率化するツールです。自動ラ…
★ 9.8k ⑂ 1.1k GPL-3.0 2026-07-13
ASR / 音声認識
GitHub
inference
Xorbits Inference (Xinference) は、言語、音声認識、マルチモーダルモデルの提供を容易にする強力で多機能なライブ…
★ 9.5k ⑂ 851 Apache-2.0 2026-07-26
音声生成 / TTS
GitHub
Bert-VITS2
Bert-VITS2は、多言語BERTをVITS2バックボーンに統合したテキスト読み上げ(TTS)システムです。このツールは、高度…
★ 8.8k ⑂ 1.3k AGPL-3.0 2026-06-29
マルチモーダル
HF
gemma-4-31B-it
Gemma 4 31B itは、Google DeepMindのオープンウェイトな命令調整済みマルチモーダルモデルです。テキストと画像を入…
❤ 3.2k ↓ 12.2M apache-2.0 2026-07-10
LLM
GitHub
how-to-train-your-gpt
このリポジリは、ChatGPTなどに使われている大規模言語モデル(LLM)をゼロから構築、学習、実行する方法を学ぶため…
★ 2.3k ⑂ 306 MIT 2026-06-23
ComfyUI
GitHub
comfyui-mixlab-nodes
comfyui-mixlab-nodesは、ComfyUI向けにWebアプリ化、画面共有、音声認識・音声合成、GPT連携、3D生成などをまとめて…
★ 1.9k ⑂ 124 MIT 2026-06-04
マルチモーダル
HF
gemma-4-26B-A4B-it
Gemma 4 26B A4B itは、Google DeepMindのオープンウェイトなマルチモーダル指示調整モデルです。テキストと画像を入…
❤ 1.3k ↓ 14.2M apache-2.0 2026-07-10
ComfyUI
GitHub
ComfyUI-DepthAnythingV3
ComfyUI上でDepth Anything V3を使えるようにするカスタムノード集です。単一画像や複数視点画像から深度推定を行い…
★ 427 ⑂ 29 MIT 2026-06-06
マルチモーダル
HF
Falcon-OCR
Falcon OCRは、3億パラメータを持つ早期結合型ビジョン・言語モデルで、文書のOCR(光学文字認識)に特化しています…
❤ 121 ↓ 4.0k apache-2.0 2026-07-03
マルチモーダル
HF
MOSS-Audio-8B-Thinking
MOSS-Audio-8B-Thinkingは、音声・環境音・音楽を横断的に理解できるオープンソースの音声理解モデルです。文字起こ…
❤ 78 ↓ 27.2k apache-2.0 2026-06-11
動画生成
GitHub
open-director
OpenDirectorは、一行のアイデアから音声、BGM、絵コンテ付きの完成されたビデオを生成するオープンソースのAIビデオ…
★ 67 ⑂ 13 LGPL-3.0 2026-05-29
音声生成 / TTS
GitHub
Higgs_v3-TTS-ComfyUI
このツールは、ComfyUI用のノード集であり、bosonai/higgs-audio-v3-tts-4bモデルを活用して、多言語(100言語対応)…
★ 61 ⑂ 11 MIT 2026-06-20
マルチモーダル
GitHub
GameVerse
GameVerseは、動画ベースの反射学習を通じてVision-Language Models (VLMs) がゲームプレイを学習できるかを検証する…
★ 50 MIT 2026-07-13
ComfyUI
GitHub
ComfyUI-Grounding
ComfyUI-Groundingは、ComfyUI上でテキスト指定による物体検出・領域マスク生成・SAM2セグメンテーションをまとめて…
★ 44 ⑂ 3 MIT 2026-07-13
ComfyUI
GitHub
ComfyUI-TranslateGemma
このツールは、Googleのオープンソース翻訳モデル「TranslateGemma」をComfyUIに統合するノードです。Gemma 3をベー…
★ 29 ⑂ 3 MIT 2026-06-13
3D / NeRF
HF
VoxTell
VoxTellは、自然文のテキスト指示からCT・MRI・PETなどの3D医用画像に対するセグメンテーションマスクを生成できる医…
❤ 17 ↓ 283 cc-by-nc-sa-4.0 2026-06-29
ASR / 音声認識
GitHub
AI-Medical-Scribe
AI Medical Scribeは、ブラウザ内で完結するローカルファーストのAI医療記録ツールです。バックエンドやAPIキーが不…
★ 14 ⑂ 1 MIT 2026-05-22
マルチモーダル
HF
moss-video-preview-base
MOSS-Video-Preview-Baseは、動画と言語をネイティブに統合して扱うクロスアテンション型の事前学習ベースモデルです…
❤ 13 ↓ 7 apache-2.0 2026-06-09
ASR / 音声認識
GitHub
video-podcast-clipper
「Video Podcast Clipper」は、長尺動画からTikTokやYouTube Shorts向けのバイラルな縦型ショートクリップを自動生成…
★ 7 ⑂ 1 MIT 2026-05-28