画像生成 HF FLUX.2-klein-base-4B
FLUX.2 [klein] 4B Baseは、Black Forest Labsが開発した最速の画像モデルファミリーの一つです。生成と編集を統合し…
❤ 146 ↓ 163.0k apache-2.0 2026-02-24
動画生成 HF Wan2.2-T2V-A14B-Diffusers
Wan2.2は、テキストや画像から高品質なビデオを生成する先進的な大規模ビデオ生成モデルです。MoEアーキテクチャを採…
❤ 144 ↓ 114.9k apache-2.0 2025-08-09
音声生成 / TTS GitHub VTS
VTS(Voice To Sound)は、ユーザーの音声スケッチとテキストプロンプトを組み合わせて効果音を生成するツールです。…
★ 143 ⑂ 6 MIT 2026-06-18
ComfyUI GitHub comfyui-flux-accelerator
ComfyUI Flux Acceleratorは、ComfyUI上でFlux.1の画像生成を高速化するためのカスタムノードです。TAEF1による高速…
★ 141 ⑂ 5 MIT 2024-12-19
音声生成 / TTS GitHub controlfoley
ControlFoleyは、ビデオ、テキスト、参照オーディオを組み合わせることで、高精度かつ制御可能なビデオ-オーディオ生…
★ 141 ⑂ 3 Apache-2.0 2026-07-13
ComfyUI GitHub ComfyUI-Molmo
ComfyUI-Molmoは、Molmoモデルを使用して画像の詳細な説明と内容分析を可能にするComfyUI用のカスタムノードです。画…
★ 140 ⑂ 8 Apache-2.0 2024-10-14
マルチモーダル GitHub GEMS
GEMSは、エージェントネイティブなマルチモーダル生成のための先進的なフレームワークです。記憶とスキルを活用し、K…
★ 139 ⑂ 10 2026-04-01
動画生成 GitHub EffectErase
「EffectErase」は、ビデオからのオブジェクト除去と挿入を同時に、かつ高品質に行うためのツールです。CVPR 2026で…
★ 138 ⑂ 7 NOASSERTION 2026-04-10
3D / NeRF GitHub gaussian-point-splatting
本ツールは、独自の確率的なアプローチ「Gaussian Point Splatting」により、数億個に及ぶ大規模な3D Gaussian Splat…
★ 135 ⑂ 11 BSD-3-Clause 2026-06-05
マルチモーダル GitHub Graph-CAD
Graph-CADは、自然言語の指示から実行可能なBlender用CADコードを自動生成するための、グラフ媒介型Text-to-CADフレ…
★ 135 ⑂ 12 2026-03-30
ComfyUI GitHub XB_ToolBox
XB_ToolBoxは、ComfyUIのAI初心者が効率的にワークフローを構築し、ローカルでAIモデルを実行できるように設計された…
★ 134 ⑂ 7 Apache-2.0 2026-07-11
ComfyUI GitHub ComfyUI-Depth-Anything-Tensorrt
「ComfyUI Depth Anything TensorRT」は、人気のある画像生成UIであるComfyUI向けのカスタムノードで、Depth Anythin…
★ 133 ⑂ 14 NOASSERTION 2026-06-04
動画生成 GitHub PSIVG
このリポジトリは、CVPR 2026で発表される研究プロジェクト「Physical Simulator In-the-Loop Video Generation」の…
★ 129 ⑂ 14 Apache-2.0 2026-06-01
3D / NeRF GitHub nexels
「Nexels」は、疎なジオメトリを用いてリアルタイムで新しい視点画像を合成するニューラルテクスチャ付きサーフェル…
★ 129 ⑂ 6 NOASSERTION 2025-12-18
動画生成 HF Wan2.1-T2V-1.3B-Diffusers
Wan2.1は、最先端のビデオ生成技術を提供するオープンな大規模ビデオ基盤モデルスイートです。テキストからビデオ、…
❤ 129 ↓ 169.2k apache-2.0 2025-04-04
マルチモーダル HF LLaVA-Video-7B-Qwen2
LLaVA-Video-7B-Qwen2は、動画理解に特化した7B規模のマルチモーダルモデルです。画像・複数画像・動画を扱えますが…
❤ 127 ↓ 15.8k apache-2.0 2024-10-25
LLM GitHub VidCom2
VidCom2は、Video Large Language Models (VideoLLMs) の推論を高速化するためのプラグアンドプレイなフレームワーク…
★ 127 ⑂ 14 Apache-2.0 2026-05-14
動画生成 GitHub LiveWorld
LiveWorldは、生成型ビデオワールドモデルにおいて、視界外のダイナミクスをシミュレートする画期的なフレームワーク…
★ 127 ⑂ 3 Apache-2.0 2026-06-23
マルチモーダル HF LLaVA-NeXT-Video-7B-hf
LLaVA-NeXT-Video-7B-hfは、画像と動画を一緒に理解して対話できるオープンソースのマルチモーダル生成モデルです。T…
❤ 126 ↓ 181.9k llama2 2025-11-11
画像生成 GitHub Spectrum
「Spectrum」は、学習不要なスペクトル拡散特徴予測を用いて、拡散モデルのサンプリング速度を大幅に向上させるツー…
★ 126 ⑂ 7 MIT 2026-04-30
動画生成 HF Matrix-Game-3.0
Matrix-Game 3.0は、画像とテキストを入力に、長時間の一貫性を保った720pインタラクティブ動画をリアルタイム生成で…
❤ 124 ↓ 245 apache-2.0 2026-04-28
動画生成 GitHub Echo-Memory
Echo-Memoryは、Joy Future AcademyのEcho Teamが開発した、ビデオワールドモデルにおけるメモリの役割を研究するた…
★ 123 ⑂ 7 2026-07-11
画像生成 GitHub guaardvark
Guaardvarkは、自己ホスト型AIワークステーションであり、自律型スクリーンエージェント、3層ニューラルルーティング…
★ 122 ⑂ 27 MIT 2026-07-06
ComfyUI GitHub ComfyUI-Woosh
ComfyUI-Wooshは、ComfyUI向けのサウンドエフェクト生成ノード集です。Sony AIのWoosh基盤モデルを活用し、テキスト…
★ 119 ⑂ 8 MIT 2026-05-07