LLM GitHub DD_Rag
DD_Ragは、企業内の知識ベースとAIアシスタントを統合するJavaベースのRAG(Retrieval-Augmented Generation)プロジ…
★ 154 ⑂ 16 2026-07-15
画像生成 GitHub Mobile-O
Mobile-Oは、モバイルデバイス上で動作する、統一されたマルチモーダルAIモデルです。画像理解(VQA、OCR、推論)と…
★ 153 ⑂ 15 NOASSERTION 2026-04-13
ASR / 音声認識 GitHub livecaption
livecaptionは、macOS (Apple Silicon) 向けのリアルタイムオンデバイス音声転写および翻訳を行うCLIツールです。UI…
★ 153 ⑂ 20 2026-06-29
AIエージェント GitHub invincat
Invincat CLIは、DeepAgents CLIを基盤としたPython製のターミナルAIプログラミングアシスタントです。ローカルリポ…
★ 152 ⑂ 15 MIT 2026-05-26
ASR / 音声認識 GitHub openwhisp
Openwhispは、Mac上で完全にローカルに動作する音声認識・テキスト補完ツールです。Fnキーを押しながら話すことで、…
★ 152 ⑂ 27 2026-04-11
動画生成 GitHub daihuo-jianshou
「带货剪手(AI E-commerce Video Generator)」は、Eコマース販売者や短編動画運営者向けのAI動画生成ツールです。…
★ 152 ⑂ 26 2026-07-13
AIエージェント GitHub ghostwork
Ghostworkは、ユーザーの画面操作を常時監視し、作業パターンを自動的に学習することで、反復的なタスクを自動化する…
★ 152 ⑂ 8 NOASSERTION 2026-07-02
動画生成 GitHub vibeframe
VibeFrameは、AIエージェントと連携してテキストのブリーフから最終的なMP4動画を生成、編集、出荷できるAIネイティ…
★ 151 ⑂ 29 MIT 2026-07-01
動画生成 GitHub HiAR
HiARは、階層的な自己回帰型のビデオ生成ツールで、従来のブロックファースト型からステップファースト型へと処理を…
★ 151 ⑂ 6 Apache-2.0 2026-06-19
ComfyUI GitHub ComfyUI-ultimate-openpose-editor
ComfyUI ultimate openpose editorは、ComfyUIの既存のOpenPoseエディターを大幅に改良した、多機能な拡張機能です。…
★ 149 ⑂ 28 GPL-3.0 2025-12-09
LLM GitHub Thinking-with-Visual-Primitives-pytorch
このツールは、DeepSeekの「Thinking with Visual Primitives」を非公式にPyTorchで再現したものです。マルチモーダ…
★ 149 ⑂ 19 MIT 2026-06-25
マルチモーダル GitHub cerul
Cerulは、AIエージェント向けの動画検索レイヤーであり、音声だけでなく、スライド、グラフ、デモ、画面上のテキスト…
★ 149 ⑂ 8 Apache-2.0 2026-07-13
動画生成 HF Wan2.2-TI2V-5B-Diffusers
Wan2.2は、テキストや画像から高品質な動画を生成する先進的な大規模動画生成モデルです。MoEアーキテクチャにより効…
❤ 148 ↓ 116.1k apache-2.0 2025-08-09
動画生成 GitHub ID-LoRA-LTX2.3-ComfyUI
このツールは、ComfyUI用のカスタムノード「ID-LoRA-2.3」を提供し、参照音声と画像に基づいて、話者の声と視覚的な…
★ 147 ⑂ 24 2026-07-01
LLM GitHub chunky
Chunkyは、RAG(Retrieval-Augmented Generation)パイプラインの品質を向上させるためのローカルでオープンソースの…
★ 147 ⑂ 13 MIT 2026-07-07
画像生成 GitHub CDM
本ツールは、「Continuous-Time Distribution Matching (CDM)」技術を用いた、少ステップ拡散蒸留のためのフレームワ…
★ 147 ⑂ 6 MIT 2026-05-11
ComfyUI GitHub ComfyUI-FaceChain
ComfyUI-FaceChainは、既存のFaceChainプロジェクトをComfyUI向けに再構築し、プロセスの分解と改善を行った画像処理…
★ 147 ⑂ 15 Apache-2.0 2025-04-28
マルチモーダル GitHub ICLR2026-Guide-CN
本ツールは、ICLR 2026の全5,352論文を大規模言語モデル(LLM)が分析し、その内容を「研究動機」「解決問題」「主要…
★ 147 ⑂ 7 2026-04-29
ComfyUI GitHub ComfyUI-FFmpeg
ComfyUI-FFmpegは、FFmpegの一般的な機能をComfyUIのカスタムノードとして提供し、ユーザーがComfyUI上で様々な動画…
★ 146 ⑂ 21 Apache-2.0 2026-05-02
画像生成 HF FLUX.2-klein-base-4B
FLUX.2 [klein] 4B Baseは、Black Forest Labsが開発した最速の画像モデルファミリーの一つです。生成と編集を統合し…
❤ 146 ↓ 163.0k apache-2.0 2026-02-24
AIエージェント GitHub agentic-engineering-handbook
このリポジトリは、AIエージェントシステムの構築に関する分散した知識を集約し、体系的な学習ロードマップを提供す…
★ 146 ⑂ 8 MIT 2026-06-27
画像生成 GitHub Hyper-Diffusion-Planner
「Hyper Diffusion Planner」は、ディフュージョンモデルを自動運転システムのエンドツーエンドプランナーとして活用…
★ 146 ⑂ 17 2026-07-09
動画生成 HF Wan2.2-T2V-A14B-Diffusers
Wan2.2は、テキストや画像から高品質なビデオを生成する先進的な大規模ビデオ生成モデルです。MoEアーキテクチャを採…
❤ 144 ↓ 114.9k apache-2.0 2025-08-09
ASR / 音声認識 GitHub SpeakSlow
「聲聲慢 SpeakSlow」は、中国語に特化した最速のローカル音声入力ツールです。無料かつオープンソースで、100%ロー…
★ 144 ⑂ 18 NOASSERTION 2026-07-11