画像生成 HF stable-diffusion-xl-base-1.0
このモデルはStability AIが開発した、テキストプロンプトから画像を生成・修正する拡散ベースの画像生成AI「Stable …
❤ 7.9k ↓ 1.4M openrail++ 2023-10-30
ComfyUI GitHub fast-stable-diffusion
TheLastBen/fast-stable-diffusionは、Google Colab上でStable Diffusion環境を迅速に構築・実行するためのノートブ…
★ 7.9k ⑂ 1.4k MIT 2025-11-29
画像生成 GitHub MochiDiffusion
Mochi Diffusionは、Apple Silicon搭載Mac向けに最適化されたStable DiffusionおよびFLUX.2 Kleinのネイティブアプリ…
★ 7.9k ⑂ 362 GPL-3.0 2026-06-21
音声生成 / TTS GitHub vits
VITSは、エンドツーエンドのテキスト読み上げ(Text-to-Speech, TTS)システムであり、条件付き変分オートエンコーダ…
★ 7.9k ⑂ 1.4k MIT 2023-12-06
画像生成 GitHub Dreambooth-Stable-Diffusion
本リポジトリは、GoogleのDreamboothのアイデアをStable Diffusionに実装したものです。従来のTextual Inversionが単…
★ 7.7k ⑂ 798 MIT 2022-12-08
AIエージェント GitHub ShortGPT
ShortGPTは、YouTubeショートやTikTokチャンネルの自動化に特化したAIビデオ自動化フレームワークです。LLM指向の編…
★ 7.7k ⑂ 1.1k MIT 2025-02-10
AIエージェント GitHub yao
Yaoは、AIエージェントとWebアプリケーションを単一バイナリで構築するためのオープンソースランタイムです。会話型…
★ 7.7k ⑂ 689 NOASSERTION 2026-08-18
ComfyUI GitHub ComfyUI-Workflows-ZHO
「ComfyUI Workflows ZHO」は、人気のAI画像生成インターフェースであるComfyUI向けの、多岐にわたるワークフローを…
★ 7.7k ⑂ 703 GPL-3.0 2024-12-20
ASR / 音声認識 GitHub mlx-audio
MLX-Audioは、AppleのMLXフレームワークを基盤とし、Apple Silicon (Mシリーズチップ) に最適化された高速で効率的な…
★ 7.7k ⑂ 682 MIT 2026-07-31
画像生成 GitHub lora
このツールは、拡散モデル(特にStable Diffusion)を効率的にファインチューニングするためのLow-rank adaptation (…
★ 7.5k ⑂ 496 Apache-2.0 2024-03-22
音声生成 / TTS GitHub MeloTTS
MeloTTSは、MITとMyShell.aiによって開発された、高品質な多言語テキスト読み上げライブラリです。英語(複数アクセ…
★ 7.5k ⑂ 1.1k MIT 2024-12-24
AIエージェント GitHub Bindu
Binduは、AIエージェントのためのアイデンティティ、通信、決済レイヤーを提供するプラットフォームです。エージェン…
★ 7.5k ⑂ 418 NOASSERTION 2026-07-06
画像生成 GitHub mmagic
MMagic (OpenMMLab Multimodal Advanced, Generative, and Intelligent Creation Toolbox)は、テキストから画像生成…
★ 7.4k ⑂ 1.1k Apache-2.0 2024-08-06
マルチモーダル GitHub PixelRAG
PixelRAGは、ウェブページ、PDF、画像をスクリーンショットとして視覚的にレンダリングし、ビジョン言語モデルで埋め…
★ 7.3k ⑂ 610 Apache-2.0 2026-07-16
ComfyUI GitHub Auto-Photoshop-StableDiffusion-Plugin
このツールは、Automatic1111 Stable Diffusionの機能をAdobe Photoshop内で直接利用できるプラグインです。ユーザー…
★ 7.3k ⑂ 530 MIT 2024-04-22
LLM GitHub InternLM
InternLMは、汎用的な利用と高度な推論のために設計された大規模言語モデル(LLM)シリーズです。最新のInternLM3-8B…
★ 7.2k ⑂ 507 Apache-2.0 2025-10-30
LLM GitHub opencompass
OpenCompassは、大規模言語モデル(LLM)の評価を効率的かつ正確に行うための包括的なプラットフォームです。強力な…
★ 7.2k ⑂ 817 Apache-2.0 2026-07-27
LLM GitHub loop-engineering
Loop Engineeringは、GrokやClaude CodeなどのAIコーディングエージェントのプロンプトとオーケストレーションを行う…
★ 7.2k ⑂ 901 MIT 2026-07-12
AIエージェント GitHub omnigent
Omnigentは、Claude Code、Codex、Pi、およびユーザーが作成したカスタムエージェントを含む、あらゆるAIエージェン…
★ 7.1k ⑂ 970 Apache-2.0 2026-07-12
ASR / 音声認識 GitHub vibe
Vibeは、OpenAI Whisper技術を利用してオーディオやビデオをオフラインで高精度に文字起こしするツールです。データ…
★ 6.9k ⑂ 465 MIT 2026-07-26
ASR / 音声認識 GitHub annyang
annyangは、ウェブサイトを音声コマンドで制御できるようにする軽量なJavaScript音声認識ライブラリです。わずか2KB…
★ 6.8k ⑂ 1.0k MIT 2026-06-11
3D / NeRF GitHub awesome-NeRF
「Awesome Neural Radiance Fields」は、ニューラルラディアンスフィールド(NeRF)に関する優れた研究論文を厳選し…
★ 6.8k ⑂ 599 MIT 2025-01-06
マルチモーダル GitHub Qwen-VL
Qwen-VLは、Alibaba Cloudが開発した大規模ビジョン言語モデル「通义千问-VL」の公式リポジトリです。Qwen-VL-Plusお…
★ 6.7k ⑂ 493 NOASSERTION 2024-08-07
音声生成 / TTS GitHub espeak-ng
eSpeak NGは、Linux、Windows、Androidなど多様なOSに対応するオープンソースのコンパクトなテキスト読み上げシンセ…
★ 6.6k ⑂ 1.3k GPL-3.0 2026-06-29