3,595 repos GH 3,480 / HF 115 · 11 categories · GitHub上のAI関連OSSを日本語で早見 · 毎日自動更新
#Python (2196 repos)
「Python」タグが付いたリポジトリ
← 全リポジトリ
ASR / 音声認識 GitHub doubao-murmur
Doubao Murmurは、豆包(doubao.com)のWeb音声認識機能を活用したミニマルな音声入力ツールです。macOSとLinux/Stea…
★ 59 ⑂ 2 MIT 2026-06-13
画像生成 GitHub MirrorMetrics
MirrorMetricsは、Stable DiffusionのFace LoRA(ファインチューニングモデル)の評価に特化した科学的ベンチマーキ…
★ 59 ⑂ 8 MIT 2026-02-21
画像生成 GitHub ComfyUI-Anima-Enhancer
ComfyUI-Anima-Enhancerは、ComfyUI用のカスタムノードで、特にAnimaモデルによる画像生成の品質と速度を向上させる…
★ 58 ⑂ 3 2026-03-17
3D / NeRF GitHub diff-surfel-tracing
このツールは、2D Gaussian Splatting(2DGS)とNVIDIA OptiXを基盤とした、差分可能な2Dガウスレイトレーサーです。…
★ 58 ⑂ 5 NOASSERTION 2025-10-14
ASR / 音声認識 GitHub ArcSub
ArcSubは、クラウドサービスとローカルのOpenVINOモデルの両方を活用するエンドツーエンドの字幕翻訳ワークステーシ…
★ 58 ⑂ 12 MIT 2026-05-23
ComfyUI GitHub ComfyUI-Layers
ComfyUI-Layersは、ComfyUI用のカスタムノード「LayersSaver」を提供するツールです。このノードを使用すると、画像…
★ 58 ⑂ 8 GPL-3.0 2024-07-31
音声生成 / TTS GitHub become-ceo
「Become CEO」は、Discord上でAIエグゼクティブチームを構築するツールです。エンジニアリング、財務、マーケティン…
★ 57 ⑂ 8 MIT 2026-03-13
マルチモーダル GitHub OmniVideo-100K
「OmniVideo-100K」は、音声・視覚推論能力の向上を目指す大規模データセットと、そのための自動データ合成エンジン…
★ 56 ⑂ 2 Apache-2.0 2026-07-08
LLM GitHub deepcloak
DeepCloakは、Cloudflare、Datadome、Turnstile、reCAPTCHAなどのボットウォールによってブロックされるウェブページ…
★ 56 ⑂ 8 MIT 2026-06-05
マルチモーダル HF audio-flamingo-next-hf
Audio Flamingo Nextは、音声・環境音・音楽をまとめて理解できるNVIDIAの大規模音声言語モデルです。音声Q&A、文字…
❤ 56 ↓ 5.7k other 2026-05-13
3D / NeRF GitHub EcoSplat
EcoSplatは、効率制御可能なフィードフォワード3D Gaussian Splatting技術を実装したツールです。マルチビュー画像か…
★ 56 ⑂ 2 MIT 2026-06-11
3D / NeRF GitHub metaquest-3d-reconstruction
本ツールは、Meta Questデバイスでキャプチャされたパススルー画像と深度データを用いて3Dシーンを再構築するための…
★ 55 ⑂ 11 MIT 2026-06-23
LLM GitHub ATM-Bench
ATM-Benchは、画像、動画、メールなどのマルチモーダルデータに対し、約4年間にわたる長期的なパーソナライズされた…
★ 55 ⑂ 3 MIT 2026-06-28
3D / NeRF GitHub MuGS
MuGSは、MuJoCo物理シミュレーションと3D Gaussian Splatting (3DGS) を組み合わせたハイブリッドレンダリングパイプ…
★ 54 ⑂ 2 NOASSERTION 2026-05-14
画像生成 GitHub LeapAlign_Code
LeapAlignは、フローマッチングモデルを人間の好みに合わせて微調整するための学習後手法です。完全なサンプリング軌…
★ 54 ⑂ 1 Apache-2.0 2026-06-13
動画生成 GitHub Awesome-Gemini-Omni-API-Prompts
このリポジトリは、Google Gemini Omni APIのプロンプト集です。MuAPIを通じて独占的に提供されるGemini Omni APIの…
★ 54 ⑂ 6 MIT 2026-06-11
ComfyUI GitHub ComfyUI-StableAudioX
ComfyUI上でAudioXモデルを使い、テキストや動画を入力として高品質な音声・音楽を生成できる拡張機能です。テキスト…
★ 53 ⑂ 9 NOASSERTION 2025-06-24
ComfyUI GitHub ComfyUI-Arc2Face
foivospar氏のArc2Faceモデルを基盤としたComfyUI用カスタムノードライブラリです。このツールは、画像から顔の埋め…
★ 53 ⑂ 10 MIT 2024-09-02
LLM GitHub memexa
Memexaは、AIエージェントと人間が中国語のデータを扱うための自己ホスト型記憶グラフツールです。WeChat、QQ、飛書…
★ 53 ⑂ 4 Apache-2.0 2026-07-01
音楽生成 GitHub SynthBridge
SynthBridgeは、ユーザーが入力したコード進行やメロディをリアルタイムで生成し、即座に演奏できる音楽生成Webアプ…
★ 52 MIT 2026-05-27
ComfyUI GitHub ComfyUI-AceStep_SFT
ComfyUI-AceStep SFTは、最先端の音楽生成モデル「AceStep 1.5 SFT」をComfyUIに実装するためのモジュラーノードスイ…
★ 52 ⑂ 11 MIT 2026-05-11
ComfyUI GitHub ComfyUI-Open-Sora-Plan
このリポジリは、AIによる動画生成プロジェクト「Open-Sora-Plan」のワークフローを、人気の高いビジュアルプログラ…
★ 52 ⑂ 8 MIT 2024-05-29
ComfyUI GitHub RealisDance-ComfyUI
RealisDance-ComfyUIは、RealisDanceをComfyUI上で扱うためのカスタムノードです。参照画像に加え、DWpose、HaMeR、S…
★ 52 ⑂ 2 Apache-2.0 2024-09-13
ASR / 音声認識 GitHub voicetag
voicetagは、Pythonで書かれた話者分離および話者識別ライブラリです。pyannote.audioとresemblyzerを組み合わせて「…
★ 52 ⑂ 5 MIT 2026-03-16