概要
ComfyUI用のカスタムノードとして、ローカル環境で複数の音声合成エンジンと多言語対応のテキスト読み上げ(TTS)、音声変換、音声編集、RVCモデルトレーニングを統合的に提供するツールです。
F5-TTS、ChatterBox、VibeVoice、Higgs Audio 2、IndexTTS-2、CosyVoice3、Qwen3-TTS、Step Audio EditXなど、多種多様なエンジンに対応し、日本語を含む複数の言語での音声生成が可能です。
無制限のテキスト長、SRTタイミング調整、文字サポートといった豊富なオーディオ機能に加え、字幕の生成・再構築・タイミング推定など、高度な字幕ワークフローもサポートします。
モジュール化されたアーキテクチャにより拡張性も高く、高品質な音声コンテンツ制作を目指すComfyUIユーザーや、複数のTTSエンジンを効率的に活用したいクリエイター、開発者に最適なソリューションです。
互換性・特徴
- ComfyUI対応
- 多言語対応
- 音声合成
- 音声変換
- 音声編集
- SRT対応
基本情報
| ライセンス | NOASSERTION |
| Stars | 1,092 |
| Forks | 127 |
| カテゴリ | 音声生成 / TTS |
| アクティビティ | high |
最新のissue
- [Bug] Error when trying to make a SRT transcription with Granite – no module named torch (更新: 2026-07-10)
- IndexTTS-2 Emotion Vector Export (更新: 2026-07-10)
- General Save Character Voice Node similar to Qwen TTS Voice Designer (更新: 2026-07-10)
- [Bug]: RuntimeError: MPS device strict-typing crash in infer_pack/models.py on Apple Silicon (更新: 2026-07-10)
- [Bug] Melbandroformer works on one workflow but not in another (更新: 2026-07-10)
最新リリース: v5.3.0 – OmniVoice + native SRT duration targeting, Visual Tag Builder, Granite ASR improvements (2026-06-24)
