概要
FunAudioLLMが開発するCosyVoiceは、大規模言語モデル(LLM)を基盤とした多言語対応の音声生成モデルです。
最新版のFun-CosyVoice 3.0は、9言語(日本語を含む)と多数の中国方言でのゼロショット音声合成を可能にし、コンテンツの一貫性、話者類似性、イントネーションの自然さにおいて高い性能を誇ります。
発音の細かな調整や、数字・記号の直接読み上げ、低遅延でのリアルタイムストリーミングも特徴です。
研究者、開発者、コンテンツクリエイターが、高品質な多言語音声コンテンツを効率的に生成・利用することを想定しています。
互換性・特徴
- 日本語対応
- Python
- LLMベース
- API
- 音声合成
- ゼロショット音声クローン
基本情報
| ライセンス | Apache-2.0 |
| Stars | 22,158 |
| Forks | 2,564 |
| カテゴリ | 音声生成 / TTS |
| アクティビティ | mid |
最新のissue
- Модели голоса .pt в диалоге (更新: 2026-07-14)
- 首先cv2效果很好,但是速度有点慢,vllm 不支持windows,windows有什么办法可以提速吗? (更新: 2026-07-14)
- vllm启动测试cosyvoice3,并发测试性能耗时过长 (更新: 2026-07-13)
- 用这个直接跑cosy3 python3.12 下的依赖变更 (更新: 2026-07-12)
- cosyvoice2 vllm 加载报错 (更新: 2026-07-11)
