概要
MOSS-TTS Familyは、MOSI.AIとOpenMOSSチームが開発したオープンソースの音声およびサウンド生成モデル群です。
高忠実度と高表現力を特長とし、安定した長尺スピーチ、複数話者ダイアログ、音声/キャラクターデザイン、環境音エフェクト、リアルタイムストリーミングTTSといった複雑な現実世界シナリオに対応します。
最新のMOSS-SoundEffect-v2.0では48kHzのバイリンガルサウンドエフェクト生成が可能になり、MOSS-TTS-v1.5では多言語合成と音声クローン機能が強化されています。
また、軽量なMOSS-TTS-Nanoモデルは4CPUコアでストリーミング出力に対応。
API、Web UI、Hugging Faceモデルとして提供されており、高品質な音声・サウンドコンテンツを必要とする開発者、クリエイター、研究者など幅広いユーザーを想定しています。
互換性・特徴
- Python
- オープンソース
- API
- Web UI
- 多言語対応
- 音声生成
基本情報
| ライセンス | Apache-2.0 |
| Stars | 3,909 |
| Forks | 349 |
| カテゴリ | 音声生成 / TTS |
| アクティビティ | high |
最新のissue
- API Service Without Guardrails? (更新: 2026-07-20)
- A feature request for future versions (更新: 2026-07-17)
- 在原生 Ubuntu 环境下进行 1.7B 模型全量微调时发生 OOM,但在 WSL2 下却能正常运行 (更新: 2026-07-09)
- [OOM Error] sft.py crashes at optimizer.step() with 48MB allocation failure on 16GB GPU (RTX 5060 Ti) due to AdamW states (更新: 2026-07-09)
