概要
SoulX-Transcriberは、複数の話者が登場する対話シナリオにおいて、話者特定(ダイアライゼーション)、タイムスタンプ付きのセグメンテーション、そして文字起こしを単一のフレームワークで実現するエンドツーエンドのラージオーディオ言語モデルです。
従来の段階的なパイプラインとは異なり、オーバーラップする会話や早口な対話でも、話者と一貫性のある正確なトランスクリプトを直接生成できる点が特徴です。
最先端のパフォーマンスを発揮し、話者認識のためのマルチステージトレーニングや、自然な対話生成のためのオーディオマッチングパイプラインを備えています。
会議の議事録作成、ポッドキャスト分析、顧客対応の自動化など、複雑なマルチスピーカー音声からの高精度な情報抽出を求める研究者や開発者、企業などが想定ユーザーです。
互換性・特徴
- Python
- 音声認識
- マルチスピーカー対応
- ダイアライゼーション
- HuggingFace対応
- AI/LLM
基本情報
| ライセンス | Apache-2.0 |
| Stars | 286 |
| Forks | 15 |
| カテゴリ | ASR / 音声認識 |
| アクティビティ | mid |
最新のissue
- 这个需要多大显存才能运行起来啊?40G的4080好像运行不起来,一直OOV (更新: 2026-07-31)
- 解码结果和论文中报告的结果差异比较大 (更新: 2026-07-28)
- Feature: Compare/integrate FunASR for multi-speaker transcription (更新: 2026-07-14)
- 数据仿真询问 (更新: 2026-06-30)
- 处理超过十分钟的音频,时间戳重置 (更新: 2026-06-29)
