概要
このリポジトリは、オーディオAI研究のための包括的な情報ハブです。
オーディオLLM、音声認識、音声合成、音楽・オーディオ生成といった多様な分野における、厳選された論文、オープンモデル、ベンチマーク、データセットを提供しています。
特徴として、112の項目と11のカテゴリを網羅し、GitHubスター数に基づく注目のプロジェクトや最新の追加項目が定期的に更新されます。
研究者や開発者が効率的に情報を探索できるよう、検索、カテゴリフィルタリング、スター数や日付でのソート機能を備えたインタラクティブなWebハブが用意されています。
オーディオAIの最先端動向を追う研究者、開発者、および関心のあるすべての人々を対象としています。
互換性・特徴
- Web UI
- Python
基本情報
| Stars | 948 |
| Forks | 48 |
| カテゴリ | 音楽生成 |
| アクティビティ | mid |
最新のissue
- [Auto-suggested] Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering (更新: 2026-07-27)
- [Auto-suggested] DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages (更新: 2026-07-27)
- [Auto-suggested] From Read Speech to Spoken Digits: A Task-Specific Evaluation of Speech Privacy With Informed Attackers (更新: 2026-07-27)
- [Auto-suggested] Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness (更新: 2026-07-27)
- [Auto-suggested] SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision (更新: 2026-07-27)
