AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
- 类型:arxiv
- 标识:2609.08936
- 链接:https://arxiv.org/abs/2609.08936
- 主分类:multimodal
- 形态:method
- TLDR:We introduce AuK, an open-source foundational model that unifies speech generation and editing through a common interface of natural-language instructions and audio context. To support this broad capability set, we construct approximately 3.03 billion instruction--audio instances and 1.95 million hours of effective supervision across five task families: speech generation, content editing, enhancement and separation, paralinguistic editing, and acoustic editing. AuK combines a multimodal large language model for semantic conditioning, an VAE jointly trained on speech, general audio, and music f
- 待LLM分类:否
- 来源文件:
- /inbox/tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json