2022 · TASLP / arXiv 2022 · Zalán Borsos, Raphaël Marinier, Damien Vincent, Eugene Kharitonov, Olivier Pietquin, Matt Sharifi, Dominik Roblek, Olivier Teboul, David Grangier, Marco Tagliasacchi, Neil Zeghidour
语义 token(w2v-BERT)+ 声学 token(SoundStream)的音频 LM 模板,MusicLM / VALL-E / Moshi 都沿这条。
2022 · TMLR 2023 / arXiv 2022 · Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi
流式 RVQ 神经音频编码,MusicGen 类模型和后续 codec 的 tokenizer 底座。
2022 · ICML 2023 / arXiv 2022 · Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, Ilya Sutskever
弱监督大规模多语 ASR,至今仍是默认语音前端,也被 Zero-AV 当伪标签和对照。
2023 · NeurIPS 2023 · Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, Kundan Kumar
改进 RVQGAN 的通用 44.1 kHz codec,常当 EnCodec 的即插即用替代。DualCodec 直接用它的架构。
2023 · arXiv 2023 · Andrea Agostinelli, Timo I. Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, Christian Frank
AudioLM 加上 MuLan 文本-音乐对齐,带旋律条件,发布 MusicCaps。
2025 · arXiv 2025 · Sreyan Ghosh, Zhifeng Kong, Sonal Kumar, S Sakshi, Jaehyeon Kim, Wei Ping, Rafael Valle, Dinesh Manocha, Bryan Catanzaro
理解线,不是 codec:3B 音频语言模型,长音频推理到约 5 分钟。
2025 · arXiv 2025 · Jiaqi Li, Xiaolong Lin, Zhekai Li, Shixi Huang, Yuancheng Wang, Chaoren Wang, Zhenpeng Zhan, Zhizheng Wu
双流编码:SSL 进第一层 token,波形残差进其余层。对标 EnCodec / DAC / Mimi。
2025 · arXiv 2025 · Challenge organizers
把边端算力、时延、码率、噪声混响一起卡死,定义 2026 部署问题。
2025 · arXiv 2025 · A. Biswas et al.
把神经音频编码从「给生成模型当 tokenizer」拉回实时通信。
2026 · arXiv 2026 · arXiv 2604.17852 authors
不改 codec 结构,改训练目标,让离散音素更好被自回归 LLM 预测。