音频与语音

十篇。ASR、音频 LM、codec。

AudioLM · AudioLM: a Language Modeling Approach to Audio Generation

2022 · TASLP / arXiv 2022 · Zalán Borsos, Raphaël Marinier, Damien Vincent, Eugene Kharitonov, Olivier Pietquin, Matt Sharifi, Dominik Roblek, Olivier Teboul, David Grangier, Marco Tagliasacchi, Neil Zeghidour

语义 token(w2v-BERT)+ 声学 token(SoundStream)的音频 LM 模板,MusicLM / VALL-E / Moshi 都沿这条。

MusicLM · MusicLM: Generating Music From Text

2023 · arXiv 2023 · Andrea Agostinelli, Timo I. Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, Christian Frank

AudioLM 加上 MuLan 文本-音乐对齐,带旋律条件,发布 MusicCaps。