核心清单

2019–2025 必读。 21 篇。

SoundSpaces: Audio-Visual Navigation in 3D Environments

2020 / ECCV · Changan Chen, Unnat Jain, Carl Schissler, Sebastia Vicenc Amengual Gari, Ziad Al-Halah, Vamsi Krishna Ithapu, Philip Robinson, Kristen Grauman

指出当时具身智能体“是聋的”,提出在 Replica / Matterport3D 上用几何声学渲染做 AudioGoal 视听导航,并把音频传感器接入 Habitat。端到端 RL 智能体可同时利用视觉与双耳音频定位发声目标。

SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning

2022 / NeurIPS Datasets and Benchmarks · Changan Chen, Carl Schissler, Sanchit Garg, Philip Kobernik, Alexander Clegg, Paul Calamia, Dhruv Batra, Philip W. Robinson, Kristen Grauman

可连续空间采样、可配置麦克风/材料、可泛化到新场景的几何声学实时渲染平台。支持视听导航、定位分离、声学匹配与远场 ASR,并报告与真实测量及 sim2real 的对比。

Learning to Set Waypoints for Audio-Visual Navigation(AV-WaN)

2021 / ICLR · Changan Chen, Sagnik Majumder, Ziad Al-Halah, Ruohan Gao, Santhosh K. Ramakrishnan, Kristen Grauman

针对 AudioGoal,提出端到端学习动态航点的分层策略,并用结构化声学记忆记录空间化听觉证据。在 Replica / Matterport3D 上显著超过固定步长 RNN 基线,对未听过声音与干扰更稳健。

Semantic Audio-Visual Navigation(SAVi)

2021 / CVPR · Changan Chen, Ziad Al-Halah, Kristen Grauman

把目标从“持续响的信标”改成语义物体的短时/间歇声(冲马桶、开门)。Transformer + 目标描述符(位置+类别)使声音停止后仍能找对物体实例,并扩展 SoundSpaces 的语义声库。

Move2Hear: Active Audio-Visual Source Separation

2021 / ICCV · Sagnik Majumder, Ziad Al-Halah, Kristen Grauman

定义主动视听源分离:智能体在时限内移动相机/麦克风,从混合声中分离目标。奖励直接来自分离质量提升,最优位置往往不是走到声源正前方。近目标(AR)与远目标(移动机器人)两种设定。

Audio-Visual Floorplan Reconstruction(AV-Map)

2021 / ICCV · Senthil Purushwalkam, Sebastià Vicenc Amengual Garí, Vamsi Krishna Ithapu, Carl Schissler, Philip Robinson, Abhinav Gupta, Kristen Grauman

短视频 + 多通道音频即可外推整屋平面图与房间语义。音频提供视场外几何、远处自由空间与房间类型线索。在 85 个真实扫描场景上,仅观察约 26% 面积即可达约 66% 全屋精度。

See, Hear, Explore: Curiosity via Audio-Visual Association

2020 / NeurIPS · Victoria Dean, Shubham Tulsiani, Abhinav Gupta

用视听对齐判别器定义好奇心:奖励新颖的视–听组合,避免纯预测误差被随机像素卡住。在 Atari 与 Habitat(SoundSpaces 声学)无外在奖励探索中,覆盖面积与稀有状态访问优于预测式好奇心。

Audio Visual Language Maps for Robot Navigation(AVLMaps)

2023 / ISER · Chenguang Huang, Oier Mees, Andy Zeng, Wolfram Burgard

把 AudioCLIP / 视觉–语言特征融合进统一 3D 体素地图,可用文本、图像或音频片段索引目标(如“去你听到咳嗽声的那张桌子”)。仿真中歧义场景召回提升约 50%,并在真机零样本导航验证。

Swoosh! Rattle! Thump! — Actions that Sound

2020 / RSS · Dhiraj Gandhi, Abhinav Gupta, Lerrel Pinto

Tilt-Bot 平台收集 60 物体、约 1.5 万次碰撞的四通道声–动作–视觉数据。证明声音可区分细粒度物体、反推动作,且交互音频嵌入预测未见物体动力学优于被动视觉嵌入。

ManiWAV: Learning Robot Manipulation from In-the-Wild Audio-Visual Data

2024 / CoRL(PMLR 正式页标注 year=2025) · Zeyi Liu, Cheng Chi, Eric Cousineau, Naveen Kuppuswamy, Benjamin Burchfiel, Shuran Song

提出 ear-in-hand 采集装置,从野外人手演示同步采集接触声与视频,用视听表征条件化 diffusion policy。覆盖倒水、擦拭、翻面等接触任务,并可泛化到未见环境。

Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation

2025 / arXiv preprint(截至整理时未见正式会议录用页) · Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang

在 OpenVLA 式架构中加入 AudioCLIP 接触声通道与多模态投影,Llama2 做骨干。为 LIBERO / RLBench 增加碰撞触发生成音频,并提出衡量过程感知的 TCR 指标。仿真与擦白板/舀燕麦真机上优于视觉-only VLA。