SoundSpaces: Audio-Visual Navigation in 3D Environments
指出当时具身智能体“是聋的”,提出在 Replica / Matterport3D 上用几何声学渲染做 AudioGoal 视听导航,并把音频传感器接入 Habitat。端到端 RL 智能体可同时利用视觉与双耳音频定位发声目标。
2019–2025 必读。 21 篇。
指出当时具身智能体“是聋的”,提出在 Replica / Matterport3D 上用几何声学渲染做 AudioGoal 视听导航,并把音频传感器接入 Habitat。端到端 RL 智能体可同时利用视觉与双耳音频定位发声目标。
在 Visual-Audio-Room(AI2-THOR + 声学)中定义视听具身导航:仅用第一人称视觉与音频规划到声源的最短路径。模块包括视觉建图、声源相对定位与动态路径规划。
可连续空间采样、可配置麦克风/材料、可泛化到新场景的几何声学实时渲染平台。支持视听导航、定位分离、声学匹配与远场 ASR,并报告与真实测量及 sim2real 的对比。
智能体主动发射 chirp 并听回声,用视–回声朝向一致性作为交互式表征学习目标。学到的视觉特征可迁移到单目深度、法向估计与视觉导航,测试时不再需要音频。
针对 AudioGoal,提出端到端学习动态航点的分层策略,并用结构化声学记忆记录空间化听觉证据。在 Replica / Matterport3D 上显著超过固定步长 RNN 基线,对未听过声音与干扰更稳健。
把目标从“持续响的信标”改成语义物体的短时/间歇声(冲马桶、开门)。Transformer + 目标描述符(位置+类别)使声音停止后仍能找对物体实例,并扩展 SoundSpaces 的语义声库。
提出动态视听导航基准:追踪移动声源,并面对噪声与干扰。在空间特征空间融合局部地图与音频几何线索。曾在 CVPR SoundSpaces Challenge 获奖。
针对多声源噪声环境,发布大规模基准 BeDAViN(2258 段、约 10.8 小时音频,远超早期导航声库),并提出 ENMuS3:声事件描述符 + 多尺度场景记忆 Transformer,在嘈杂多源设定上显著提高成功率。
定义主动视听源分离:智能体在时限内移动相机/麦克风,从混合声中分离目标。奖励直接来自分离质量提升,最优位置往往不是走到声源正前方。近目标(AR)与远目标(移动机器人)两种设定。
短视频 + 多通道音频即可外推整屋平面图与房间语义。音频提供视场外几何、远处自由空间与房间类型线索。在 85 个真实扫描场景上,仅观察约 26% 面积即可达约 66% 全屋精度。
用视听对齐判别器定义好奇心:奖励新颖的视–听组合,避免纯预测误差被随机像素卡住。在 Atari 与 Habitat(SoundSpaces 声学)无外在奖励探索中,覆盖面积与稀有状态访问优于预测式好奇心。
在 semantic AudioGoal 上引入自然语言求助:高层策略决定跟音频走还是问 oracle,低层策略分别执行视听导航与语言指令。在未听过声音与干扰声上提升明显。
双向对话式视听导航:智能体可提问并理解自由文本回答。预算感知的半马尔可夫决策 + 轨迹预测 + 问句生成,并发布 AVN-Instruct。在噪声/新声源上相对单向交互有大幅提升。
把 AudioCLIP / 视觉–语言特征融合进统一 3D 体素地图,可用文本、图像或音频片段索引目标(如“去你听到咳嗽声的那张桌子”)。仿真中歧义场景召回提升约 50%,并在真机零样本导航验证。
用 LLM 做零样本 semantic AV 导航:多模态感知 + 反思式规划 + 想象房间布局的辅助 LLM。无需环境内演示即可超过 RL 基线;oracle 感知时成功率可超 60%。
Tilt-Bot 平台收集 60 物体、约 1.5 万次碰撞的四通道声–动作–视觉数据。证明声音可区分细粒度物体、反推动作,且交互音频嵌入预测未见物体动力学优于被动视觉嵌入。
夹爪麦克风 + 第三人称视觉 + LSTM 记忆,用离线模仿 + 在线人工干预学习遮挡操作(从袋子里掏钥匙)。真机成功率约 70%,比无音频策略高约 50 个百分点。
把接触麦克风当触觉替代,用 AudioSet 上大规模视听预训练(AVID)初始化操作表征。在少数据接触丰富任务上优于视觉-only 与从零训练的多模态编码器。
提出 ear-in-hand 采集装置,从野外人手演示同步采集接触声与视频,用视听表征条件化 diffusion policy。覆盖倒水、擦拭、翻面等接触任务,并可泛化到未见环境。
在 OpenVLA 式架构中加入 AudioCLIP 接触声通道与多模态投影,Llama2 做骨干。为 LIBERO / RLBench 增加碰撞触发生成音频,并提出衡量过程感知的 TCR 指标。仿真与擦白板/舀燕麦真机上优于视觉-only VLA。
按推理域梳理 PointNav / ObjectNav / ImageNav / AudioGoalNav,专章覆盖 SoundSpaces、SAVi、AV-WaN、AVLEN、CATCH、CAVEN、AVLMaps、RILA 等,并给出指标与数据集对照。