arXiv:2512.23994v4 · cs.SD · 18 May 2026 · 五页阅读

PhyAVBench

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu* · HKUST(GZ) / Tencent · † Core contributors · * Corresponding author · arXiv · HTML · 本地 PDF · 代码与样本

这是一篇关于考试的论文。所考的不是生成的嘴型是否对上、声音是否好听,而是:当物理条件改变时,生成的声音是否随之服从物理。

所考的系统,根据文字同时写出活动影像与配套声音。这一任务称为。相邻的两种条件是:给定一张静止图像再生成声画,称为;给定已有无声影像再配上声音,称为。一套事先固定的题目、参考录音与计分规则,用来比较不同系统,称为。本文提出的基准测试名为 PhyAVBench。

Abstract 把先前工作的缺陷写得很直接:“Previous benchmarks in this area primarily focus on audio-video temporal synchronization, while largely overlooking explicit evaluation of audio-physics grounding.” 时间对齐问的是:撞击画面出现的那一瞬,撞击声是否同时响起。问的是另一件事:更硬的地面是否更脆、更重的物体是否更响、空瓶与装了水的瓶在吹气时音高是否不同。前者可以在“给一段像敲击的声音”的情况下通过;后者要求声音随受控物理因素改变。

因此本文的核心设计不是再录一批“各种声音事件”,而是构造:两条文字几乎相同,只改一个物理量。模型必须对这一改动给出方向正确、幅度也说得通的声音变化。这一测验称为;用来给变化打分的自动指标称为。作者评了 Table II 上的十七行系统,并做了七十四人的听音研究。即使商业上最引人注目的 ,主表 CPRS 也只有 0.4512(Section I;Table II)。分数的可比条件与正文中的一处错位,见证据页。

以下五页按因果顺序展开:先前基准为何测不到物理,成对提示与 CPRS 如何把物理因素隔离出来,十七行数字与人工相关说明了什么,以及作者自己写下的未覆盖之处。做法与比分各有专页;本页只把这条链摊开。

  1. 本页 · 故事

    先说结局:这是一场物理灵敏度考试,不是对口型考试。下面四页是题目从何而来、如何出题、分数如何读。

  2. 背景

    T2AV / I2AV / V2A 作为任务、Sora 2 之后的商业与学术模型、Foley 拟音线,以及 TAVGBench 到 T2AV-Compass 为何只覆盖同步与语义。四个缺口:声学覆盖窄、复用旧数据、缺少因果标注、没有受控变量协议。

  3. 做法

    PhyAV-Sound-11K 的规模与采集、五阶段策展、337 组成对提示为何只改一个因素、六维四十一细项、APST 与 CPRS 的公式,以及闭源评 100 对、开源评 337 组。

  4. 证据

    Table II 十七行、人工 74 人与 Table III 的 0.92,以及 Seedance 的 TV-IB 表述与表中数字不符。

  5. 余韵

    极端与危险事件未收入、泄漏规避是采集主张、换编码器后第一名会移动,然后把因果再述一遍。