arXiv:2512.23994v4 · cs.SD · 18 May 2026 · 五页阅读
这是一篇关于考试的论文。所考的不是生成的嘴型是否对上、声音是否好听,而是:当物理条件改变时,生成的声音是否随之服从物理。
所考的系统,根据文字同时写出活动影像与配套声音。这一任务称为。相邻的两种条件是:给定一张静止图像再生成声画,称为;给定已有无声影像再配上声音,称为。一套事先固定的题目、参考录音与计分规则,用来比较不同系统,称为。本文提出的基准测试名为 PhyAVBench。
Abstract 把先前工作的缺陷写得很直接:“Previous benchmarks in this area primarily focus on audio-video temporal synchronization, while largely overlooking explicit evaluation of audio-physics grounding.” 时间对齐问的是:撞击画面出现的那一瞬,撞击声是否同时响起。问的是另一件事:更硬的地面是否更脆、更重的物体是否更响、空瓶与装了水的瓶在吹气时音高是否不同。前者可以在“给一段像敲击的声音”的情况下通过;后者要求声音随受控物理因素改变。
因此本文的核心设计不是再录一批“各种声音事件”,而是构造:两条文字几乎相同,只改一个物理量。模型必须对这一改动给出方向正确、幅度也说得通的声音变化。这一测验称为;用来给变化打分的自动指标称为。作者评了 Table II 上的十七行系统,并做了七十四人的听音研究。即使商业上最引人注目的 ,主表 CPRS 也只有 0.4512(Section I;Table II)。分数的可比条件与正文中的一处错位,见证据页。
以下五页按因果顺序展开:先前基准为何测不到物理,成对提示与 CPRS 如何把物理因素隔离出来,十七行数字与人工相关说明了什么,以及作者自己写下的未覆盖之处。做法与比分各有专页;本页只把这条链摊开。
先说结局:这是一场物理灵敏度考试,不是对口型考试。下面四页是题目从何而来、如何出题、分数如何读。
T2AV / I2AV / V2A 作为任务、Sora 2 之后的商业与学术模型、Foley 拟音线,以及 TAVGBench 到 T2AV-Compass 为何只覆盖同步与语义。四个缺口:声学覆盖窄、复用旧数据、缺少因果标注、没有受控变量协议。
PhyAV-Sound-11K 的规模与采集、五阶段策展、337 组成对提示为何只改一个因素、六维四十一细项、APST 与 CPRS 的公式,以及闭源评 100 对、开源评 337 组。
Table II 十七行、人工 74 人与 Table III 的 0.92,以及 Seedance 的 TV-IB 表述与表中数字不符。
极端与危险事件未收入、泄漏规避是采集主张、换编码器后第一名会移动,然后把因果再述一遍。