第三页 · 做法
PhyAVBench 的数据部分名为 。Abstract 与 Section III-A 给出同一组规模:25.5 小时、11,605 条新录有声视频、184 名参与者、337 组经人工整理的提示。六维、四十一细项,从碰撞、混响到涡脱落与 。贡献 4 写明:每条提示平均有 17 条独立真值样本,以保证统计上可比较,并主张 zero data leakage。Table I 把每条提示的真值条数写成 2∼40。Abstract 的 “each grounded with an average of 17 videos” 未写明 each 指组还是指提示;按 11,605 ÷ (337 × 2) ≈ 17.22,与贡献 4 的“每条提示”相符。组均则约为 34 条。
每条视频标注完整的发声因果链:相互作用的物体、材料、动作动力学(力、速度)、环境,以及由此产生的音色、幅度、时间结构。每组成对提示另标受控变量、对应的声学变化,以及物理原因。材料、几何或作用力的改变,被连到共振、频谱或声强的预期效应。标注经人工核验。作者强调:写的不仅是发出了什么声音,而且是为何发出。
Abstract · Section III-A · 贡献 4 · Table I
Section III-B 与 Figure 2 把策展写成五步。人类与大语言模型交替:模型负责枚举与起草,人负责删不可行项、保证只改一个因素。附录 C 把起草模型写成 GPT-5.1,交叉核验用 GPT-5.1 与 Gemini-2.5-pro。
普查发声与传播的定律、机制、可被视听观察到的场景。语言模型辅助枚举,专家删去不可行、重复或无关项,合并近义概念。得到的知识库作为分类法的基础。
按机制分成六主维:声源力学、流体与空气动力学、声传播环境、观察者物理、时间与因果、复杂耦合。每维再拆成可控制的细项。人负责消歧、去重、保证可解释。Table IV 把第六维的表头写成 “Complex Phenomena”,与此处的 “Complex Coupling” 用词不一致,计数仍为六维。
为每个细项起草场景模板,并显式控制目标变量(力、速度、接触面积、材料刚度、流体流量等)。再改写以降低歧义、避免主观形容,并排除对预期声学结果的明示——提示不写“声音会更高”,只写瓶子是空的还是装了水。专家核验:每对只差一个物理因素,非目标条件保持不变。
不为每条提示去 AudioSet 里检索,而是按目标物理条件重新拍摄。能在受控环境中隔离该变量者,优先受控;多样性来自实例、表演者、设备在同一约束下的变化。每条提示配多条独立样本。作者把这一步写成避免的理由。
模型先筛歧义、意外混淆、控制变量被破坏。人再核物理一致性、文—声—画对齐、现实可成立性。不合格者删除、改写或重录,直到达到既定标准。
Section III-B · Figure 2 · Appendix C
是整座基准测试的发动机。Section I:一组中的两条 T2AV 提示只在单一受控变量上不同,该变量应引起相应的声音变化。Section III-B 阶段 3 把同一约束写进操作规程。因此,两段生成声音之间的差异,原则上只能归因于那一个因素。模型若对两条提示给出几乎相同的“这一类事件的典型声”,方向向量就会接近零,或指向与真值相反的一侧。
Figure 2 给出可核对的原文。两条提示共享同一机位(static medium shot)、同一动作(瓶口连续吹气约三秒,重复两次)、同一环境(安静室内)。唯一改动是瓶子的状态。
The bottle is empty.
A static medium shot shows a person holding a transparent plastic bottle. The bottle is empty. In a quiet indoor environment, the person brings the bottle to their mouth and blows continuously into the bottle opening for about 3 seconds, repeating this action twice.
The bottle is 4/5 full of water.
词句其余部分与 A 相同,仅把 empty 换成 4/5 full of water。空腔体积减小,Helmholtz 共振频率应改变。提示并不写出“音高会升高或降低”。
Section I 另举一对比:在相同视觉条件下敲木头与敲金属。Table IV 把四十一细项都写成这种“A 对 B”:扳手落在混凝土对地毯(t01)、实心球对空心球(t02)、快拍对慢拍(t08)、龙头滴水对倾倒(t14)、浴室对体育馆(t22)、距离加倍则声压级减半(t34)。每一对都在问同一件事:那一个因素变了,声音有没有朝物理上成立的方向走。
提示原文抄自 Figure 2。下列六格是 Table IV 的主维,不是论文雷达图的复绘。
硬度、密度、尺寸、撞击速度、松紧与张力。附录时长 63.284k 秒,六维中最长。
Helmholtz、水对蜂蜜、阵风对微风。16.009k 秒。
衍射、水下、闭门对开门。附录平均 CPRS 0.3302,六维中最难。
距离加倍、水平与垂直定位。时长最短,1.148k 秒;平均 CPRS 0.3558,相对最易。
拨弦对捂住振动弦;周期摆对乱敲键盘。
Table IV 表头作 Complex Phenomena。鞭响(微型音爆)、电磁致声。细项编号不连续,见余韵页。
不给单条声音打“好不好听”。Section IV-B:它使用成对或成组提示,只改变一个与音频有关的物理变量(尺寸、材料、气流等),预期的声音变化在物理上有定义。若生成声音的变化方向与幅度与真实、有物理根据的趋势一致,则模型被视为具有物理灵敏度。比较的是这两个因素与真值视频中的对应因素,从而把音频物理理解从高层保真或同步中隔离出来。
为此引入 。令 Φ(·) 为预训练 模型的音频编码器,把一段声音映成向量。对提示 Pa、Pb,先对 N 对真值音频取平均嵌入,再相减得到真值物理方向:
式 (1) 把真值对写成 (agt,i, agt,i),而 eb,gt 使用 bgt,i。按后文,前一对应为 (agt,i, bgt,i)。方向对齐用余弦,再平移到 [0,1]:
幅度用 vgen 在 vgt 上的投影,再除以 ∥vgt∥²,得到标量 p。p = 1 表示幅度完全一致。再套以中心在 1 的高斯核,k = 5:
c 问方向是否对,f(p) 问沿该方向走了多远是否与真值同阶。二者各占一半。嵌入空间中的“方向”是编码器认为的差异,不是牛顿力学的坐标轴;作者后来用 ImageBind 与 CAV-MAE-Sync 重算,以表明排序不极度依赖某一个 Φ。那是证据页与余韵页的内容。
Section IV-B 式 (1)–(7) · k=5 · 主表 Φ 为 CLAP [47]
Section IV-A:T2AV 与 I2AV 都根据文字联合生成声画;V2A 另评。I2AV 用真值视频的第一帧作输入图像。V2A 用去掉声音的真值视频。CPRS、FVD、KVD 以全部真值视频为参考。闭源系统因预算只评 T2AV,并从数据集中随机抽 100 对提示;开源系统评全部 337 组,并以最高质量视频为真值。因而 Table II 里商业行与开源行并不在同一抽样上。这一限制不改变“即使 Sora 2 也只有 0.4512”这一作者自己的表述,但禁止把 0.4512 与 0.2844 读成严格的同分布之差。
质量、语义、同步仍一并报告: 看像不像真的;CLIP 与 CLAP 看是否像那段文字; 看是否对齐。它们回答的是旧问题。APST 回答的是新问题。人工部分用 1–5 的 打文本一致、声画同步、物理变化响应(PVR-MOS),74 人。协议细节与数字在证据页。
Section IV-A · Section IV-B