第二页 · 背景
Sora 2 之后,同时生成画面与声音成为可见的产品能力。先前的基准测试已经会问:声音是否与画面同时发生、是否属于同一类事件。它们通常不问:更重的物体撞击是否更响,空腔变小音高是否改变。
所讨论的生成系统接受不同的输入,输出却都包含声音。第一种,只给文字,同时写出活动影像与声音,即。第二种,先给一张静止图像(通常仍附文字),再生成后续声画,即。第三种,画面已经拍好,只要求配上声音,即。Section IV-A 写明:本文不评测传统的无声文本到视频,也不评测音频到视频。三种条件的差别在于模型事先看见多少视觉事实。T2AV 必须自己发明画面与声音;I2AV 至少钉住第一帧;V2A 连整段动作都已给定。若物理锚定仍然失败,则失败不能只归因于“没看见该看的东西”。
Section I 把 T2AV 的受注意程度系于 的发布(OpenAI, 2025),并列举 filmmaking、advertising、world modeling 为应用。在此之前,SyncFlow、JavisDiT、UniVerse-1、Ovi 已经尝试同时生成声画。与只出视频、或只做 V2A 的方法相比,联合生成降低了“先出画面再另找声音”的门槛。作者随即写下另一句:existing methods still struggle to generate physically plausible audio,并常伴随声画不同步。
Section I citing Sora 2 [1];SyncFlow [2];JavisDiT [3];UniVerse-1 [4];Ovi [5]
Section II-A 把近期商业系统写成一次范式转移:从“先出视频再级联配音”转向大规模统一架构,在同一次生成里协调画面与声音。点名的系统是 Sora 2、Veo 3.1、Seedance 1.5 Pro、Kling v2.6、Wan 2.6。作者认为它们依赖大规模多模态预训练与紧耦合的结构,能够在开放场景里给出电影级视听。这是产品能力的陈述,不是物理锚定的陈述。
学术线关注的是如何把两种模态对齐。较早的扩散基线包括 Seeing and Hearing 与 CMC-PE;Kim 等人用 mixture-of-noise 处理视听信息密度不均。为了对齐时间,SyncFlow 与 AV-Link 引入流匹配与时间适配器;JavisDiT 与 AV-DiT 再加分层时空先验与模态适配器。UniVerse-1 把预训练的视频与音频潜表示“缝合”(stitching of experts);UniForm 则主张在共享多模态潜空间里用统一的扩散变换器。这些工作的共同目标,是语义相关与时间对齐。它们并不以“空腔体积改变时音高必须移动”为训练目标。
V2A 另成一条线,接近电影:为已有画面后配脚步、撞击、衣物声。FoleyCrafter 用语义适配器;HunyuanVideo-Foley 用自监督音频特征对齐潜扩散;MMAudio 用流匹配稳定联合训练;ThinkSound 把推理链条引入声音生成。Section II-A 的收束句是:these models still struggle to capture fine-grained physical causality between the visual interactions and their corresponding sounds。因果已经在画面里(木头被敲、瓶中有水),声音仍可能只是“这一类事件的典型声”,而不是这一次物理条件的声。
Section II-A · 商业 [1],[30]–[33] · 学术 [2]–[5],[16]–[21] · V2A [34]–[37]
既有了生成系统,就需要来比较它们。Section II-B 把评测史写成:从单模态质量,转向同时检查语义与时间对齐。TAVGBench 与 Verse-Bench 强调复杂提示下的同步与语义一致;JavisBench 强调开放式联合生成中的跨模态连贯;VABench 再把信号保真与指令遵从收成一套多维标准。任务更窄的评测也已出现:PEAVS 以人的意见建感知同步指标;SAVGBench 与 Real Acoustic Fields 看空间声与房间声学;FoleyBench 看 V2A 的类别多样性与因果;DualDub 看语音与背景轨的联合;LVAS-Bench 看长视频配音的一致性。
覆盖面已经不窄。所缺的是另一类题目。Section II-B 写:这些基准对 Doppler 效应、材料相关声学、声速等显式物理原则的覆盖有限,并且缺少受控变量设置。因而它们不足以诊断模型是否理解物理上成立的声画关系。Table I 把这一判断做成对照表:六列声学物理维、是否受控、是否新采集、每条提示有几条真值视频、用什么指标。
Table I · 与既有声画生成基准的对照。六列物理维按原文:声源机制、流体与空气动力学、声传播、观察者物理、时间与因果、复杂耦合。只抄论文写出的记号,不补未写的分数。
| 基准 | 声源 | 流体 | 传播 | 观察者 | 因果 | 耦合 | 受控 | 新采集 | 每提示真值 | 指标 |
|---|---|---|---|---|---|---|---|---|---|---|
| TAVGBench | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | 1 | AV-Align |
| SAVGBench | ✗ | ✗ | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ | — | AV&Spatial-Align |
| Verse-Bench | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ | 1 | AV-Align |
| JavisBench | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✓(部分) | 1 | AV-Align |
| VABench | ✓ | ✓ | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ | 0 | AV&Stereo Align |
| T2AV-Compass | ✓ | ✗ | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ | 1 | AV-Align |
| PhyAVBench | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | 2∼40 | AV-Align 与物理灵敏度 |
TAVGBench、Verse-Bench、JavisBench、T2AV-Compass 的指标栏都是 :声音与画面是否对齐、语义是否一类。SAVGBench 把空间对齐加进去,并且是表上唯一在“时间与因果”列打勾的先前工作;真值条数记为 “—”。VABench 在声源、流体、因果三列打勾,但每条提示的真值视频为 0,指标是立体声对齐。新采集一栏,只有 Verse-Bench 为是、JavisBench 为部分是;其余复用旧数据。没有任何先前行在“受控设置”列打勾,也没有任何先前行覆盖声传播、观察者物理或复杂耦合。
因而 2024–2025 年所谓“全面”的声画基准,其全面性是语义与时间上的。物理列大多为空。下一页才是空列如何被填上。此处先说明:空列不是疏忽,而是题目类型不同。对齐题可以在单一提示上完成——一条文字、一条生成、一条真值或无人参考。物理灵敏度题必须成对:没有对照,就无法知道模型是“会发这类声音”,还是“会随这一物理量改变声音”。
Table I · Section II-B · Section I
Section I 把先前基准与数据集的问题写成四条。四条之间是因果,不是并列的抱怨。
i) 声学覆盖窄。既有基准强调高层声画对齐(同步、语义一致),只覆盖狭窄的声学现象。材料相关音色、共振、由作用力引起的幅度变化、声传播、环境效应,大体未探。因此现有分数无法说明模型是否能在不同声学条件下推广,或是否抓住了支配发声的物理原则。Table I 是这一条的证据:六列里先前工作最多打三个勾。
ii) 复用现有数据集。许多基准把 AudioSet 一类并非为音频物理关系采集的视听语料重新切题。变量不受控、录音条件不一致,并且存在从训练语料的可能。更关键的是:这类数据缺少反事实或受控变化,因而无法把某一个物理因素隔离出来。没有隔离,就没有灵敏度测验。
iii) 缺少细粒度声学推理标注。既有数据通常只有事件类别或描述文字,不标注材料、作用力、空间配置、时间因果。于是无法判断模型是抓住了音频物理关系,还是只依赖表层相关——例如“看见锤子就输出敲击声”,而不问锤子打在什么上、多重、多快。
iv) 没有专门的音频锚定协议。现有协议依赖全局感知指标或人工判断。Figure 1 的对照是:它们不显式测试模型是否对受控物理变化作出正确反应,也不量化该反应的方向与幅度。没有这一协议,就难以诊断缺陷,也难以指导物理感知生成模型的训练。
四条叠在一起,才逼出后文的设计。覆盖必须从碰撞做到 ;数据必须新录,以免泄漏与变量混乱;每条视频必须写出“为何发声”的因果链;计分必须比较成对变化,而不是给单条声音打一个“像不像”的分。缺任何一条,灵敏度测验都会塌回对齐测验。
Section I · Figure 1 · Table I
对口型与同步解决的是时间:声事件与视事件是否重合。语义一致解决的是类别:敲击的画面配上敲击的声音,而不是配上流水。二者都可以在模型只记住“事件类别—典型声”的映射时得到高分。物理题要求的是同一类别内部的方向:木头与金属、空瓶与装水的瓶、快拍与慢拍。Section I 的例子是:在视觉条件相同的前提下,敲木头对敲金属;音色与共振的方向变化,应反映材料相关的声学性质。
Helmholtz 共振把这件事说得更硬。往瓶口吹气时,空腔中的空气以特定频率振荡。注入液体减小空腔,频率改变。若两条提示只差“empty”与“4/5 full of water”,其余词句相同,而模型仍给出几乎一样的嗡鸣,则它通过了“这是吹瓶”的语义关,没有通过空腔体积关。Figure 2 后来把这两条提示完整写出。背景只需记住:这类题目无法用单条 AV-Align 代替,因为单条分数不包含“相对于对照条件,声音朝哪边变”。
VABench 已经在声源与流体两列打勾,却把每条提示的真值视频写成 0,且没有受控设置。有物理话题、没有成对对照,仍然测不出灵敏度。T2AV-Compass 有声源与因果、每提示 1 条真值,同样没有受控列。因此缺口不是“完全没有人谈物理”,而是没有人把物理做成可隔离、可对比、带多条真值的考试。
Section I · Figure 1 · Table I · Figure 2 的提示原文留到做法页