{
  "paper": "PhyAVBench",
  "arxiv": "2512.23994v4",
  "note": "Glosses for a reader without an AI background. Paper-specific claims cite section/table. No invented MOS or CPRS numbers.",
  "terms": {
    "t2av": {
      "term": "T2AV / 文本到声画生成",
      "background": "Text-to-Audio-Video：根据一段文字描述，同时生成活动影像与配套声音。与只出画面、声音另配的流水线不同，T2AV 把视听当作一次联合生成。",
      "paper_use": "本文的主任务。Abstract 与 Section I 把 T2AV 写成 filmmaking、advertising、world modeling 的中心能力；评测覆盖商业统一模型（Sora 2、Veo 3.1 等）与开源联合生成模型。本文不评测传统无声文本到视频或音频到视频。",
      "source": "Abstract；Section I；Section IV-A"
    },
    "i2av": {
      "term": "I2AV / 图像到声画生成",
      "background": "Image-to-Audio-Video：给定一张静止图像（通常再配文字），生成后续活动影像与声音。输入比纯文字多了一帧视觉锚点。",
      "paper_use": "Section IV-A：以真值视频的第一帧作为输入图像。Table II 评了 MOVA、LTX、Ovi、UniVerse-1。有图像条件后 FVD/KVD 显著下降（画面更接近真值），但 CPRS 并未因此自动升高。",
      "source": "Abstract；Section IV-A；Table II"
    },
    "v2a": {
      "term": "V2A / 视频到音频",
      "background": "Video-to-Audio：给定已有影像（通常去掉原声），为其生成配套声音。电影配音、Foley 拟音即属此类。模型看不见“该发出什么音高”的文字物理条件，只看见画面。",
      "paper_use": "Section IV-A：输入为去掉声音的真值视频。Table II 评了 MMAudio、HunyuanVideo-Foley、ThinkSound、FoleyCrafter。画面已给定，物理线索本应更强，但领先的 MMAudio CPRS 也只到 0.4003。",
      "source": "Abstract；Section II-A；Section IV-A；Table II"
    },
    "benchmark": {
      "term": "基准测试 / benchmark",
      "background": "一套事先固定的题目、参考答案与计分规则，用来比较不同系统。题目不变，分数才可横比。本文的基准测试不是“好不好听”，而是“声音是否随物理条件正确变化”。",
      "paper_use": "PhyAVBench 自称 first benchmark for audio-physics grounding。Table I 对照先前 TAVGBench、SAVGBench、Verse-Bench、JavisBench、VABench、T2AV-Compass：那些题多半测同步与语义，每条提示通常只有 0 或 1 条真值视频，且缺少受控变量。",
      "source": "Abstract；Table I；Section I；Section II-B"
    },
    "apst": {
      "term": "APST / 音频物理灵敏度测验",
      "background": "Audio-Physics Sensitivity Test。成对给出两条提示，二者只改一个与发声有关的物理量（材料、空腔体积、作用力等），其余场景保持不变。看模型生成的两段声音，其变化方向与幅度是否与真实录音一致。",
      "paper_use": "Section I 与 Section IV-B：paired or grouped prompts that vary only one audio-related physical variable。用意是把物理因果从语义先验里隔离出来——模型不能只靠“这是敲击就给一段敲击声”过关。",
      "source": "Abstract；Section I；Section IV-B"
    },
    "cprs": {
      "term": "CPRS / 对比物理响应分数",
      "background": "Contrastive Physical Response Score，取值 [0,1]，越高越好。在预训练音频编码器的特征空间里，比较“生成声音的变化向量”与“真值录音的变化向量”：一半看方向（余弦，再映到 [0,1]），一半看沿真值方向的幅度是否接近 1（高斯核，k=5）。",
      "paper_use": "主指标。Table II 的 Physical 列。Sora 2 为 0.4512，开源 T2AV 的 JavisDiT++ 为 0.2844，V2A 领先的 MMAudio 为 0.4003。Table III：与人工 PVR-MOS 的 Pearson 相关为 0.92，高于 AVH 0.72、Javis 0.71。主表用 CLAP 编码器；附录换 ImageBind / CAV-MAE-Sync 后排序大体稳定，绝对分数会变。",
      "source": "Section IV-B 式 (1)–(7)；Table II；Table III；Appendix B-A"
    },
    "pairing": {
      "term": "成对提示 / paired prompts",
      "background": "两条文字描述构成一组：场景、机位、动作尽量相同，只改一个受控物理因素。因此两段声音之间的差异，原则上应归因于那一个因素，而不是场景换了或措辞换了。",
      "paper_use": "337 组成对提示。Section III-B 阶段 3：each paired prompt differs only in a single physical factor。正文例子：敲木头对敲金属；空瓶对装了 4/5 水的瓶（Helmholtz）。提示刻意不写“声音会变高/变响”，以免模型抄答案。",
      "source": "Abstract；Section I；Section III-B；Figure 2"
    },
    "phyav-sound": {
      "term": "PhyAV-Sound-11K",
      "background": "本文新录的有声视频数据集，专为物理对照而采，不复用 AudioSet 一类现成语料。",
      "paper_use": "25.5 小时、11,605 条、184 名参与者、337 组提示。贡献 4：每条提示平均 17 条独立真值样本。Table I：每条提示 2～40 条真值。附录 Figure 7：时长长尾，m01 声源力学 63.284k 秒，m04 观察者物理仅 1.148k 秒。",
      "source": "Abstract；Section III-A；贡献 4；Table I；Appendix A-B"
    },
    "helmholtz": {
      "term": "Helmholtz 共振",
      "background": "空腔经窄口与外界连通时，腔内空气可像弹簧一样振荡，发出相对稳定的音高。往空瓶口吹气即属此类。注入液体会减小空腔体积，共振频率随之改变。",
      "paper_use": "6 维中流体与空气动力学下的细项 t16（Table IV）：Blowing empty vs. full bottle。Figure 2 的提示对把瓶子写成 empty 对 4/5 full of water，其余词句相同。Figure 3：HunyuanVideo-Foley 在该场景上 CPRS 0.799，被当作“方向对了”的定性例子。",
      "source": "Abstract；Section III-A；Table IV t16；Figure 2；Figure 3"
    },
    "clap": {
      "term": "CLAP",
      "background": "Contrastive Language-Audio Pretraining（Wu et al., 2023）：在大量“文字—声音”对上训练，使二者落到同一向量空间。常被用来给“这段声音像不像这段文字”打分。",
      "paper_use": "两用。其一，CPRS 的 Φ(·) 取预训练 CLAP 音频编码器（式 1）。其二，Table II 的 CLAP 列是文本—音频语义分，全表都很低，部分为负；Section IV-C 承认 CLAP 文本编码器未必能分辨本基准的细粒度对。附录 Table VIII：LAION-CLAP 与 PVR-MOS 相关 0.9230。",
      "source": "Section IV-B citing [47]；Table II；Section IV-C；Table VIII"
    },
    "embedding": {
      "term": "嵌入 / 特征向量",
      "background": "把一段声音（或一句文字、一帧图像）压成一组固定长度的实数，使“像不像”“朝哪变”可以做加减与夹角。嵌入空间里的方向，并不等于物理课本上的牛顿方向，只是编码器认为的差异方向。",
      "paper_use": "CPRS 在嵌入空间里定义 v_gt = e_b,gt − e_a,gt，再与 v_gen 比方向与投影。附录用 LAION-CLAP、ImageBind、CAV-MAE-Sync 三种嵌入重算，排序大体一致，Sora 2 的 CPRS 从 0.4512 降到 0.3479（CAV-MAE-Sync），此时 Wan 2.6 反而更高。",
      "source": "Section IV-B；Appendix B-A；Tables V–VII"
    },
    "fvd": {
      "term": "FVD / KVD / FAD",
      "background": "三类分布距离：FVD、KVD 看生成视频与真值视频在特征空间里有多接近（越低越好）；FAD 对音频做同类事（越低越好）。它们衡量“像不像真的”，不衡量“物理变化对不对”。",
      "paper_use": "Table II 的 AV Quality。开源 T2AV 中 JavisDiT++ FVD 最低（474.62）；商业模型里 Sora 2 的 KVD 最低（72.04）。Wan 2.6 与 Kling v2.6 的 FAD 并列最好（1.48）。I2AV 的 Ovi：FVD 122.79、KVD 7.46。质量好不等于 CPRS 高。",
      "source": "Section IV-B；Table II；Section IV-C"
    },
    "desync": {
      "term": "DeSync / AV 同步指标",
      "background": "DeSync 估计声画时间错位（越低越好）。AV-IB 是声画在 ImageBind 空间的整体相似。AVH（Audio-Visual Hits）看声学事件是否锚在正确时刻。JavisScore 看时空同步。",
      "paper_use": "沿 JavisDiT 的评测配方（Section IV-B）。商业 T2AV 中 Seedance 1.5 Pro 的 DeSync 最低（0.0095），且 AV-IB 0.2794、Javis 0.2412 最高；Kling v2.6 的 AVH 最高（0.2756）。同步好仍可 CPRS 不高：Seedance CPRS 0.4044，低于 Sora 2 的 0.4512。",
      "source": "Section IV-B；Table II；Section IV-C"
    },
    "avalign": {
      "term": "AV-Align / 声画对齐",
      "background": "先前基准的主指标家族：声音事件与画面事件是否同时出现、语义是否同一类。它不要求“更重的物体撞击更响”或“空腔变小音高改变”。",
      "paper_use": "Table I：TAVGBench、Verse-Bench、JavisBench、T2AV-Compass 的 Evaluation Metric 均为 AV-Align；SAVGBench 为 AV&Spatial-Align；VABench 为 AV&Stereo Align。PhyAVBench 写成 AV-Align & Physics Sensitivity。",
      "source": "Table I；Section I；Section II-B"
    },
    "foley": {
      "term": "Foley / 拟音",
      "background": "为已拍好的画面后配动作音：脚步、撞击、衣物摩擦等。V2A 模型多从此任务出发。语义对、节奏对，仍可能用“一类声音”应付，而不随材料或力度改变。",
      "paper_use": "Section II-A：FoleyCrafter、HunyuanVideo-Foley、MMAudio、ThinkSound。作者写这些模型 still struggle to capture fine-grained physical causality。Table II：MMAudio CPRS 0.4003 为 V2A 最高。",
      "source": "Section II-A；Table II"
    },
    "leakage": {
      "term": "数据泄漏 / data leakage",
      "background": "若评测视频早已出现在某模型的训练语料里，模型可能在“背题”，分数不再代表对新物理条件的推理。复用 AudioSet 等公开集时，这一风险尤其大。",
      "paper_use": "Section I 的缺口 ii 与 Section III-B 阶段 4：全部新录，explicitly designed to prevent data leakage；贡献 4 写 zero data leakage。这是采集策略上的主张，论文未给出与各商业模型训练语料的交集审计。",
      "source": "Abstract；Section I；Section III-B；贡献 4"
    },
    "sora2": {
      "term": "Sora 2",
      "background": "OpenAI 于 2025 年发布的商业统一声画生成模型。Section I 把它写成 T2AV 受到广泛注意的里程碑。",
      "paper_use": "Table II T2AV 商业组 CPRS 最高：0.4512。KVD 72.04 为商业组最低。作者仍说 only 0.4512，作为“领先商业模型也过不了物理关”的例证。闭源只在随机 100 对提示上评 T2AV（预算限制），与开源全 337 组不可严格横比。",
      "source": "Section I citing [1]；Table II；Section IV-A；Section IV-C"
    },
    "mos": {
      "term": "MOS / 平均意见分",
      "background": "Mean Opinion Score：多人按量表打分再取平均。本文用 1–5 的 Likert 量表，分数越高越好。",
      "paper_use": "三种：TC-MOS（声画是否符合文字）、AV-Sync-MOS（声画是否对齐）、PVR-MOS（成对视频的声音差异是否对应提示里的物理变化）。74 名参与者。附录 B-B：20 组提示 × 10 个 T2AV 系统（含真值）× 3 问 = 600 题；质控后保留 419 条有效作答。正文未给出各模型 MOS 的阿拉伯数字，只在 Figure 5 与文字中给出名次：Wan 2.6 三项皆首，随后 Sora 2 与 Kling v2.6。",
      "source": "Section IV-B；Section IV-C4；Appendix B-B；Figure 5"
    },
    "pearson": {
      "term": "Pearson 相关",
      "background": "两个变量之间线性相关的程度，介于 −1 与 1。此处用来问：自动指标的高低，是否与人打的 PVR-MOS 同向涨落。",
      "paper_use": "Table III：CPRS 0.92，CLAP 0.84，AV-IB 0.76，AVH 0.72，Javis 0.71，DeSync 0.62，TA-IB 0.58，FAD 0.51。附录 Table VIII 换嵌入后仍高于 0.89。主表 0.92 与 LAION-CLAP 的 0.9230 相符（四舍五入）。",
      "source": "Table III；Appendix B-A；Table VIII"
    },
    "diffusion": {
      "term": "扩散模型 / diffusion",
      "background": "一类生成模型：从噪声出发，逐步去噪，得到图像、声音或视频。2020 年代的声画系统大多建立在扩散或自回归骨架上。",
      "paper_use": "Section II-A：现有 T2AV 通常 build upon diffusion or autoregressive architectures。商业模型被写成 tightly coupled diffusion-based；学术线提到 Seeing and Hearing、JavisDiT、UniVerse-1 的“stitching of experts”等。本文是评测基准，不提出新的扩散结构。",
      "source": "Section II-A"
    },
    "audio-physics": {
      "term": "音频物理锚定 / audio-physics grounding",
      "background": "生成的声音是否服从支配发声的物理关系：材料改变音色，作用力改变幅度，空腔改变共振，距离改变声压，遮挡改变频谱。不同于“像不像这类事件的声音”。",
      "paper_use": "全文中心词。作者认为先前基准测的是同步与语义，测不到这种锚定。6 个主维、41 个细项即为此而设。结论：current models still struggle to capture fundamental audio-physical phenomena。",
      "source": "Abstract；Section I；Section V"
    }
  }
}