音视频联合

九篇。表征、AV-LLM、说话人脸。

ImageBind · ImageBind: One Embedding Space To Bind Them All

2023 · CVPR 2023 · Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra

用图像当枢纽,把文本、音频、深度、热成像、IMU 绑进同一空间。早期 Video-LLM 的音频塔常用它。