CogVideoX · CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
2024 · arXiv 2024 · Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang et al.
开源 DiT + 3D causal VAE + expert AdaLN。AniSora 用它的权重做动画 SFT。
九篇。从 Sora 到开源复现与加速。
开源 DiT + 3D causal VAE + expert AdaLN。AniSora 用它的权重做动画 SFT。
开源 13B 双流→单流 Transformer + causal 3D VAE。Open-Sora 2.0 先拿它的 VAE 再换深压缩 AE。
同一媒体基座同时出 1080p 视频和同步音频,跨到音频生成线。
复现 Sora 配方的完整开源栈:数据管线、STDiT、3D AE、flow matching。Tora 以它为底座。
时空 patch DiT + 可变时长/分辨率,把视频生成写成世界模拟,后面开源路线都在对这个。
用 CogVideoX 权重做动画全参 SFT,补自然视频模型在动画上的短板。
不改权重,推理时自适应复用 DiT 层,加速 Open-Sora / Latte / CogVideoX。
把 Open-Sora 推到接近商用水准,并证明训练成本可以压到约 20 万美元。
在 Open-Sora 的 DiT 上加入轨迹条件,做运动可控生成。