视频模型

LTX-2.5 开源发布:6.8秒生成10秒视频,多镜头一致性+扩散解码器+机器人预训练,ComfyUI 首日集成

2026年8月12日1 次阅读
LTX-2.5 开源发布:6.8秒生成10秒视频,多镜头一致性+扩散解码器+机器人预训练,ComfyUI 首日集成

Lightricks 孵化的 LTX 今天发布 LTX-2.5,这是其开源视频/世界模型线的最新大版本。新模型几乎重建了整个生成管线:换上全新扩散视频解码器、加入原生多镜头生成、换用 Gemma 4 语言骨干,还附带一个面向物理 AI 和机器人的预训练 checkpoint。在两块 NVIDIA GB200 上自托管时,6.8 秒就能生成一段 10 秒 720p 视频——比实时还快。同时,LTX-2.5 通过战略合作在发布当天就入驻了 ComfyUI。基于多家媒体转述整理。

几乎重写了整个管线

LTX-2.5 不是在旧模型上打补丁,而是对生成管线的几乎每个阶段做了重建:

扩散视频解码器是这次最核心的变化。之前的 LTXV 用的是高压缩比但细节损失较大的解码方式,高运动画面容易出现伪影。LTX-2.5 引入了新的 pixel diffusion 过程,在保持高压缩比的同时重建文字、人脸等精细细节,运动画面中的伪影明显减少。

原生多镜头生成解决了视频创作者的一个老痛点:之前要生成多镜头序列,只能逐镜头生成再拼接,角色外观和声音很难保持一致。LTX-2.5 可以在单次生成中输出完整的多镜头序列,角色、场景和声音跨镜头保持一致。

语言骨干升级到 Gemma 4,配合专门的 prompt enhancer,对复杂多主体提示词的理解和执行更准确。比如"一个穿红裙的女人在雨中跳舞,背景是东京街头霓虹灯"这种多元素提示,新模型更不容易遗漏或混淆元素。

蒸馏模型也做了大幅改进,接近完整模型质量的同时推理成本和速度都显著降低。通过和 NVIDIA 的联合优化,蒸馏版可以在 RTX GPU 上本地运行,显存需求也降低了。

速度:快于实时,但有条件

LTX 给出的最亮眼数字是速度:在两块 NVIDIA GB200 superchip 上自托管,生成一段 10 秒 720p 图生视频只需 6.8 秒,比视频本身的播放时长还短。

但这个数字有前提——GB200 是 NVIDIA 目前最顶级的芯片,绝大多数团队没有这个配置。通过 LTX 自己的托管 API 跑同样的任务(输出分辨率更高为 1080p),耗时 23.7 秒。

即便如此,和竞品 API 对比仍然有速度优势。LTX 给出的同任务端到端测试数据:Google Gemini Omni Flash 52 秒,xAI Grok 1.5 63 秒,Google Veo 3.1 70 秒(8秒片段),MiniMax H3 180 秒,字节 Seedance 2.5 317 秒,快手 Kling 3.0 Pro 398 秒。

定价:便宜,但不是最便宜

LTX-2.5 Fast 层定价 $0.09/秒,一段 10 秒 720p 带音频视频 $0.90。Pro 层 $0.12/秒,$1.20/10秒。

放在市场里看:Google Veo 3.1 Lite 只要 $0.50/10秒,是当前视频生成市场的价格地板,但闭源且不支持 4K 和片段延长。LTX-2.5 Fast 比大部分竞品便宜(Veo 3.1 标准 $4.00,FLUX 3 Video $1.70),但并非"最便宜"。

LTX 宣称成本是竞品的"八分之一",这个说法和实际定价对不上——没有任何主流竞品的 10 秒片段要 $7.20。如果这个比例成立,可能只针对 Kling 3.0 Pro 或 Seedance 2.5 等不公开按秒定价的高端模型,或者是指自托管场景下的边际 GPU 成本。

开源才是真正的差异化

LTX-2.5 最核心的竞争力不是速度或价格,而是开源。这是目前视频生成领域唯一可自托管、可微调的开放权重模型家族。年营收低于 1000 万美元的组织免费使用,更大的公司需要谈商业许可。

对影视工作室、游戏公司、机器人团队来说,这意味着:你可以把模型下载到自己的服务器上,用自己的数据微调,不用担心创意资产经过第三方 API。LTX-2.5 还附带了一个面向物理 AI 和机器人的预训练 checkpoint,可以微调到完全不像电影视频的领域数据上——这是闭源 API 做不到的。

模型家族累计下载量已超过 3300 万次,是开源视频/世界模型中下载量最大的。

ComfyUI 首日集成

LTX-2.5 发布当天就通过战略合作入驻了 ComfyUI——目前开源生成媒体领域事实上的工作流工具。ComfyUI 联合创始人 Yoland Yan 表示,开源权重和节点式工作流的结合让创作者可以自由组合和定制视频生成管线,这是闭源 API 无法提供的灵活性。

模型现在可以通过 Hugging Face 下载、ComfyUI 使用、或 LTX 托管 API 调用。

需要注意的局限

  • 6.8 秒的"快于实时"速度依赖顶级硬件,普通用户在消费级 GPU 上的体验会差不少
  • "八分之一成本"的说法需要打折理解,实际定价并非市场最低
  • 质量方面,LTX 提供了人工偏好测试数据,但独立第三方基准测试尚待补充
  • 多镜头生成是重要进步,但长视频(超过 20 秒)的一致性仍需验证

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...