视频模型

Runway 公开实时视频生成研究:边打字边出画面,AI 视频从"等结果"变成"当场导"

2026年9月13日2 次阅读
视频模型动态 · 2026年9月10日 · Runway实时生成流式视频
一句话总结:9月10日,Runway 发布研究文章《Towards Instant Video Generation》,公开了把自家 Gen-4.5 等基础模型改造成"实时流式生成"的技术路线——视频不再是一次性交付的成品,而是跟着你的输入一帧一帧当场长出来。

这是什么?

现在用 AI 生成视频的流程大家都熟:输入提示词,等几秒到几分钟,拿到一段已经渲染完的视频。不满意?改改提示词,再等一轮。Runway 在文章里直说了:用户反馈里最痛的就是这个"等"——生成和迭代时间是整个创作流程里最慢的一环。

Runway 想做的是另一回事:时间到首帧(time-to-first-frame)尽可能短,画面像直播一样流式输出。你输入一句话,画面几乎是即时开始变化;你改一个词,画面跟着变。这不是把生成提提速,而是把"提交作业再批改"换成"老师站在旁边看着你写"。

顺带一提,就在大约一周前 Runway 刚发布了 Solaris 和 GWM Worlds 2,这篇研究文章等于把公司下阶段的牌摊开了一部分:实时化。

为什么重要?

速度不只是体验问题,还是钱的问题。视频模型跑得越快,占用 GPU 的时间就越短,单条视频的成本就越低。Runway 自己的判断很直接:在同等画质下,成本决定了哪些使用场景"划算"。把生成时间压下来,原来因为太贵、太慢而不成立的场景就会被盘活。

更深一层的是创作方式的改变。今天的 AI 视频更像"抽卡"——生成、不满意、重来。而实时反馈让创作者从"等着看结果"变成"全程 actively directing":画面在你的调整下当场演进,整个人的角色从赌徒变成了导演。

技术上怎么做到的?(通俗版)

Runway 的做法是对 Gen-4.5 这类基座模型做后训练改造,大致分三步:

  • 第一步:把模型改成"逐帧接着画"。传统视频模型是一次性算出整段视频,Runway 把架构改成时间上因果的逐帧自回归生成——每一帧只依赖开头一帧加一句描述,以及之前已经画出来的帧。视频和音频的解码器也改成因果流式,画到哪、播到哪。
  • 第二步:用蒸馏把速度提上来。刚改成逐帧的模型还是太慢,一帧要好些步才算完。Runway 用分布匹配蒸馏把每帧压到几步,快到可以实时流式输出。
  • 第三步:解决"一步错步步错"。这是视频模型实时化最棘手的地方:语言模型错了可以中途改口,视频模型的一个小瑕疵会随着后续帧不断累积、滚雪球,画面越拉越崩。Runway 的解法是 on-policy 蒸馏——让模型在训练时就看到自己生成的画面,学会纠正自己的跑偏,而不是放大它。

另外他们发现训练技巧上有个反直觉的结论:与其一开始就用长序列训练,不如从短到长逐步加长(课程式训练),直接上长序列会让模型在后半段彻底跑飞。

对谁有用?

创作者
改想法不再重新生成,迭代成本大幅下降
游戏 / 教育
需要画面跟着观众实时变的应用场景
机器人 / 自动驾驶
仿真环境必须实时响应、即时反馈边缘情况
AI Agent 团队
数字 agent 操作电脑,需要即时的画面反馈流

Runway 在文章里把话说得相当远:他们认为交互式体验是生成式媒体的终极用例。教育、游戏、机器人,都需要"画面反应速度跟得上观看者"的视频;而要评估机器人、自动驾驶这些物理 agent 的表现,也需要能实时生成、即时响应的环境。今年早些时候他们推出 Runway Characters 时就提过这条路,这次是把整条技术路线摊开来讲了。

普通用户怎么看:这是一篇研究文章,不是新产品上线——实时生成模型还没有以正式产品形态开放。但方向已经很明确:下一阶段视频模型的竞争焦点,正从"谁画质更好"转向"谁的反馈更即时"。如果你在用 Runway 的产品线(比如 Characters),值得留意实时能力什么时候先落进这些产品;对整个行业来说,"边导边出"大概率会成为下一代视频工具的标配交互。

来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...