Runway 公开实时视频生成研究:边打字边出画面,AI 视频从"等结果"变成"当场导"
这是什么?
现在用 AI 生成视频的流程大家都熟:输入提示词,等几秒到几分钟,拿到一段已经渲染完的视频。不满意?改改提示词,再等一轮。Runway 在文章里直说了:用户反馈里最痛的就是这个"等"——生成和迭代时间是整个创作流程里最慢的一环。
Runway 想做的是另一回事:时间到首帧(time-to-first-frame)尽可能短,画面像直播一样流式输出。你输入一句话,画面几乎是即时开始变化;你改一个词,画面跟着变。这不是把生成提提速,而是把"提交作业再批改"换成"老师站在旁边看着你写"。
顺带一提,就在大约一周前 Runway 刚发布了 Solaris 和 GWM Worlds 2,这篇研究文章等于把公司下阶段的牌摊开了一部分:实时化。
为什么重要?
速度不只是体验问题,还是钱的问题。视频模型跑得越快,占用 GPU 的时间就越短,单条视频的成本就越低。Runway 自己的判断很直接:在同等画质下,成本决定了哪些使用场景"划算"。把生成时间压下来,原来因为太贵、太慢而不成立的场景就会被盘活。
更深一层的是创作方式的改变。今天的 AI 视频更像"抽卡"——生成、不满意、重来。而实时反馈让创作者从"等着看结果"变成"全程 actively directing":画面在你的调整下当场演进,整个人的角色从赌徒变成了导演。
技术上怎么做到的?(通俗版)
Runway 的做法是对 Gen-4.5 这类基座模型做后训练改造,大致分三步:
- 第一步:把模型改成"逐帧接着画"。传统视频模型是一次性算出整段视频,Runway 把架构改成时间上因果的逐帧自回归生成——每一帧只依赖开头一帧加一句描述,以及之前已经画出来的帧。视频和音频的解码器也改成因果流式,画到哪、播到哪。
- 第二步:用蒸馏把速度提上来。刚改成逐帧的模型还是太慢,一帧要好些步才算完。Runway 用分布匹配蒸馏把每帧压到几步,快到可以实时流式输出。
- 第三步:解决"一步错步步错"。这是视频模型实时化最棘手的地方:语言模型错了可以中途改口,视频模型的一个小瑕疵会随着后续帧不断累积、滚雪球,画面越拉越崩。Runway 的解法是 on-policy 蒸馏——让模型在训练时就看到自己生成的画面,学会纠正自己的跑偏,而不是放大它。
另外他们发现训练技巧上有个反直觉的结论:与其一开始就用长序列训练,不如从短到长逐步加长(课程式训练),直接上长序列会让模型在后半段彻底跑飞。
对谁有用?
Runway 在文章里把话说得相当远:他们认为交互式体验是生成式媒体的终极用例。教育、游戏、机器人,都需要"画面反应速度跟得上观看者"的视频;而要评估机器人、自动驾驶这些物理 agent 的表现,也需要能实时生成、即时响应的环境。今年早些时候他们推出 Runway Characters 时就提过这条路,这次是把整条技术路线摊开来讲了。
来源
- Runway 官方研究文章:Towards Instant Video Generation(2026年9月10日)
- AlphaSignal 报道:Runway Rebuilds Gen-4.5 to Stream Video Frames in Real Time