xAI Imagine Video 1.5 大更新:7个参考锚定角色+语音一致性,原生1080p文生视频上线
xAI 给 Grok Imagine Video 1.5 加了三把火——图片参考、语音参考、纯文生视频,还把分辨率推到原生1080p。角色和声音跨镜头保持一致,这是AI视频走向"连续叙事"的关键一步。
这次更新了什么
Imagine Video 1.5 上月首发时就以更真实的运动和音画同步引起关注。8月1日,xAI推送了该模型的首个重大功能扩展,核心是三个新能力:
- Multi-Reference:最多7个参考图,每个可独立锚定不同维度
- Voice Consistency:角色图+语音样本组合,跨镜头保持同一声音
- Text-to-Video:纯文本直接生成视频,不再依赖起始图片
- 原生1080p:文生视频和图生视频都支持
Multi-Reference:分角色、分场景、分产品
这是本次更新最实用的部分。之前AI视频生成一个痛点是:换镜头角色就"变脸",换场景就"走样"。Multi-Reference让创作者给每个参考图分配不同的锚定角色——一张图锁人脸,一张图锁产品,一张图锁场景。
实际操作中,你可以:
- 保脸换场景:角色不变,背景从办公室切到户外
- 保场景换角色:同一街道,不同人物走过
- 全保只改动作:角色和场景都不动,只改变行为
最多7个参考图同时输入,对广告和产品视频尤其有用——品牌Logo、产品外观、代言人面孔可以同时锚定。
Voice Consistency:声音也能跨镜头了
角色一致性解决了"脸不变"的问题,但AI视频还有另一个老大难:声音。同一个角色在不同镜头里声音变了,叙事感立刻崩。
xAI的方案是:把角色图和语音样本一起输入。模型在生成视频时同时保持面孔和声音的统一。这直接瞄准了多镜头叙事的制作需求——不用每条视频重新定义角色身份,连续镜头自然衔接。
可用性和API
功能开放节奏不同:
- 文生视频+1080p:全平台已可用,包括Grok Imagine网页版、iOS和Android
- 图片/语音参考:先在美国SuperGrok Heavy和SuperGrok Plus用户开放,几天内逐步扩展到所有付费层级
- API:开发者可通过
grok-imagine-video-1.5模型调用图片参考、文生视频和1080p生成;语音参考目前需向xAI单独申请
行业位置:两种路线的互补
当前AI视频赛道的核心竞争点集中在两个方向:长度和精度。
字节跳动的Seedance 2.5走的是"长片一次生成"路线——单次30秒,多轮扩展到数分钟,追求的是完整故事一镜到底。xAI走的是"多参考精细控制"路线——7个参考锚定不同维度,语音跨镜头一致,追求的是每个镜头的精确可控。
两种路线其实互补:一个解决"能不能讲完一个故事",一个解决"每个镜头是不是我想要的"。对创作者来说,长片叙事和精细控制缺一不可。
---
*基于多家媒体转述整理,信息来源:xAI官方公告、TestingCatalog、CryptoBriefing*