AI 角色的下一步,已经能由你实时决定了?
刚刚,Vivix 发布了两款激活参数约 30B 的实时交互多模态模型:A1 和 W1。它们和传统视频模型最大的区别是,视频生成以后,你可以随时说话、点击或者下指令,直接改变后面的剧情发展。
比如,和 AI 女友聊天时,你可以让她再靠近一点:
还能和博物馆里的古代仕女俑对话,让文物活过来。
以前是提示词决定整段视频,现在提示词只负责开个头,后面怎么发展,主要看你怎么玩。
不敢想象这个技术用在 AI 短剧上会有多上头...观众一句话,就能救下原本要领盒饭的角色;点一下屏幕,男女主可能直接分手。
接下来,我们具体看看 A1 和 W1 到底是怎么做到的。
一、A1模型:实时控制人物
Vivix-A1 能让 AI 角色能根据和你的实时对话,在场景中做出一系列有活人感的动作。
这种活人感究竟是怎么实现的?
环境感知能力
目前大多数数字人的能力仍然集中在口型、表情和有限的上半身手势。角色通常被固定在镜头前,无法理解周围空间,也很难自由行走或与场景中的物体互动。
而 A1 将角色能力扩展到了开放场景,能自如在开阔环境中运动,并且镜头跟随运动。。
比如,在这段线上看房 Demo 中,AI角色丝滑地在虚拟样板间中走动,并同步展开介绍,神情步态均非常自然。
这正是“活人感”的来源之一。
全身大动作能力
角色能自然完成行走、转身、弯腰、舞蹈和姿势切换,不再只有口型和几个固定手势。比如在 AI 女友和博物馆 Demo 中,角色可以自由进行全身活动、自然拿取物体,甚至起身翩翩起舞,整个过程连贯流畅,没有明显卡顿或动作崩坏。
A1 不是驱动一张脸和半截身体,而是真正让角色拥有了一副能够自由活动的身体。
细腻情绪表现
情绪会同时落在眼神、眉毛、嘴角、语气、手势和身体姿态上,而不是生硬地切换表情模板。
比如角色紧张时,视线会变得游移,动作也会有所收敛;开心时,面部和身体会一起放松。不同情绪之间还有自然的过渡,不会突然“变脸”,因此看起来更像真的在经历情绪。
全双工交互
A1 支持实时全双工交互。即使角色正在说话或行动,用户也能随时插话、追问或者更换话题,不用等它完成这一轮表演。
角色会及时停下当前内容,理解新的指令并接着回应,让互动从一问一答变成更自然的实时交流。
互动过程中支持多模态输入
A1 支持语音、文字和图片输入,而且图片不只用于确定角色最初的形象。
互动过程中临时上传一张商品图,角色就能根据新素材调整讲解,把商品带入当前场景并完成拿取和展示,不需要重新生成整段视频。
A1让角色生成进入了下一阶段:不再只是一个形象,而是一个具有完整行为逻辑的人物。
当角色能够长期保持自己的行为方式和反应逻辑,它才真正具备进入陪伴、游戏和虚拟世界的可能。
二、W1模型:实时改剧情
Vivix-W1 会让整个故事根据你的语音、文字、图片和点击继续变化,直到走向一条只属于你的故事线。
它是一款面向互动叙事的实时交互多模态模型,能生成一段能够被持续介入的音视频故事。
既可以通过语音和文字改变剧情,也可以加入新的图片或视频,还能使用触控、点击、镜头控制和角色移动等方式直接参与故事。
比如,在由 W1 模型生成的乐高积木风格《上帝模式小镇》Demo 中,当输入“让路面铺满糖果”,主人公脚下的街道随即变成糖果世界;输入“把天气改为雨天”,天空迅速转阴,雨水、环境音和人物反应也会同步变化。点击画面中的风向标,还可以直接转动它,与故事里的物体实时互动。
这些操作并不是重新生成一段视频,而是在当前故事的基础上,继续改变下一秒的画面、声音和剧情。
目前,官方展示了 W1 的五类交互方式。
最直接的是语音和文字。可以直接用自然语言描述想看到的内容,在故事进行中临时改变设定。比如,说出希望角色发生的对白,W1 就会把这句话转化为故事画面和角色台词,并沿着这个设定继续生成。

有时,不需要输入完整指令,只是滑动鼠标也可以继续生成。
在下面的 Demo 中,所有内容都是实时生成的,当你用鼠标做出选择后,士兵便随之行动,故事也随之进入新的分支。

还可以直接在屏幕触控,生成下一帧画面。

还能通过加入图片,决定角色如何改变。

W1 还具备实时导演能力。它能根据剧情发展自动组织多镜头序列,在全景、近景和人物特写之间自然切换。

另外,还支持多模态输入,为生成故事提供稳定的起点。人物长什么样、故事发生在哪里、整体采用怎样的声音和视觉风格,都可以通过音频、图像、视频等不同形式的输入提前设定。

但 W1 的多模态输入并不局限于生成开始前。即使故事已经展开,仍然可以加入新的参考。
W1 会把这些新信息融入正在生成的内容流,在延续原有角色、场景和剧情的基础上继续发展。
三、为什么可以实时响应?
A1 和 W1 能够实时响应,是因为 Vivix 重构了整套模型架构、交互层、基础设施。
以 DiT 为代表的主流视频模型主要面向离线生成,Prompt 在开始时已经确定,模型围绕完整片段统一计算,再经过解码和推流输出结果。整条链路是串行的,我们只能等待当前视频生成结束,才能修改结果。
而实时交互模型打破了这个前提。新的语音、动作和视觉参考随时可能进入,AI 必须一边生成音视频,一边理解新输入,更新生成状态并改变后续。
这也带来了更大的计算压力。
难点首先来自信息吞吐量。人在文本交互中每秒只需要消费约 3—5 个 Token,而连续音视频每秒包含数万级视觉 Token 和同步音频信息,吞吐量提高了约 10³—10⁴ 倍。模型不仅要实时处理这些信息,还要把响应延迟控制在毫秒级。
为此,Vivix 将整段视频生成拆解成连续、细粒度的音视频 Token 流。模型不再等待完整片段计算结束,而是在流式生成循环中持续预测接下来的画面和声音。
不过,真正决定新指令能否及时生效的,是 Vivix 对实时推理链路的重构。

Vivix 把这条链路拆成两部分:一部分负责理解新输入,并将其转换成模型能够使用的信息;这套模块被称为编码服务(Encoder Service)。另一部分负责持续生成接下来的画面和声音,被称为解码循环(Decoder Loop)。
系统中还有一个负责安排计算顺序的调度器。它可以把新信息随时加入正在运行的解码循环,也能中止尚未完成的生成步骤。因此,“打断”并不是播放器切掉旧视频,再重新生成一个片段,而是新指令真正进入了模型内部的生成过程。
也就是说,当模型还在生成画面时,新的输入已经可以开始编码;当上一段内容还在推流时,下一段音视频也已经进入计算。
这套架构还同时支持“快思考”和“慢思考”。简单的对话与动作指令可以直接进入快速链路,尽可能降低首次响应延迟;涉及剧情规划、工具调用和长程上下文的任务,则由异步运行的导演 Agent 处理。
多个 Agent Loop 共用同一套上下文,不会因为长程规划而阻塞眼前的互动。

为了让连续生成能够长时间运行,Vivix 还在推理侧采用了视频流式 PD 分离、KV Cache 管理以及通信与计算重叠等技术。
这些技术最终反映在实际延迟上,画面出现可见反应的延迟低于 0.6 秒;计入全球网络与直播推流后的端到端响应延迟低于 1.7 秒;模型原生打断通常发生在约 300—900 毫秒内。
训练 Infra 同样围绕实时视频进行了重构。Vivix 将视频特征解码服务化,支持原生 2K、10-bit 长视频训练,再利用 Vivix Sparse Attention 压缩视频中的时空稀疏信息。这套训练管线让激活参数约 30B 的视频模型能够在一个月内完成稳定训练。
官方报告显示,这套 Infra 将当前实时视频推理成本控制在每小时 1 美元以下。注意,这里指的是基础设施层面的推理成本,并非最终 API 售价,但已经接近云游戏、音乐会员和流媒体等大众娱乐服务的价格区间。
总的来说,Vivix 的实时交互并不是单纯依靠增加算力,而是模型架构、训练管线与推理 Infra 协同设计的结果。
四、做出 A1 和 W1 的,是什么团队?
说到这里,再简单介绍一下 Vivix。
这是一家成立于 2025 年 1 月的年轻公司。从创立之初,公司就把方向押在了一件更底层的事情上,不再做一个新的 AI 视频工具,而是致力于打造实时互动多模态模型。
于是就有了这次发布的 A1 和 W1。

Vivix 认为,一段可交互内容,首先得是一段让人愿意看下去的内容。它离不开三个基本元素:人是体验的中心,场景承载互动,时间则让事件发生变化,最终形成故事。
只有角色足够自然,能够理解、回应和行动,互动才可能产生真实的联系感。
但只有角色还不够,一个能够持续发展的故事,还需要模型理解物体、场景和时间,并根据新的介入实时改变后续。这里的“实时”不只是速度指标,它直接决定屏幕前的人是否相信,自己正在参与一段真正发生的内容。
A1 先让角色真正“活”起来,W1 再让角色所在的故事持续发展。这两款模型并不是彼此独立的方向,而是 Vivix 对实时交互内容给出的两步答案。
Vivix 目前已经完成 A 轮融资。估值达到 13.2 亿美元。随着 A1、W1 的正式亮相,这家公司也从渐渐走到台前,亮明了自己在实时交互多模态模型上的长期方向。
五、从生成内容,到生成体验
最后,简单说说我对这类模型的看法。
A1 和 W1 真正改变的,不是视频生成的某一项指标,而是模型生成的基本单位。传统模型生成的是一段已经完成的内容,实时交互模型生成的则是一段仍在发生、可以继续被改变的体验。
最先受影响的可能是 AI 角色。过去的数字人、虚拟主播和陪伴角色主要依靠语言建立互动,身体只是承载对话的外壳。A1 让角色开始拥有完整动作和环境反馈,交流也从“说了什么”扩展到“做了什么”。
当这种能力从单个角色扩展到整个故事,就会出现新的内容形式。AI 短剧无需提前制作所有剧情分支,可以根据观众的介入实时生成不同走向;游戏角色也不必完全依赖固定台词和行为树。故事可以根据临时介入继续发展,影视的叙事感、游戏的参与感和直播的即时性,也可能逐渐融合。

但它最终未必会以“互动影游”这一种形态出现。虚拟陪伴、互动直播、教育培训、数字展陈和品牌体验,都需要能够长期存在、理解环境并实时回应的角色与场景。
因此,A1 和 W1 更像是两种底层能力。开发者可以通过 API 将它们接入不同场景,最终做出来的产品,可能不再被简单归类为视频、游戏或者直播。
当然,这条路线还处于早期阶段。
但至少可以看到,AI 内容正在从一次性生成的作品,变成一个可以持续运行、实时回应并不断发展的过程。未来我们消费的,可能不再只是同一段内容,而是一段因每个人的介入而不同的体验。