Vivix是什么
先说说Vivix到底是什么。它是一家由前商汤高管刘宇创立的AI新锐公司,推出的全球首个实时交互多模态基座模型,包含两个版本:
和
。这两款模型都采用了约30B激活参数的统一流式架构,把多模态参考、原生交互和流式视频生成整合在一起。用户可以通过语音、文字、触控等方式直接介入,实时改变AI角色的动作和剧情走向。端到端首次反应延迟低于1.7秒,推理成本在一年内降低了两个数量级,已经接近主流视频平台CDN带宽成本,甚至能在消费级GPU上实现实时推理。

Vivix的主要功能
你可能会好奇,这跟咱们熟悉的AI视频工具有什么区别?Vivix的核心能力,可以拆解成几个关键点:
- :AI角色在说话或行动时,用户随时可以插话、换话题,角色立刻响应,不需要等它把当前轮次说完。真正实现人机双向对话,而不是你问一句它答一句的“单行道”。
- :角色不仅能说话,还能实时行走、转身、拿东西、与环境互动,支持写实人物、3D角色和动漫形象等多种风格。这可不是简单的“嘴型同步”,连肢体动作都跟上了。
- :画面、对白、环境音和音效同步生成,不需要单独加一个音频模型来处理,口型、动作和声音匹配度很高,视听一体化输出。
- :支持语音、文字、图片等多种输入方式,而且图片可以在互动过程中动态加入,角色会根据新素材实时调整讲解内容和动作表现。
- :模型可以自主切换视角、移动镜头,处理对白节奏和人物反应,实现电影级的实时导演能力,叙事感很强。
- :采用小段流式生成方式,上一段内容作为下一段基础,支持故事长期演进而不漂移,长时间交互不会有断裂感。
- :流式调度器处理新输入最短只需要300毫秒,用户输入到画面首次可见反应平均低于0.6秒,端到端首次反应时间(TTFR)低于1.7秒。
- :通过MJD多维联合蒸馏、原生NVFP4训推协同与VMI推理引擎优化,30B参数模型也能在消费级显卡上实现实时推理。
如何使用Vivix
如果你对Vivix感兴趣,上手其实很简单:
- :前往Vivix的官网 https://vivix.ai/ 或API开放平台提交体验申请。
- :根据需求选择 (角色实时交互)或 (互动叙事/世界生成)。
- :上传角色图片、场景描述或语音指令,确定故事或角色的初始状态。
- :通过语音、文字、点击或触控与AI角色/故事进行双向交流,随时改变剧情或角色行为。
- :在流式生成过程中追加新图片或修改指令,系统会实时重定向后续内容,不需要从头生成。
Vivix的核心优势
从技术细节来看,Vivix有几个让人印象深刻的优势:
- :流式调度器响应新输入最短只需300毫秒,用户输入到画面首次可见反应平均低于0.6秒,端到端TTFR低于1.7秒。这个延迟水平,已经接近人类对话的反应速度了。
- :通过MJD多维联合蒸馏、原生NVFP4训推协同与VMI推理引擎,将30B参数模型压缩到2步推理,消费级显卡单卡就能跑出超过10,000 video tokens/s的速度。
- :推理与基础设施成本在一年内降低了约100倍,实时生成成本已经接近YouTube每小时约0.2美元的CDN带宽成本。
- :摒弃了传统ASR+LLM+TTS拼接管线,采用端到端原生多模态生成循环,交互更自然,延迟更低。
- :通过局部连续性衔接和全局序列先验,维持人物、背景、声音和动作的长期稳定,避免长时间生成后画面漂移——这是很多生成式AI难以攻克的难题。
Vivix的同类竞品对比
说到竞品,智谱的GLM-Realtime是目前最直接的对比对象。两者都是多模态模型,但定位侧重点不太一样。
,Vivix是全球首个实时交互多模态基座模型,而GLM-Realtime是端到端音视频通话多模态模型。Vivix更强调“生成式”能力,AI实时生成角色动作、场景和镜头叙事;GLM-Realtime更侧重“理解式”,可以实时理解用户摄像头画面并语音回应。
,Vivix采用统一流式架构,约30B激活参数,端到端原生多模态生成循环;GLM-Realtime是端到端多模态模型,跨文本/音频/视频实时推理。
上,Vivix的流式调度器300毫秒,画面首次可见小于0.6秒,端到端TTFR低于1.7秒;GLM-Realtime强调“近乎实时”,具体数值未公开。
方面,Vivix支持画面+对白+环境音+音效同步生成(音画联合),而GLM-Realtime只支持语音+文本输出(基于视频理解)。Vivix还支持全身角色行走、转身、拿取物品、物理交互,GLM-Realtime则侧重理解用户视频,没有角色生成功能。
上,Vivix可以在消费级GPU上实时运行,单卡跑超10,000 video tokens/s;GLM-Realtime是云端API调用,没有本地硬件要求。
,Vivix的推理成本一年内降低了约100倍,接近CDN带宽成本;GLM-Realtime按分钟计费,音频0.18–0.3元/分钟,视频1.2–2.1元/分钟。
上,Vivix具备电影级多镜头自主切换、角色风格自定义(写实/3D/动漫)、环境物理交互等能力;GLM-Realtime则提供清唱功能、Function Call工具调用、口语陪练、面试模拟等实用功能。
Vivix的适用人群
那么,Vivix到底适合谁?
- :需要构建开放世界剧情、实时NPC交互与动态叙事的游戏工作室,Vivix的实时交互和动作生成能力几乎是量身定制。
- :希望打造实时互动数字人、虚拟主播或沉浸式直播体验的团队,Vivix能大幅降低制作门槛。
- :需要AI销售/导购进行线上带看、商品展示与实时答疑的企业,Vivix的实时交互和多模态能力可以提升用户体验。
- :开发虚拟导览、互动讲解、沉浸式研学内容的机构,Vivix的角色生成和叙事能力能让内容更生动。
- :关注实时多模态生成、流式架构与低延迟推理技术的前沿技术人员,Vivix的技术架构本身就是一个值得研究的案例。