来源:互联网 更新时间:2026-08-24 14:30
VITA是腾讯优图实验室在交互式全模态大语言模型领域的一次新探索。这几年,大语言模型(LLM)和多模态大语言模型(MLLM)的发展速度有目共睹,GPT-4这类模型展现出的强大多模态能力和自然交互体验,已经给实际应用铺好了路。但一个现实问题是,开源社区在这一领域还存在明显的短板。为了弥合这个差距,腾讯优图实验室等机构的研究人员推出了VITA——这是首个开源的、能同时处理视频、图像、文本和音频的多模态大语言模型,并且支持真正高级的多模态交互体验。
VITA的几个核心亮点包括:
在交互体验上,VITA有两项关键创新:

Fig 1:VITA的交互示意图。传统的音频交互需要预定义的唤醒词,比如每次提问时都得说“嗨!Siri∼”,或者按个按钮来控制输入(限制1)。当模型正在生成输出时,人机交互通常是阻塞的,因为传统系统只能按顺序响应输入(限制2)。相比之下,一方面,VITA支持音频、文本和视觉的端到端处理,而不是像以前那样分开。另一方面,VITA在交互上做出了两个贡献:非唤醒交互——自动过滤背景噪音和非查询人声,省去了唤醒词和按钮;音频中断交互——如果用户用另一个问题打断,生成过程会暂停,模型立即响应最新的查询。
接下来,我们重点看看VITA的核心架构、训练数据和训练流程。
VITA的模型架构如下图所示。

Fig 2:VITA可以处理纯文本/音频形式的输入,也能处理视频/图像结合文本/音频的输入。此外,不同查询输入设置有不同的状态令牌。<1>对应有效的查询音频,比如“世界上最大的动物是什么?”,这时候期望模型给出回应。<2>对应嘈杂的音频,比如环境里有人在喊我吃饭,这时候期望模型不回复。<3>对应查询文本,即用户以文本形式提出的问题。训练阶段,模型要学会自动区分不同的输入查询类型。到了部署阶段,通过<2>就可以实现非唤醒交互。基于这个机制,进一步引入了双工方案来实现音频中断交互:两个模型同时运行,生成模型负责处理用户查询;当生成模型工作时,另一个模型监视环境。如果用户用另一个有效的音频查询打断,监视模型会汇总历史上下文来回应最新的查询,同时生成模型暂停并转为监视状态——相当于两个模型交换了角色。
VITA以Mixtral 8×7B作为语言模型的基础,通过三个主要阶段的训练来达成多模态和交互能力:

Fig 3:VITA的训练流程。第一阶段,通过扩大词汇表并利用高质量的双语文本语料库对Mixtral 8×7B进行
研究人员为VITA收集和构建了大量高质量的训练数据:
在数据处理方面,采用了数据拼接策略,将纯文本和图像数据的上下文长度统一为6000个token,以提高训练效率。
值得注意的是,在多模态指令微调阶段,从500万个纯文本数据中采样80万个条目,以维持LLM的文本理解能力。这个操作是在多模态指令微调阶段进行的,而不是视觉对齐阶段,因为后者的LLM参数是固定的。
对于一般的图像描述任务,引入了ShareGPT4V中由GPT-4V生成的数据,确保数据质量。此外还引入了Alla va-Caption和ShareGTP4o-Image数据集,并补充了一些由现有MLLM生成的中文图像描述。
对于一般的图像问答任务,初步收集了三个数据集:LLaVA-Mixture-sample、Lvis-Instruct和ScienceQA。使用现有的MLLMs生成了额外的21.8K中文QA数据。同时,从LLaVA-150K数据集中移除了标题子集,并将其余部分翻译为中文。
对于OCR和图表任务,引入了Anyword-3M、ICDAR2019-LSVT、ICDAR2017-RCTW、Open-Chart(包括ChartQA、DVQA、InfoVQA、Pew和OpenCQA)数据集,以及一些由现有MLLMs从其他开源数据中生成的合成数据。对于Anyword-3M,选择答案文本长度在20到50之间的数据,问题要求识别图像中的文本。对于ICDAR2019-LSVT、ICDAR2017-RCTW和Open-Chart,使用现有MLLMs生成详细的描述和QA对。
对于一般的视频描述任务,使用ShareGemini数据集。
对于一般的视频QA任务,使用现有MLLMs重新标注了Video-ChatGPT和VideoChat2。

Fig 4:不同的文本数据直接拼接到6K个token。图像首先被分成多个局部patches,然后不同的图像-文本对被对应拼接起来。视频数据直接逐帧采样作为输入,无需拼接。通过这种方式,可以统一不同训练batch中的数据长度,从而提高训练效率。
拼接不同数据带来了两个好处:
在这一阶段,对模型进行指令微调,增强其对文本和音频指令的遵循能力。


根据上述构建的QA对,模型需要区分三种类型的查询:
基于这些查询类型,设计了三种状态token:<1>、<2> 和 <3>。在训练阶段,在答案的开头插入对应的状态token,使模型能够灵活处理不同的交互行为。
状态token <1> 表示问题输入为查询音频。此时,模型的输出需要以文本或通过TTS工具转换的语音形式呈现给用户。
状态token <2> 表示问题输入为噪声音频。模型应输出EOS token作为终止符。然而,训练过程中发现,突然终止输出可能会显著降低性能。因此,将噪声音频对应的文本发送给LLM,并使用其输出文本作为训练目标。在推理过程中,<2> 作为另一种特殊的EOS标记。
状态token <3> 表示问题为纯文本,用于在训练集中区分前两种查询。
在训练过程中,视觉和音频编码器保持冻结状态,而连接器与Mixtral 8×7B一起进行训练。
为了实现VITA的高效交互功能,研究人员进行了大量的工程优化:
非唤醒交互意味着模型可以在不需要唤醒词或按钮的情况下被激活,并对环境中的用户音频问题做出回应。部署过程必须满足以下要求:
对于第一个要求,现有的语音活动检测(VAD)可以提供帮助。VITA使用SileroVAD,该系统经过大规模语料库训练,涵盖超过6,000种语言,并且能够在各种背景噪声下表现良好。对于第二个要求,利用前面介绍的状态token <2>。这使模型能够自动区分输入音频是否为有效查询。如果输入为非查询类型,模型将直接终止推理,从而仅对查询类型的输入作出响应。
音频中断交互允许用户随时用新问题打断模型的生成过程。为实现这一点,部署环境必须满足以下要求:
从语言、音频、多模态三个方面来衡量VITA的最终效果。语言方面,使用的评测集包括C-EVAL、AGIEVAL、MMLU和GSM8K;音频方面,使用的是Wenetspeech和Librispeech;多模态方面,使用的是MME、OCRBench、HallusionBench和Video-MME。具体的评估结果,这里就不一一展开了,感兴趣的话可以直接看原论文。
VITA作为一个开源的全模态交互式大语言模型,其学术和实践意义都很显著:
不过,虽然VITA在多模态理解和交互方面取得了显著进展,但与闭源模型比如GPT-4o相比,仍然存在差距。研究团队也指出了未来的工作方向:
总的来说,VITA代表了开源多模态大语言模型的一个重要里程碑。它不仅从技术角度推动了MLLM的发展,也为开源社区探索自然、智能的人机交互开辟了新的方向。随着VITA的持续优化和社区的共同努力,有理由期待在不久的将来,开源MLLM能在功能和性能上真正媲美甚至超越闭源商业模型,为人工智能的普及和应用带来更多可能性。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
海尔消毒柜自动消毒如何中止
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc