热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >腾讯版GPT-4o开源平替方案:VITA

腾讯版GPT-4o开源平替方案:VITA

来源:互联网 更新时间:2026-08-24 14:30

简介

VITA是腾讯优图实验室在交互式全模态大语言模型领域的一次新探索。这几年,大语言模型(LLM)和多模态大语言模型(MLLM)的发展速度有目共睹,GPT-4这类模型展现出的强大多模态能力和自然交互体验,已经给实际应用铺好了路。但一个现实问题是,开源社区在这一领域还存在明显的短板。为了弥合这个差距,腾讯优图实验室等机构的研究人员推出了VITA——这是首个开源的、能同时处理视频、图像、文本和音频的多模态大语言模型,并且支持真正高级的多模态交互体验。

VITA的几个核心亮点包括:

  1. 全模态处理能力

    :视频、图像、文本、音频,四种模态一把抓,真正做到了全模态融合。

  2. 双语理解

    :在英语和中文上都有出色的理解和生成能力,不是偏科型选手。

  3. 自然交互体验

    :引入了无唤醒交互和音频打断等创新功能,人机交互的自然度上了一个台阶。

  4. 开源可用

    :模型、训练代码和推理部署框架全部开源,给社区提供了宝贵的资源和研究基础。

VITA

在交互体验上,VITA有两项关键创新:

  1. 无唤醒交互

    。传统的语音助手都得靠唤醒词(比如“Hey Siri”)才能激活,用起来总让人觉得不太自然。VITA的思路是引入状态token,教会模型自动识别输入音频的类型,从而实现无需唤醒词的自然交互。模型会自动过滤掉背景噪音和非查询人声,只对真正有效的查询音频做出响应。

  2. 音频打断交互

    。传统系统中,模型在生成输出时是无法接收新输入的。VITA用了一个双工方案来解决这个痛点:部署两个VITA模型,一个负责生成对当前查询的响应,另一个持续监控新的输入。当用户中途打断并提出新问题时,生成过程会暂停,模型立刻响应最新的查询。这大大提高了交互的自然度和效率。

Fig 1:VITA的交互示意图。传统的音频交互需要预定义的唤醒词,比如每次提问时都得说“嗨!Siri∼”,或者按个按钮来控制输入(限制1)。当模型正在生成输出时,人机交互通常是阻塞的,因为传统系统只能按顺序响应输入(限制2)。相比之下,一方面,VITA支持音频、文本和视觉的端到端处理,而不是像以前那样分开。另一方面,VITA在交互上做出了两个贡献:非唤醒交互——自动过滤背景噪音和非查询人声,省去了唤醒词和按钮;音频中断交互——如果用户用另一个问题打断,生成过程会暂停,模型立即响应最新的查询。

接下来,我们重点看看VITA的核心架构、训练数据和训练流程。

模型架构

VITA的模型架构如下图所示。

Fig 2:VITA可以处理纯文本/音频形式的输入,也能处理视频/图像结合文本/音频的输入。此外,不同查询输入设置有不同的状态令牌。<1>对应有效的查询音频,比如“世界上最大的动物是什么?”,这时候期望模型给出回应。<2>对应嘈杂的音频,比如环境里有人在喊我吃饭,这时候期望模型不回复。<3>对应查询文本,即用户以文本形式提出的问题。训练阶段,模型要学会自动区分不同的输入查询类型。到了部署阶段,通过<2>就可以实现非唤醒交互。基于这个机制,进一步引入了双工方案来实现音频中断交互:两个模型同时运行,生成模型负责处理用户查询;当生成模型工作时,另一个模型监视环境。如果用户用另一个有效的音频查询打断,监视模型会汇总历史上下文来回应最新的查询,同时生成模型暂停并转为监视状态——相当于两个模型交换了角色。

VITA以Mixtral 8×7B作为语言模型的基础,通过三个主要阶段的训练来达成多模态和交互能力:

  1. 双语指令微调

    。研究人员首先扩展了Mixtral 8×7B的词表,从32,000扩展到51,747,目的是增强中文理解能力。然后用500万条高质量的双语文本语料进行指令微调,让模型在中英文上都表现亮眼。

  2. 多模态对齐

    。这一阶段的目标是缩小文本与其他模态(视频、图像、音频)之间的表示差距。视觉编码器用的是InternViT-300M-448px,通过动态分块策略来处理高分辨率图像输入。对于视频,则根据长度采样4到16帧。研究人员收集了大量高质量的多模态数据用于训练,涵盖图像描述、问答、OCR、图表理解、视频描述和问答等多个任务。

  3. 多模态指令微调

    。最后阶段,构建了精心设计的多模态指令数据集,教模型遵循文本或音频指令来理解图像或视频。还引入了状态标记来区分不同类型的输入查询,为后续的多模态人机交互打下基础。

Fig 3:VITA的训练流程。第一阶段,通过扩大词汇表并利用高质量的双语文本语料库对Mixtral 8×7B进行

指令微调

,让模型熟练掌握中英文。第二阶段

多模态对齐

,将各个编码器与LLM连接起来,处理各种模态。通过大量高质量的多模态数据,将文本特征空间与视频、图像、音频的特征空间对齐。最后阶段的

多模态指令微调

,让模型遵循文本或音频指令来理解图像或视频。此外,专门设计的状态token用于区分输入查询的类型,为后续的多模态人机交互铺路。

训练数据和方法

研究人员为VITA收集和构建了大量高质量的训练数据:

  1. 图像相关任务

    :使用了ShareGPT4V、Alla va-Caption、ShareGTP4o-Image等数据集,还补充了中文图像描述数据。

  2. 图像问答

    :采用LLaVA-Mixture-sample、Lvis-Instruct、ScienceQA等数据集,并生成了额外的中文问答数据。

  3. OCR和图表任务

    :使用Anyword-3M、ICDAR2019-LSVT、ICDAR2017-RCTW、Open-Chart等数据集,并生成了补充数据。

  4. 视频任务

    :使用ShareGemini数据集进行视频描述,并重新标注了Video-ChatGPT和VideoChat2的数据用于视频问答。

  5. 纯文本数据

    :从500万条纯文本数据中采样80万条,以维持模型的文本理解能力。

在数据处理方面,采用了数据拼接策略,将纯文本和图像数据的上下文长度统一为6000个token,以提高训练效率。

多模态对齐

视觉模态

  • 视觉编码器

    :使用InternViT-300M-448px作为视觉编码器,该编码器接收448×448的图像作为输入,通过一个简单的两层MLP视觉连接器生成256个词元。对于高分辨率图像输入,通过动态补丁策略来捕捉局部细节。视频被视为图像的特殊情况来处理:如果视频长度小于4秒,均匀采样4帧;如果视频长度在4到16秒之间,每秒采样一帧;超过16秒的视频,则均匀采样16帧。为防止引入过多视觉词元,不对视频的单个帧执行动态补丁。

  • 视觉对齐

    :在视觉对齐阶段,仅训练视觉连接器。使用的训练数据(不包括纯文本SFT部分)汇总在表1中。此外,这个阶段不使用音频形式的问题。

值得注意的是,在多模态指令微调阶段,从500万个纯文本数据中采样80万个条目,以维持LLM的文本理解能力。这个操作是在多模态指令微调阶段进行的,而不是视觉对齐阶段,因为后者的LLM参数是固定的。

  • 对于一般的图像描述任务,引入了ShareGPT4V中由GPT-4V生成的数据,确保数据质量。此外还引入了Alla va-Caption和ShareGTP4o-Image数据集,并补充了一些由现有MLLM生成的中文图像描述。

  • 对于一般的图像问答任务,初步收集了三个数据集:LLaVA-Mixture-sample、Lvis-Instruct和ScienceQA。使用现有的MLLMs生成了额外的21.8K中文QA数据。同时,从LLaVA-150K数据集中移除了标题子集,并将其余部分翻译为中文。

  • 对于OCR和图表任务,引入了Anyword-3M、ICDAR2019-LSVT、ICDAR2017-RCTW、Open-Chart(包括ChartQA、DVQA、InfoVQA、Pew和OpenCQA)数据集,以及一些由现有MLLMs从其他开源数据中生成的合成数据。对于Anyword-3M,选择答案文本长度在20到50之间的数据,问题要求识别图像中的文本。对于ICDAR2019-LSVT、ICDAR2017-RCTW和Open-Chart,使用现有MLLMs生成详细的描述和QA对。

  • 对于一般的视频描述任务,使用ShareGemini数据集。

  • 对于一般的视频QA任务,使用现有MLLMs重新标注了Video-ChatGPT和VideoChat2。

  • 数据拼接

    :对于纯文本数据和图像数据,目标是将上下文长度拼接到6K token,如下图所示。拼接数据的数量对应表1中的拼接条目列。

Fig 4:不同的文本数据直接拼接到6K个token。图像首先被分成多个局部patches,然后不同的图像-文本对被对应拼接起来。视频数据直接逐帧采样作为输入,无需拼接。通过这种方式,可以统一不同训练batch中的数据长度,从而提高训练效率。

拼接不同数据带来了两个好处:

  • 支持更长的上下文长度,使得从单图像问答扩展到多图像问答交互成为可能,实现更灵活的输入形式和延长的上下文;
  • 提高了计算效率,因为视频帧通常包含大量视觉词元。通过拼接图像-问题对,在训练批次中保持了词元数量的平衡,从而提高了计算效率。此外,实验发现,使用拼接数据训练的模型在性能上与未拼接数据的模型表现相当。

音频模态

  • 音频编码器

    :输入音频首先通过Mel滤波器,将音频信号分解为Mel频率尺度上的各个频带,模拟人类对声音的非线性感知。随后,使用4层CNN下采样层和24层的transformer,共计341M参数,处理输入特征。采用简单的两层MLP作为音频-文本模态连接器。最终,每2秒的音频输入被编码为25个token。

  • 音频对齐

    :在对齐任务中,选择自动语音识别(ASR)。使用的数据集包括Wenetspeech,该数据集涵盖了超过10,000小时的多领域语音识别数据(主要集中在中文)。类似地,Gigaspeech也包含10,000小时的高质量音频数据,大部分用于英语语音识别任务。另一个任务是音频字幕生成,依赖于Wa vcaps的AudioSet SL子集,该数据集包含400K个音频片段及其对应的音频字幕。在对齐过程中,音频编码器和连接器都进行了训练。

多模态指令微调

在这一阶段,对模型进行指令微调,增强其对文本和音频指令的遵循能力。

训练数据

  • 数据构建

    :指令微调阶段的数据来源与对齐阶段相同(见表1),并进行了如下改进:

  • 音频问题替换

    :使用TTS技术(如GPT-SoVITS)将大约一半的问题随机替换为其音频版本,以提升模型对音频查询的理解能力和指令遵循能力。音频版问题和文本版问题的数量见表1。
  • 系统提示设置

    :设置不同的系统提示,避免不同类型数据之间的冲突(见表2)。例如,有些问题可以基于视觉信息或模型自身知识进行回答,这就可能产生冲突。此外,由于图像数据的patch类似于视频数据的多个帧,可能会让模型感到困惑。系统提示可以明确区分不同的数据类型,使其更容易理解。

  • 噪声音频构建

    :在人机交互过程中,并非所有的音频输入都需要响应,这些被称为噪声音频。一个具有良好交互能力的系统应能主动识别音频类型,并有选择地执行后续输出。为此,需要构建各种噪声音频样本供模型识别。具体操作是:从现有的多模态和单模态QA数据中随机抽取474K个句子。这些负样本文本集中在不需要用户响应的非查询相关内容上,其长度分布与正向问题的长度分布一致。然后,使用TTS工具将这些句子转换为音频。噪声音频样本的构建使模型能够识别不需要响应的音频输入,这有助于实现非唤醒交互。具体的训练策略将在下文中详细说明。

训练流程

根据上述构建的QA对,模型需要区分三种类型的查询:

  • 查询音频

    :问题由音频发起。
  • 噪声音频

    :输入为音频,但不包含问题。
  • 查询文本

    :问题由文本发起。

基于这些查询类型,设计了三种状态token:<1><2><3>。在训练阶段,在答案的开头插入对应的状态token,使模型能够灵活处理不同的交互行为。

  • 状态token <1> 表示问题输入为查询音频。此时,模型的输出需要以文本或通过TTS工具转换的语音形式呈现给用户。

  • 状态token <2> 表示问题输入为噪声音频。模型应输出EOS token作为终止符。然而,训练过程中发现,突然终止输出可能会显著降低性能。因此,将噪声音频对应的文本发送给LLM,并使用其输出文本作为训练目标。在推理过程中,<2> 作为另一种特殊的EOS标记。

  • 状态token <3> 表示问题为纯文本,用于在训练集中区分前两种查询。

在训练过程中,视觉和音频编码器保持冻结状态,而连接器与Mixtral 8×7B一起进行训练。

部署和工程优化

为了实现VITA的高效交互功能,研究人员进行了大量的工程优化:

  1. 双工部署方案

    :同时部署两个VITA模型,一个负责生成响应,另一个持续监控环境输入。
  2. 多模态vLLM适配

    :优化了vLLM框架以支持VITA的多模态处理需求。
  3. 状态token设计

    :引入不同的状态标记来区分有效查询音频、噪声音频和查询文本,实现无唤醒交互。
  4. 历史上下文聚合

    :在音频打断时,模型能够聚合历史上下文来响应最新查询。

非唤醒交互

非唤醒交互意味着模型可以在不需要唤醒词或按钮的情况下被激活,并对环境中的用户音频问题做出回应。部署过程必须满足以下要求:

  • 实时跟踪环境声音

    :这涉及确定音频内容是否属于人类语言。
  • 过滤噪声音频

    :模型应仅对有效的用户查询音频作出响应。

对于第一个要求,现有的语音活动检测(VAD)可以提供帮助。VITA使用SileroVAD,该系统经过大规模语料库训练,涵盖超过6,000种语言,并且能够在各种背景噪声下表现良好。对于第二个要求,利用前面介绍的状态token <2>。这使模型能够自动区分输入音频是否为有效查询。如果输入为非查询类型,模型将直接终止推理,从而仅对查询类型的输入作出响应。

音频中断交互

音频中断交互允许用户随时用新问题打断模型的生成过程。为实现这一点,部署环境必须满足以下要求:

  • 实时跟踪和过滤外部查询

    :在生成响应的同时,系统必须实时跟踪和过滤外部查询。
  • 回答新问题

    :当出现新问题时,系统必须停止当前生成,整合历史上下文,并对当前查询作出回应。

评估

从语言、音频、多模态三个方面来衡量VITA的最终效果。语言方面,使用的评测集包括C-EVAL、AGIEVAL、MMLU和GSM8K;音频方面,使用的是Wenetspeech和Librispeech;多模态方面,使用的是MME、OCRBench、HallusionBench和Video-MME。具体的评估结果,这里就不一一展开了,感兴趣的话可以直接看原论文。

总结

VITA作为一个开源的全模态交互式大语言模型,其学术和实践意义都很显著:

  1. 推动开源MLLM发展

    :VITA是首个同时支持视频、图像、文本和音频处理的开源MLLM,为开源社区提供了宝贵的参考。
  2. 探索自然交互

    :在无唤醒交互和音频打断方面的创新,为提升MLLM的交互体验指明了方向。
  3. 促进多模态融合

    :展示了如何在一个统一的框架内实现多模态信息的端到端处理。
  4. 开放研究资源

    :完全开源为后续研究提供了重要的基础设施。

不过,虽然VITA在多模态理解和交互方面取得了显著进展,但与闭源模型比如GPT-4o相比,仍然存在差距。研究团队也指出了未来的工作方向:

  1. 进一步提升模型的多模态理解能力,特别是在复杂场景和长文本理解方面。
  2. 增强模型的推理和创造能力,使其能够处理更加开放和具有挑战性的任务。
  3. 优化交互体验,探索更多创新的人机交互方式。
  4. 提高模型的效率和部署友好性,使其更易于在实际应用中落地。
  5. 持续扩展训练数据和任务类型,使模型具备更广泛的知识和技能。

总的来说,VITA代表了开源多模态大语言模型的一个重要里程碑。它不仅从技术角度推动了MLLM的发展,也为开源社区探索自然、智能的人机交互开辟了新的方向。随着VITA的持续优化和社区的共同努力,有理由期待在不久的将来,开源MLLM能在功能和性能上真正媲美甚至超越闭源商业模型,为人工智能的普及和应用带来更多可能性。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc