热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >登顶Top2!MiniCPM-V 8B新版本:GPT-4V水准小钢炮,8G显存,4070轻松推理!

登顶Top2!MiniCPM-V 8B新版本:GPT-4V水准小钢炮,8G显存,4070轻松推理!

来源:互联网 更新时间:2026-08-07 14:36

时隔1个月,面壁“小钢炮”MiniCPM系列迎来了又一次更新——**MiniCPM-Llama3-V 2.5 8B**正式登场。作为端侧多模态模型的新标杆,这次发布的模型延续了小钢炮系列的核心优势:高清图像识别(1344×1344分辨率)和强大的OCR能力。而在8B参数规模下,它依然带来了一系列值得关注的突破。 - **最强端侧多模态综合性能**:超越Gemini Pro、GPT-4V这些“巨无霸” - **OCR能力SOTA**:180万像素更清晰,难图、长图、长文本都能精准识别 - **量化后仅需8G显存**:4070显卡即可轻松推理,手机端能以6-8Tokens/s的速度高效运行 - **图像编码快了150倍**:首次在端侧实现系统级多模态加速 - **支持30+种语言** 发布后,MiniCPM-Llama3-V 2.5迅速登顶HuggingFace热度榜Top2,与Meta、微软、谷歌等科技巨头一同从全球66万模型中脱颖而出。目前,MiniCPM-V系列下载量已超过13万,GitHub星标突破2K。 ▲ 新版MiniCPM-V小钢炮再次登顶Hugging Face趋势榜单Top2 --- 从OpenAI发布GPT-4V以来,多模态大语言模型的发展速度可以用“日新月异”来形容。开源社区的快速迭代,加上模型性能与参数规模之间呈现出的那种类似摩尔定律的趋势,正在重塑整个技术格局(如图1):**达到GPT-4V水平的模型,其参数规模正在随着时间推移逐步缩小**。这或许可以称之为多模态大模型时代的“摩尔定律”。 ▲ 图1. GPT-4V级别模型参数规模逐渐缩小,终端算力逐渐增强 与此同时,手机、电脑等终端设备的算力也在持续增强。两个趋势叠加,让多模态大模型正全面走向端侧,拓展了更多应用场景。借助高效多模态训练技术,MiniCPM-V系列推出了全新的MiniCPM-Llama3-V 2.5。沿着这条多模态大模型的摩尔定律轨迹,它将此前需要26B参数才能达到的GPT-4V级别能力,压缩到了8B。通过一系列终端优化技术,MiniCPM-Llama3-V 2.5首次在端侧实现了GPT-4V级的多模态能力。 ### 效果展示 MiniCPM-Llama3-V 2.5的亮点可以概括为以下几个方面: 1. **领先的性能**:8B参数规模下,超越了GPT-4V-1106、Gemini Pro等主流商用闭源多模态大模型。 2. **优秀的OCR能力**:OCRBench得分达到725,超越GPT-4o、GPT-4V、Gemini Pro、Qwen-VL-Max等商用闭源模型,达到最佳水平。 3. **多语言支持**:支持德语、法语、西班牙语、意大利语、俄语等30多种语言的多模态能力,多语言对话表现良好。 4. **可信行为**:在Object HalBench上的幻觉率降低到10.3%,显著低于GPT-4V-1106(13.6%),达到开源社区最佳水平。 5. **高效部署**:通过模型量化、CPU、NPU、编译优化等技术,实现高效的终端设备部署。 下面通过具体示例来展示它的实际能力。 首先,MiniCPM-Llama3-V 2.5的OCR能力出色,可以对英文文章截图进行内容提取: ▲ 图2:中文长图理解样例 它对非常规长宽比的图像输入也能很好地理解,比如对手机长截图进行总结: ▲ 图3:中文长图理解样例 密集表格数据也能直接转化为对应的Markdown格式: ▲ 图4:中文表格转Markdown样例 复杂流程图同样不在话下,可以分点解释: ▲ 图5:英文复杂推理样例 为了更直观地展示效果,团队提供了一些在小米14 Pro上的录屏样例。比如,模型能够针对输入的食物营养结构图进行分析,并据此设计复杂的饮食计划: ▲ 图6:英文复杂推理实时样例(2倍速播放) 高铁车票的信息提取和提问也毫无压力: ▲ 图7:中文OCR实时样例(2倍速播放) 最后,多语言对话能力同样让人印象深刻: ▲ 图8:多语言对话样例(2倍速播放) ### 实验结果 #### 1. 多模态基础能力评测 ▲ 表1:主流多模态基准下的评测结果 在一系列主流多模态数据集上,MiniCPM-Llama3-V 2.5表现出色(表1)。OpenCompass分数涵盖MME、MMB、MMMU等11个主流多模态数据集的综合指标,可以作为总评价指标。在这项评测中,MiniCPM-Llama3-V 2.5取得了最高的65.1分,超越了闭源模型Gemini Pro和GPT-4V(2023.11.06)。 与其他三个基于Llama-3 8B的开源模型相比,MiniCPM-Llama3-V 2.5的优势也很明显。以LLaVA-NeXT Llama-3 8B为例,MiniCPM-Llama3-V 2.5在各项评测基准上均实现了3个点以上的提升。更值得注意的是,它的视觉编码结果数量范围只有96-960 tokens,远小于LLaVA-NeXT的1728-2880 tokens,计算开销大幅降低。 #### 2. OCR能力评测 ▲ 表2:OCR能力基准的评测结果 在场景文字理解方面,MiniCPM-Llama3-V 2.5同样表现优异。从表2可以看到,它在OCRBench上取得了最优效果,在TextVQA和DocVQA上与Gemini Pro、GPT-4V的结果也颇具竞争力。 #### 3. 多语言能力评测 如图9所示,与Yi-VL-34B相比,MiniCPM-Llama3-V 2.5在多语言对话方面表现更优: ▲ 图9:多语言LLaVABench评测结果 ### 终端优化 ▲ 图10:手机芯片视觉编码效率(448×448图片输入)和部署框架 与云端服务器不同,手机等终端设备的大模型部署受限于有限的内存(如12-16GB)和较慢的芯片处理速度(如8核CPU)。为了让多模态大模型在手机端运行更流畅,MiniCPM-Llama3-V 2.5系统地采用了模型量化、CPU、NPU、编译优化等高效加速技术。 如图10所示,CPU是目前手机设备中最普及的芯片类型。为了保证兼容性,MiniCPM-Llama3-V 2.5主要使用CPU进行语言模型部分部署。通过4比特量化和llama.cpp框架的配合,**实现了每秒8-9 tokens的语言模型编码速度和每秒3-4 tokens的解码速度**。 但手机端多模态大模型部署的图像编码方案依然极具挑战。如果不采取任何优化,一张448×448分辨率图片的编码通常需要45秒。经过手机端编译优化、显存整理等一系列优化,MiniCPM-Llama3-V 2.5将CPU编码延迟降低到了5秒左右。对于高通芯片的移动手机,它还首次将NPU加速框架QNN整合进了llama.cpp。经过系统优化后,**多模态大模型端侧图像编码实现了150倍加速的显著提升(45秒→0.3秒)**。 ▲ 图11:模型架构及视觉编码 ### 模型构建 MiniCPM-Llama3-V 2.5的模型架构和训练方式大致如下。 #### 1. 模型架构 如图11所示,模型包含三个组成部分:(1) 视觉编码器:SigLIP-400M;(2) 压缩层:perceiver resampler结构;(3) 语言模型:Llama-3 8B。 为应对输入图片的高分辨率和变长宽比问题,模型采用了LLaVA-UHD论文提出的自适应视觉编码方法。每张输入图片会根据其大小和长宽比计算最优切片方式,每个切片再根据ViT的预训练分辨率进行调整,最后送入视觉编码器。 #### 2. 模型训练 训练采用了多阶段方法,包括预训练、有监督微调和基于AI反馈的对齐训练。 预训练阶段的主要目标是利用大量网络图文对(约500M)对齐视觉和语言部分。为提高训练效率,这一阶段固定了语言模型参数,仅对视觉部分进行训练。 监督微调阶段,使用VQA、文档理解等多种高质量数据,来学习精准的多模态理解能力。同时,基于VisCPM提出的多模态能力跨语言泛化技术,仅通过轻量级的多语言指令微调,就完成了30多种语言的多模态能力泛化。 最后,采用RLAIF-V技术,通过基于AI反馈的对齐训练来进一步提高模型的可信回答能力。这一阶段,模型通过分而治之的思想,对不同描述进行AI打分,并基于分数高低构建偏好数据集,进行DPO优化。 --- ### 总结 作为面壁小钢炮系列的最新模型,MiniCPM-Llama3-V 2.5在主流评测基准上达到了GPT-4V级别的多模态综合性能,拥有出色的OCR能力、任意长宽比高清图理解能力、可信回答能力和多语言交互能力。通过一系列端侧优化技术,它可以在手机端高效运行。MiniCPM-Llama3-V 2.5展示了端侧多模态大模型的巨大潜力。可以预见,在不久的将来,会有更多更强大的模型出现在用户移动端,提供可靠、安全的智能服务,提升生活和工作效率,惠及更多应用场景。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc