热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >微软「小而美」系列三连发!视觉小钢炮PK GPT-4o,MoE新秀力压Llama 3.1

微软「小而美」系列三连发!视觉小钢炮PK GPT-4o,MoE新秀力压Llama 3.1

来源:互联网 更新时间:2026-08-24 13:44

微软的Phi系列小模型家族又悄悄放了个大招——Phi 3.5版本正式上线,一口气端出三款新模型:38.2亿参数的

Phi-3.5-mini-instruct

、419亿参数的

Phi-3.5-MoE-instruct

和41.5亿参数的

Phi-3.5-vision-instruct

三款模型均已在Hugging Face开放下载、使用和微调,并且拿到了微软的MIT许可证——这意味着可以不受限制地进行商业应用和修改,诚意满满。别看参数规模不大,在不少第三方基准测试里跑出来的成绩却很亮眼:有的地方甚至把谷歌的Gemini 1.5 Flash、Meta的Llama 3.1按在地上摩擦,个别竞技场上连OpenAI的GPT-4o都被拉下了马。

性能能打,许可证又宽松,网友们在社交网络上纷纷试用并点赞。接下来,我们结合Hugging Face的发行说明,把这三位选手各自的本事拆开看看。

Phi-3.5-mini-Instruct:小而美

模型地址:https://huggingface.co/microsoft/Phi-3.5-mini-instruct

延续Phi系列“小而美”的路线,这款轻量级模型基于Phi-3的数据集构建,38亿参数,支持128K token的上下文长度。训练用了512块H100-80G GPU,耗时10天,啃完3.4万亿个token。

它的定位非常明确:给内存或算力受限的设备用。虽然资源有限,但推理能力不减——代码生成、数学推理、逻辑任务都能搞定。默认使用Flash Attention,实测在NVIDIA V100甚至更早的GPU上就能跑通。

多语言

尺寸紧凑,多语言能力却很能打。支持阿拉伯语、中文、英语、芬兰语、法语、德语等23种语言。下表显示了Phi-3.5-mini在多语言MMLU、MEGA和MMLU-pro上的表现——即便只有3.8B参数,在多语言任务上面对更大参数的模型也毫不逊色。

长上下文

128K上下文长度让它可以处理长文档/会议摘要、长文档QA、长文档信息检索。在衡量长上下文代码理解的RepoQA基准中,它直接超过了Llama-3.1-8B-instruct和Mistral-7B-instruct——小个子照样能办大事。

Phi-3.5-MoE-instruct:首款MoE

模型地址:https://huggingface.co/microsoft/Phi-3.5-MoE-instruct

这是微软Phi系列里第一个MoE(混合专家)模型。简单说,就是把多个“专家”子模型组合在一起,每个负责不同的任务,需要时再动态激活。架构上看,420亿参数,实际运行时只有16×3.8B参数,但只激活其中6.6B参数——很聪明地做到了“大而不臃肿”。

训练用了512个H100-80G GPU,23天,啃下4.9万亿个token,同样支持128K上下文长度。MoE版本专注于处理高质量、推理密集的数据,在代码、数学和多语言理解上尤其有优势。

而且优化过程做得很扎实:监督微调、近端策略优化、直接偏好优化三管齐下,确保指令遵循的精确性和安全性。

专业学科

既然是处理专业任务的架构,那它在专业学科领域的表现值得重点看看。在5个样本的MMLU(大规模多任务语言理解)上,Phi-3.5-MoE直接压过了GPT-4o mini——STEM、人文、社会科学,覆盖面很全。这种组合架构让它跨语言也能处理复杂任务,保持高质高效。

Phi-3.5-vision-instruct:视觉多模态

模型地址:https://huggingface.co/microsoft/Phi-3.5-vision-instruct

前面两个都是纯文本选手,这一位则集成了文本和图像处理能力。在256个A100-80G GPU上训练6天,啃完5000亿个token。特别适合做图像理解、光学字符识别、图表/表格理解以及视频摘要这类任务。同样支持128K上下文,能处理复杂的多帧视觉任务。

微软强调,训练数据是合成数据与过滤后的公开数据集结合,重点放在了高质量、推理密集的数据上。

视觉任务

Phi-3.5-vision的核心场景是多帧图像理解和推理——比如详细的图像对比、多图像摘要、视频摘要,这些在办公场景里应用很广。测试下来,大多数图像基准都有提升:MMMU从40.2涨到43.0,MMBench从80.5升到81.9,文档理解基准TextVQA从70.9提到72.0。

在现有多图像基准比较中,平均看Phi-3.5-vision在同尺寸模型里跑得最好,多帧功能和视频摘要甚至能和更大体量的模型掰手腕。

还有一个叫BLINK的基准测试,包含14项人类一眼就能搞定、但对大模型仍然很难的视觉任务。Phi-3.5-vision不仅每项小分都更高——比如艺术风格识别87.2、法医学鉴定92.4——总分上还超过了Gemini-1.5-Flash、GPT-4o-mini和Claude-3.5-Sonnet。

视频理解方面,Video-MME基准测试评估了模型对不同时长视频的处理能力。虽然和领先者相比还有进步空间,但得分基本都超过了InternVL模型——一个不错的起点。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc