来源:互联网 更新时间:2026-08-02 07:13
聊个新鲜出炉的大事儿——微软又放出一个小模型,Phi-4。140亿参数,仅用40%的合成数据,数学性能直接超越了GPT-4o。这话听着是不是有点夸张?但36页的技术报告已经出来了,数据摆在明面上,由不得人不信。
在GPQA和MATH这两个硬核基准上,Phi-4的数学能力不仅碾压了GPT-4o、Gemini Pro 1.5,还顺便把同级别的其他小模型给“秒了”。甚至和Llama-3.3-70B-Instruct这样的大模型掰手腕,也丝毫不落下风。

更令人咋舌的是,在2024年的ACM数学竞赛问题上,Phi-4的准确率达到了91.8%。连Phi系列的前负责人Sebastien Bubeck看到这个结果后都忍不住感叹。

下面这个例子很直观,展示了Phi-4在数学推理上的“又快又准”。

这次Phi-4延续了Phi系列的核心思路——依旧是在教科书级别的“合成数据”上完成训练。

但除了合成数据,Phi-4这次还实现了三大核心技术突破:精选的原生数据、领先的后训练技术,以及DPO中的关键token搜索(Pivotal Tokens Search)。可以说,Phi-4的成功,也从侧面间接回应了行业里关于“数据墙”的争议。

目前,新模型已在微软Azure AI Foundry上提供,下周也会在HuggingFace上线,值得关注。
Phi-4和大多数只在网络内容或代码上预训练的语言模型不太一样。它很有策略地把合成数据贯穿到了整个训练过程中。
之前的Phi系列模型,能力主要来源于“蒸馏”,也就是从GPT-4这样的教师模型那“偷师”。但这次Phi-4在STEM领域的问答能力上,已经显著超越了它的“老师”。这说明,高质量的数据生成和后训练技术,比单纯的模型蒸馏能带来更实质性的提升。

论文地址:https://arxiv.org/abs/2412.08905
Phi-4的核心竞争力主要来自三方面:预训练和中训练的合成数据、高质量有机数据的筛选与过滤、以及后训练。因为有了这些创新,Phi-4在推理类任务上的表现,足以和比它大得多的模型一较高下,甚至在某些领域已经超越了Llama-3.1-405B。
从表1就能看得很清楚:在GPQA(研究生级别STEM问答)和MATH(数学竞赛)这两个“地狱级”的基准中,Phi-4的成绩全面碾压了它的老师GPT-4o。

表1 Phi-4在经典基准测试上的表现
为了验证Phi-4有没有“刷题”或者数据污染,研究者专门拿2024年11月的AMC-10和AMC-12数学竞赛题来测试它。这两场比赛的数据在训练时从未出现过,所以成绩能真实反映模型的泛化能力。结果呢?虽然只有14B参数,但Phi-4的平均得分大幅超过了它的老师GPT-4o。

Phi-4在数学竞赛问题上优于许多更大的模型,包括Gemini Pro 1.5
合成数据构成了Phi-4训练数据的“大脑袋”。它不是简单地拼凑,而是通过多智能体提示(multi-agent prompting)、自修订工作流(self-revision workflows)和指令反转(instruction reversal)等多种技术生成的。这些方法能构建出促使模型具备更强推理能力的数据集,弥补了传统无监督数据的短板。
需要强调的是,合成数据并不是有机数据的廉价替代品。它有几个非常硬核的优势。
在有机数据里,token之间的关系很复杂,模型需要费很大劲才能从A推理到B。但合成数据不同,因为它本身就是语言模型一个词一个词“算”出来的,逻辑链条非常清晰,这种结构化的token能让模型的训练效率大幅提升。
合成数据能帮助模型绕开一些“坑”。比如网络论坛有自己的说话风格,但人们跟大模型聊天是另一种画风。如果你直接拿论坛数据训练,模型可能就会“懵”,它会把论坛里的某些特殊表达当成常态,导致在实际对话中“驴唇不对马嘴”。合成数据会把这些内容改写成适合LLM聊天的风格,让模型在推理时能“对号入座”。
在后训练阶段,合成数据同样发挥了关键作用,通过拒绝采样和DPO等新方法,进一步优化了模型的输出。
为了搞定这些数据,研究团队一口气创建了50种不同的合成数据集类型,每种都依赖不同的种子和多阶段提示程序,覆盖了各种主题、技能和交互方式,累计达到了约4000亿个无权重的token。他们通过以下几个关键步骤,确保了这些合成数据的高质量。
后训练数据集主要由两部分组成:
–
–
研究者用这些SFT和DPO数据来缓解模型的“幻觉”。结果如图6所示,这种方法大幅减少了SimpleQA中的幻觉现象。

Phi-4依然是Transformer架构,14B参数,默认上下文长度4096,在训练中期扩展到了16K。预训练后的模型本身不擅长遵循指令,所以直接搞零样本评估意义不大。团队用了一套内部基准,采用对数似然评估(MMLU、MMLU-pro、ARCC)和少量样本提示(TriviaQA、MBPP、MATH、GSM8k)的方法来测试预训练效果。

表2 phi-4较phi-3-medium在预训练后基准测试评估的提升值
在长上下文基准HELMET测试中,Phi-4在召回率、最大上下文等指标上几乎拿下了绝对的领先优势。

正如前文提到的,后训练阶段最关键的技术是“关键token搜索”(PTS)。那它到底是什么呢?
模型在生成答案时,每个token都对应着一段前缀。对于每个前缀,有两个关键因素:一是当前答案正确的条件概率,二是这个token带来的概率增量。
其实,在AI模型做题时,决定答案对错的往往只有少数几个关键token。研究者们发现了一个有趣的现象:当模型在做数学题时,仅仅是生成了一个“negative”这个关键token,就让它原本可能要“翻车”的答案转而走向了成功。紧接着,生成了一个“(a”这个token,又可能让正确率急剧下降。

如果把这个方法和DPO结合起来看,问题就暴露出来了。上图3显示,很多token的概率远低于关键token“negative”的0.31,这些token会产生噪声,稀释来自关键token的有效信号。更糟糕的是,像“(a”这种导致解题不稳定的token,反而会因为它的低概率(0.12)收到强烈的正向学习信号。直觉上,当两个文本内容出现实质性偏差时,再去比较它们各自下一个token的概率,已经没什么意义了。真正有价值的信号,应该来自文本开始偏离的那个节点。
为了解决这个问题,微软团队提出了“关键token搜索”(PTS)。这个方法专门针对单个关键token生成偏好数据,让DPO的优化效果精准打在“七寸”上。PTS的核心任务,就是在完整的token序列中找出那些对成功率有显著影响的token位置。它会将这些关键token转化为训练数据:把问题加上关键token之前的前缀作为查询基准,再把能提高或降低成功率的单个token分别作为“接受”和“拒绝”的样本。
PTS的二分查找算法虽然不能保证找出所有关键token,但它有两个重要特性:第一,找到的一定是关键token;第二,如果成功概率在解题过程中是接近单调变化的,那就能找出所有关键token。
下图5是PTS生成的偏好数据示例。

在数学问答中,研究者发现一个有趣的现象:关键token往往不是明显的错误,而是引导模型走向不同解题路径的“分岔口”。比如方法A是“分别乘以分母”,方法B是“直接交叉相乘”。虽然数学上都正确,但对模型来说,后者通常更稳健。而PTS生成的数据,正好能帮助Phi-4在这些关键决策点上做出更优的选择。
正是这些技术上的创新,让Phi-4在各个基准测试中表现惊艳。回到表1,与同级别的Qwen-2.5-14B-Instruct相比,Phi-4在12个基准测试中赢了9个。而且研究团队认为,Phi-4在SimpleQA上的表现实际上比Qwen更好。之所以Score看起来不高,是因为基础模型在SimpleQA上的分数确实比对手高,但团队在后训练中为了优化用户体验,有意调整了行为,而不是一味追求高分数。

在STEM问答任务上,Phi-4的实力尤其突出。在GPQA研究生级问题和MATH数学竞赛上,它甚至超过了老师GPT-4o。编码能力方面,在HumanEval和HumanEval+上,它也拿下了比任何其他开源模型(包括更大的Llama模型)更高的分数。
当然,Phi-4也不是神。它在SimpleQA、DROP和IFEval上表现一般。对于前两个问题,研究人员认为那些报告的数值过于简化,不能准确反映真实表现。但IFEval确实暴露了Phi-4的一个真实弱点——在严格遵循指令上还有困难。
团队相信,在下一步研究中,通过更有针对性的合成数据,Phi系列的指令跟随性能会得到显著改善。那么问题来了,下一个Phi系列的小模型会是什么样?坦白说,还挺让人期待的。
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
忍者必须死3极刃血影角色介绍
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
余姚的路虎4s店在哪个位置
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
合集38个项目筹集5.406亿美元 Figure融资2亿
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc