热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai教程 >微软Phi-4封神,14B小模型数学击败GPT-4o,合成数据占比40%,36页技术报告出炉

微软Phi-4封神,14B小模型数学击败GPT-4o,合成数据占比40%,36页技术报告出炉

来源:互联网 更新时间:2026-08-02 07:13

聊个新鲜出炉的大事儿——微软又放出一个小模型,Phi-4。140亿参数,仅用40%的合成数据,数学性能直接超越了GPT-4o。这话听着是不是有点夸张?但36页的技术报告已经出来了,数据摆在明面上,由不得人不信。

在GPQA和MATH这两个硬核基准上,Phi-4的数学能力不仅碾压了GPT-4o、Gemini Pro 1.5,还顺便把同级别的其他小模型给“秒了”。甚至和Llama-3.3-70B-Instruct这样的大模型掰手腕,也丝毫不落下风。

更令人咋舌的是,在2024年的ACM数学竞赛问题上,Phi-4的准确率达到了91.8%。连Phi系列的前负责人Sebastien Bubeck看到这个结果后都忍不住感叹。

下面这个例子很直观,展示了Phi-4在数学推理上的“又快又准”。

这次Phi-4延续了Phi系列的核心思路——依旧是在教科书级别的“合成数据”上完成训练。

合成数据比例高达40%

但除了合成数据,Phi-4这次还实现了三大核心技术突破:精选的原生数据、领先的后训练技术,以及DPO中的关键token搜索(Pivotal Tokens Search)。可以说,Phi-4的成功,也从侧面间接回应了行业里关于“数据墙”的争议。

目前,新模型已在微软Azure AI Foundry上提供,下周也会在HuggingFace上线,值得关注。

01 数学击败GPT-4o,36页技术报告出炉

Phi-4和大多数只在网络内容或代码上预训练的语言模型不太一样。它很有策略地把合成数据贯穿到了整个训练过程中。

之前的Phi系列模型,能力主要来源于“蒸馏”,也就是从GPT-4这样的教师模型那“偷师”。但这次Phi-4在STEM领域的问答能力上,已经显著超越了它的“老师”。这说明,高质量的数据生成和后训练技术,比单纯的模型蒸馏能带来更实质性的提升。

论文地址:https://arxiv.org/abs/2412.08905

Phi-4的核心竞争力主要来自三方面:预训练和中训练的合成数据、高质量有机数据的筛选与过滤、以及后训练。因为有了这些创新,Phi-4在推理类任务上的表现,足以和比它大得多的模型一较高下,甚至在某些领域已经超越了Llama-3.1-405B。

从表1就能看得很清楚:在GPQA(研究生级别STEM问答)和MATH(数学竞赛)这两个“地狱级”的基准中,Phi-4的成绩全面碾压了它的老师GPT-4o。

表1 Phi-4在经典基准测试上的表现

为了验证Phi-4有没有“刷题”或者数据污染,研究者专门拿2024年11月的AMC-10和AMC-12数学竞赛题来测试它。这两场比赛的数据在训练时从未出现过,所以成绩能真实反映模型的泛化能力。结果呢?虽然只有14B参数,但Phi-4的平均得分大幅超过了它的老师GPT-4o。

Phi-4在数学竞赛问题上优于许多更大的模型,包括Gemini Pro 1.5

02 合成数据的优势

合成数据构成了Phi-4训练数据的“大脑袋”。它不是简单地拼凑,而是通过多智能体提示(multi-agent prompting)、自修订工作流(self-revision workflows)和指令反转(instruction reversal)等多种技术生成的。这些方法能构建出促使模型具备更强推理能力的数据集,弥补了传统无监督数据的短板。

需要强调的是,合成数据并不是有机数据的廉价替代品。它有几个非常硬核的优势。

数据结构化和支持渐进式学习

在有机数据里,token之间的关系很复杂,模型需要费很大劲才能从A推理到B。但合成数据不同,因为它本身就是语言模型一个词一个词“算”出来的,逻辑链条非常清晰,这种结构化的token能让模型的训练效率大幅提升。

将训练与推理上下文对齐

合成数据能帮助模型绕开一些“坑”。比如网络论坛有自己的说话风格,但人们跟大模型聊天是另一种画风。如果你直接拿论坛数据训练,模型可能就会“懵”,它会把论坛里的某些特殊表达当成常态,导致在实际对话中“驴唇不对马嘴”。合成数据会把这些内容改写成适合LLM聊天的风格,让模型在推理时能“对号入座”。

在后训练阶段,合成数据同样发挥了关键作用,通过拒绝采样和DPO等新方法,进一步优化了模型的输出。

03 合成数据的来源

预训练和训练中数据

为了搞定这些数据,研究团队一口气创建了50种不同的合成数据集类型,每种都依赖不同的种子和多阶段提示程序,覆盖了各种主题、技能和交互方式,累计达到了约4000亿个无权重的token。他们通过以下几个关键步骤,确保了这些合成数据的高质量。

种子数据集的构建

1. 网页和代码种子:

从网页、书籍和代码库里淘出高价值的摘录和代码片段。为了保证质量,他们搞了个两段式筛选:先识别高价值页面,再分割成段落,对每个段落的客观内容和推理深度打分。

2. 问题数据集:

从各大网站、论坛和问答平台上收集问题,然后用投票机制平衡难度。具体来说,团队为每个问题生成多个独立答案,用多数投票法判断答案是否一致。一致的(太简单)和完全不一致的(太难或太模糊)都会被淘汰。

3. 从多种来源创建问答对:

利用语言模型从书籍、科学论文等有机来源里提取问答对。这不是简单地找现成的“问和答”,而是通过一个pipeline检测文本中的推理链,识别关键步骤,再重新整合成问题和答案。实验证明,这种方法比直接在原始内容上训练效果更好。

重写和增强:

种子数据会通过多步骤提示流程转化为合成数据,比如把一段有用的内容重写成练习题、讨论题或结构化推理任务。

自我修订:

初始响应会进入一个“死循环”反馈机制——模型根据推理和事实准确性的标准自我评判,然后改进自己的输出。

指令反转用于代码和其他任务:

为了提高模型从指令生成输出的能力,团队“倒着来”:先有代码,再用它生成对应的指令。只有原始代码和根据这个指令重新生成的代码相似度很高时,这条指令才被保留。这样就保证了指令和内容是对应的。

后训练数据

后训练数据集主要由两部分组成:

监督微调(SFT)数据集:

从公开数据集和合成数据中精心挑选用户提示,生成多个模型响应,再用LLM自己当评委选出最佳。

直接偏好优化(DPO):

基于拒绝采样和LLM评估生成偏好数据对,其中一部分是基于关键token对的方法创建的。

研究者用这些SFT和DPO数据来缓解模型的“幻觉”。结果如图6所示,这种方法大幅减少了SimpleQA中的幻觉现象。

04 预训练

Phi-4依然是Transformer架构,14B参数,默认上下文长度4096,在训练中期扩展到了16K。预训练后的模型本身不擅长遵循指令,所以直接搞零样本评估意义不大。团队用了一套内部基准,采用对数似然评估(MMLU、MMLU-pro、ARCC)和少量样本提示(TriviaQA、MBPP、MATH、GSM8k)的方法来测试预训练效果。

表2 phi-4较phi-3-medium在预训练后基准测试评估的提升值

在长上下文基准HELMET测试中,Phi-4在召回率、最大上下文等指标上几乎拿下了绝对的领先优势。

05 后训练

正如前文提到的,后训练阶段最关键的技术是“关键token搜索”(PTS)。那它到底是什么呢?

关键token搜索(Pivotal Token Search)

模型在生成答案时,每个token都对应着一段前缀。对于每个前缀,有两个关键因素:一是当前答案正确的条件概率,二是这个token带来的概率增量。

其实,在AI模型做题时,决定答案对错的往往只有少数几个关键token。研究者们发现了一个有趣的现象:当模型在做数学题时,仅仅是生成了一个“negative”这个关键token,就让它原本可能要“翻车”的答案转而走向了成功。紧接着,生成了一个“(a”这个token,又可能让正确率急剧下降。

如果把这个方法和DPO结合起来看,问题就暴露出来了。上图3显示,很多token的概率远低于关键token“negative”的0.31,这些token会产生噪声,稀释来自关键token的有效信号。更糟糕的是,像“(a”这种导致解题不稳定的token,反而会因为它的低概率(0.12)收到强烈的正向学习信号。直觉上,当两个文本内容出现实质性偏差时,再去比较它们各自下一个token的概率,已经没什么意义了。真正有价值的信号,应该来自文本开始偏离的那个节点。

为了解决这个问题,微软团队提出了“关键token搜索”(PTS)。这个方法专门针对单个关键token生成偏好数据,让DPO的优化效果精准打在“七寸”上。PTS的核心任务,就是在完整的token序列中找出那些对成功率有显著影响的token位置。它会将这些关键token转化为训练数据:把问题加上关键token之前的前缀作为查询基准,再把能提高或降低成功率的单个token分别作为“接受”和“拒绝”的样本。

PTS的二分查找算法虽然不能保证找出所有关键token,但它有两个重要特性:第一,找到的一定是关键token;第二,如果成功概率在解题过程中是接近单调变化的,那就能找出所有关键token。

下图5是PTS生成的偏好数据示例。

在数学问答中,研究者发现一个有趣的现象:关键token往往不是明显的错误,而是引导模型走向不同解题路径的“分岔口”。比如方法A是“分别乘以分母”,方法B是“直接交叉相乘”。虽然数学上都正确,但对模型来说,后者通常更稳健。而PTS生成的数据,正好能帮助Phi-4在这些关键决策点上做出更优的选择。

06 以小博大,Phi-4赢麻了

正是这些技术上的创新,让Phi-4在各个基准测试中表现惊艳。回到表1,与同级别的Qwen-2.5-14B-Instruct相比,Phi-4在12个基准测试中赢了9个。而且研究团队认为,Phi-4在SimpleQA上的表现实际上比Qwen更好。之所以Score看起来不高,是因为基础模型在SimpleQA上的分数确实比对手高,但团队在后训练中为了优化用户体验,有意调整了行为,而不是一味追求高分数。

在STEM问答任务上,Phi-4的实力尤其突出。在GPQA研究生级问题和MATH数学竞赛上,它甚至超过了老师GPT-4o。编码能力方面,在HumanEval和HumanEval+上,它也拿下了比任何其他开源模型(包括更大的Llama模型)更高的分数。

当然,Phi-4也不是神。它在SimpleQA、DROP和IFEval上表现一般。对于前两个问题,研究人员认为那些报告的数值过于简化,不能准确反映真实表现。但IFEval确实暴露了Phi-4的一个真实弱点——在严格遵循指令上还有困难。

团队相信,在下一步研究中,通过更有针对性的合成数据,Phi系列的指令跟随性能会得到显著改善。那么问题来了,下一个Phi系列的小模型会是什么样?坦白说,还挺让人期待的。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc