热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Llama 3.1 405B 中文基准评测出炉!推理总分80.44,略超GPT-4 Turbo,不敌GPT-4o

Llama 3.1 405B 中文基准评测出炉!推理总分80.44,略超GPT-4 Turbo,不敌GPT-4o

来源:互联网 更新时间:2026-08-19 14:18

7月23日,Meta正式发布了

Llama 3.1 405B

,并高调宣称这是“世界上最大、功能最强大的开源基础模型”。128K的上下文长度、支持八种语言,再加上在常识、可操纵性、数学、工具使用和多语言翻译等方面的表现,Meta直接对标的是

GPT-4、GPT-4o、Claude 3.5 Sonnet

这些闭源巨头。开源模型能做到这个份上,确实让人眼前一亮。

不过,中文社区最关心的是:这模型在中文场景下到底行不行?我们决定亲自下场,针对中文推理相关的核心任务做了一轮深度测评。具体来说,用了两套自建的基准:一套是中文数学多步推理基准(

SuperCLUE-Math6

,含2024道题),另一套是中文等级化代码单元测试基准(

SuperCLUE-Code3

,含1560个测试用例),重点评估数学和编程两个维度的能力。

先说结论

结论1:在SuperCLUE推理任务的总分上,Llama 3.1 405B拿到

88.44分

,超过了GPT-4 Turbo,仅次于GPT-4o,暂列排行榜第二。这个位置很有分量,毕竟对手都不是省油的灯。

结论2:数学专项方面,模型在SC-Math6上得分

91.19分

,判定为推理等级5。与GPT-4o的差距只有0.58分,几乎可以忽略不计,领先其他所有模型。数学推理这块,它已经站到了第一梯队。

结论3:代码专项方面,SC-Code3得分

69.68分

,接近70分大关。比GPT-4 Turbo高了0.11分,但和GPT-4o还有2分左右的差距。编程能力够用,但还没到顶尖。

测评结果

SuperCLUE-Math6

SuperCLUE-Code3

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc