热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >阿里开源的32B大模型到底强在哪里?

阿里开源的32B大模型到底强在哪里?

来源:互联网 更新时间:2026-07-31 14:02

阿里巴巴最近开源了一个320亿参数的大语言模型Qwen1.5-32B,网上都说很强很强,那么它到底强在哪里呢?

更高的性价比

Qwen1.5-32B中的B是billion,也就是10亿,32B就是320亿参数量。阿里之前还开源过Qwen-1.5-72B,720亿参数。相比之下,新模型参数少了一半多,可实际测试成绩却几乎没掉队。

大语言模型文件里主要就是参数。参数少一半,文件大小也小一半,加载到显存时占用的空间自然也跟着减半。现在显卡有多紧俏?消费级的3090大概要8K,4090已经飙到1.5个W了。显存占用少一半,意味着可以用更少、更低显存的显卡,成本直接降下来,但模型表现和之前的大块头差别不大——这才是真正的性价比。

性能测试优良

上面说测试表现不错,那么到底体现在哪?拿下面这张测试结果图表来说:

很多人看这类图表时比较懵,主要就看谁的分数高。这里把几个关键指标的含义拆解一下:

  • MMLU

    (Massive Multitask Language Understanding):多领域知识理解,考的是综合能力。涵盖57个不同领域的选择题,包括历史、文学、科学、工程技术等,用来评估模型的泛化能力——解决没训练过的新问题。

  • CMMLU

    :中文场景的多领域知识理解,由MBZUAI、上海交通大学、微软亚洲研究院推出。67个主题,涉及自然科学、社会科学、工程、人文及常识,专门评估模型在中文语境下的知识和推理能力。

  • C-Eval

    :中文能力评估。上海交通大学、清华大学和爱丁堡大学联合推出,包含13948道多选题,覆盖52个学科和四个难度级别。

  • GSM8K

    :数学问题解决能力。Google开发的数学题集,约8000个高中到大学水平的数学问题。

  • MATH

    :类似GSM8K,涵盖初等代数、数论、概率、几何、微积分等多个领域,题目用LaTeX格式编写。

  • MBPP

    :数学推理和问题解决能力,需要模型生成数学表达式或文字解答。

  • HumanEval

    :编程能力。OpenAI创建,包含数百个编程题目及其解决方案。

  • BBH

    (Big-Bench Hard):复杂语言理解能力。Google、斯坦福等开发的数据集,包含需要深度推理、常识运用或复杂认知任务。

看懂这些指标后,再看图表:Qwen1.5-32B和Qwen1.5-72B的能力确实相差无几,在复杂语言理解(BBH)上甚至略胜一筹——不知道是不是学习了百度弱智吧的问题。

图表里还有几个模型值得关注:

  • Llama2-34B

    :Meta(Facebook)开源的大模型,可以说国内大模型的百花齐放离不开Llama。但从图表看,这个模型已经落后了,真的是青出于蓝而胜于蓝。

  • Yi-34B

    :零一万物(李开复老师投资)开发的开源模型,300多亿参数,综合能力不错,但数学和解决复杂问题的能力比Qwen差一点。

  • Mixtral-8x7B

    :欧洲公司开发的稀疏专家混合模型。内部有多个子模型,比如有的擅长数学,有的擅长法语,有的擅长代码。生成Token时会选择两个专家子模型(每个6B参数),所以比普通300亿参数模型处理更快。从图表看,它在数学和编程方面的能力挺出色。

很多人关心国内大模型和GPT的差距。这里有一张Qwen1.5-72B和GPT-4的能力对比图:

差距还是很明显的,数学、编程、复杂问题处理等方面都有很大的提升空间。当然我们一直在追赶,只是别人也在进步。有人说这个差距是1年,也有人说是2年,你怎么看?

实测体验

指标不能代表全部。用最近热议的“弱智吧”问题来测一测——弱智吧是百度贴吧,充满荒谬离奇的发言,研究者发现用这里的问题训练模型能提升逻辑能力。

测试使用云服务器上部署的镜像实例,基于开源项目text-generation webui。启动后进入聊天页面,先设置角色为“AI助理”,模式选“chat-instruct”。然后和它聊了三个经典的弱智吧问题。结果只有“生鱼片是死鱼片”这个问题回答得不太好——大模型好像不太理解“生”和“死”在这个语境里的区别。

正常应该怎么回答?到阿里的“通义千问”上问了一下,感觉也没太说到点子上,毕竟师出同门,语料差不多。又找了一个GPT-4的应用问了一下。GPT-4倒是准确把握住了“生”和“死”的含义,只是回答得没那么直接。

在测试数据集评测中,Qwen1.5-32B的中文处理能力明显高于GPT-4,但“生鱼片是死鱼片”这个问题确实没答好。这是模型泛化能力不足,还是训练语料的问题呢?你怎么看?

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc