来源:互联网 更新时间:2026-06-22 10:09
过去,国产模型发布时,大家习惯性贴上的标签无非是“开源第一”或“性价比第一”。但这次,智谱 GLM-5.2 的发布,风向彻底变了。铺天盖地的消息都在说一件事:开源模型已经可以和一流闭源模型正面硬刚了。尤其是在 coding 这个领域,御三家的名单里,现在是 GPT、Claude,再加上智谱。
具体来看,GLM-5.2 在 Design Arena 上直接拿下了第一,Elo 分数高达 1360。
在 BridgeBench BS(抗胡说测试)上也是排名 #1,得分 100.0;推理能力同样排名 #1,得分 42.8。
在 Code Arena: Frontend 中,它排名第二,比 Claude Opus 4.7 (Thinking) 高出 29 分,只落后于 Fable 5。
不过,好奇的是,那位传说中的 Claude Fable 5 现在到底在哪儿发财呢?反正我是用不上。全世界最强的编程模型因为禁令被关停,而 GLM-5.2 却把同一量级的能力开源给了所有人。
当然,榜单归榜单,还是得自己上手测一测。一来是验证模型的实际表现,二来是看看它到底适不适合自己的使用场景。毕竟,每个人的工作流都不一样。这次测试,主要从 coding 和日常任务两个维度展开。废话不多说,直接看结果。
这次 GLM-5.2 一个重要的升级就是支持了 1M 上下文,这个必须得测。直接让它根据一份超长的产品需求文档,生成一个“K姐食堂”APP 的设计稿。
提示词:根据文档需求,完成K姐食堂APP的设计。
...(此处省略超长 PRD 文档内容)...
结果出乎意料地好。完成度非常高,每个小窗口都是可以直接互动的。覆盖面也很完整,一共生成了 19 个展示界面,从首页、店铺页、规格弹窗,到确认订单、订单详情、售后、评价,这些关键页面一个不落。后台页面也不是摆设,数据看板、订单管理、售后管理都有。后续只需要补上交互、状态流转、真实素材和响应式适配,基本就是一个完整的 APP 了。
接下来是经典的 3D 项目测试,每次模型测评的保留项目。
提示词:做一个可交互的 3D 太阳系页面。要求使用 Three.js,行星围绕太阳公转,轨道可见,点击行星后侧边面板显示信息,支持播放/暂停、速度调节、视角拖拽、滚轮缩放,手机端适配。
出来的效果确实惊艳。该有的行星都有,交互也相当齐全。点击、拖拽、缩放、暂停、速度调节、重置视角,一个不少。能明显感觉到模型对 Three.js 的基础、页面整合能力以及交互实现能力都相当扎实。
再来一个射击游戏,看看它在游戏开发方面的能力。
提示词:请输出完整单文件 HTML,用 Canvas 做一个类似《雷电》的竖版射击游戏。包含玩家战机、敌机、子弹、碰撞检测、爆炸效果、分数、生命、关卡、暂停、Boss 战以及手机端操控按钮。
做完之后玩了十几分钟,体验感十足。战机、Boss、子弹、音效都有,还做了屏幕震动效果。玩法结构完整,GLM-5.2 显然理解了竖版射击游戏的基本骨架,能独立搭建出主循环、实体系统、碰撞检测、移动端控制和视觉特效。
测试一下 bug 修复能力。这次修复的是一个甘特图 HTML 文件,这种工作场景比普通表格更能体现前端状态设计能力。
提示词:下面是一段有 bug 的单文件 HTML,目标是做一个销售趋势图,其中包含数据访问错误、Chart 实例重复创建、缺乏响应式、缺少 KPI 数据展示和图表类型切换等问题。请修复代码,并输出修复后的完整 HTML。
修复前的效果图显示了数据无法正确切换的问题。修复后的版本则相当完整,KPI 区域、图表类型切换、响应式设计、空状态保护都补上了。这说明模型不仅能读懂原始 bug,还能主动完善产品体验。
总的来看,GLM 的前端 bug 修复能力不错,能定位核心问题,也能补全缺失的交互逻辑。
审美本身也是模型能力的一部分。让 GLM-5.2 为一个叫“LumaNote”的 AI 笔记产品生成一个官网首页。
提示词:生成一个完整的单文件 HTML 官网,包含首屏产品展示、核心工作流、功能亮点、适用人群、价格方案和 FAQ 等区块。设计要求成熟 SaaS 风格,克制清爽,有高级感。
打开 GLM-5.2 生成的官网页面,第一眼还以为点进了哪个 AI 工具的官网。暖纸色背景、深色主按钮、细边框、低饱和棕色强调色,搭配得非常舒适。整个设计已经从只会堆砌渐变卡片的阶段跳出来了,审美在线。
大模型的中文写作水平是很多普通用户关心的点,毕竟是很多上班族的文案工具。
提示词:根据材料写一篇公众号文章,主题是“AI 工具进公司一年后,真正有用的地方和没用的地方”。要求开头直接进入场景,有个人判断,写清楚 AI 帮到了哪里、没帮到哪里,以及为什么新人和老手效果不同。
文章生成速度很快,整体读下来很顺畅,开头也能立刻抓住读者。文章中关于“新人和老手对比”的部分是加分项,有真实管理经验的味道,比单纯讲工具优缺点更有记忆点。如果满分 100 分,这次的写作能力可以给到 85 分。
很多模型经常搞错指令,看看 GLM-5.2 的表现。
提示词:根据规则处理文本。规则包括:最终答案只能输出 4 条项目符号,每条少于 18 个中文字,必须保留原文里的数字,不要出现“提升”“优化”“打造”等词。
结果不错,4 条项目符号,每条少于 18 个中文字,保留了数字,也避开了禁词,所有要求都满足了。
提示词:我要去洗车,我家离洗车店 50 米,我是开车去好,还是走路去好?
还好,没有掉进陷阱里。它还温馨提示可以先走路过去,等洗好再去取车。
提示词:根据材料制作一份 8 页以内的 PPTX,主题是“AI 工具在内容团队的落地方案”。要求包含封面、现状问题、目标、流程设计、岗位分工、风险控制、试点计划、结尾页,风格稳重商务。
任务完成度达标。能看出模型对项目内容理解得很透彻,审美也合格,做出来的东西已经可以直接使用,人工稍微精细调整一下就能拿去汇报。
整个 GLM-5.2 测下来,感觉前面那些榜单或许还真没啥水分。测试结果相当强悍,已经达到国内模型的顶尖水平。不仅能跑,能用,而且用得还很舒服。以前上班时那些资料整理、代码初版、页面搭建、PPT 结构、测试样例,现在都可以交给模型先跑一版,人可以把精力放回判断和取舍上。
对 GLM-5.2 的评价是:上限很高,完成度也稳,已经值得放进日常工作流里认真试用。至于能不能长期留下来,还要看后面几周高频使用时,模型在细节、稳定性和成本上的表现。也许以后接 API 的时候,都分不清接的是 GLM-5.2 还是 Claude Opus 了。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
蚂蚁庄园答题今日答案2026年7月29日
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc