来源:互联网 更新时间:2026-07-21 07:13
月之暗面的最新旗舰模型 Kimi K3 终于正式亮相了。
K3的完整权重将在7月27日之前开源,核心参数方面,参数量高达2.8万亿,上下文窗口为百万token。同时,它采用MoE架构,在896个专家中高效激活16个,扩展效率较上一代模型提升2.5倍。
AlphaEngine 团队基于自建的 IRB 投研基准进行了系统测评,结论如下:

图:AlphaEngine IRB投研能力测评结果
IRB(Investment Research Benchmark)是熵简科技AI团队持续维护的投研能力评测体系。它的题源不是教科书习题,而是从真实投研工作中沉淀下来的高难度案例——那些让分析师犯过错、让模型反复翻车的问题。
目前 IRB 覆盖财务建模、时序归因、口径核验、情景推演等核心领域,采用多裁判双盲评分机制。

本次测评中,Kimi K3 与 GPT-5.5、OPUS-4.8、Claude Fable 5、DeepSeek V4 等模型同题作答,统一评分。
从分数分布来看,K3 的优势主要集中在四个方向:时效纪律、证据边界、前提纠错、策略整合。这四项对 GPT-5.5 和 OPUS-4.8 均形成 15 分以上的领先;在长上下文建模和历史复盘上,K3 与 Fable 5 处于同一水平线。

图:IRB 8大维度测评比分
值得注意的是,K3在推理链条的关键节点上表现出更强的纪律性:
下面选取 4 道代表性题目,具体展示 K3 在这些关键节点上与其他模型的差异。
题面:请解释今天上午光通信板块内部的盘中分化:天孚通信跌近 10%,而中际旭创、新易盛只是小幅回调。造成这种差异的可能原因有哪些?
这是一道典型的日内事件归因题,上下文并没有直接给出天孚通信的独立利空实锤证据,模型必须在信息不充分的情况下给出归因。Kimi K3(88.3分)的做法是先承认没有看到天孚通信的实锤个股利空,然后再用三条可复核的间接证据(估值溢价、资金结构、板块轮动)搭建合理归因框架。它没有为了回答完整而编造不存在的事实。
其他模型的典型失败模式:
K3 的价值在于:
题面:请分析三季度债券市场的行情走势,并梳理目前市场上的主流判断以及各方观点中最主要的分歧点。
这是一道典型的推理纪律题,上下文中旧证据和新证据同时存在,模型必须判断哪个代表当前市场状态,而不是简单平均所有材料。Kimi K3(94.3分)抓住了 DR001 从极端低位回升至 1.35%-1.40% 区间这一最新数据,明确区分资金面边际收敛和流动性全面收紧的差异,让结论锚定在最新事实上,而不是被旧的低利率数据拉偏。
其他模型的典型失败模式:
强模型不是把所有材料平均引用,而是判断证据的来源和准确性。
题面:东阳光药半年报显示净利润率只有 0.76%,请帮我分析一下利润率为什么这么低,主要受哪些因素影响?
这是一道错误前提纠错题,用户问题中的0.76%净利润率本身可能存在口径错误或计算偏差,模型不能顺着这个数字直接编原因。Kimi K3(92.3分)没有直接沿着净利润率只有0.76%去编解释,而是先回溯半年报原始数据,发现归母净利润实际为亏损,0.76%可能来自不同口径(如少数股东损益调整后的总利润率),随后才在纠正口径的基础上解释公司经营状况。
其他模型的典型失败模式:
这个动作看起来简单,但实际上大多数模型都做不到。
题面:请你详细阐述一下 A 股牛市通常经历哪些阶段,各阶段的主导风格和资产配置思路分别是什么;另外,请结合市场上的多家机构存在分歧的观点,分析当前市场更接近牛市的哪一阶段。
这是一道多框架整合题。不同机构对牛市阶段的划分标准、对当前市场定位、对配置方向的建议各不相同,模型需要在多元观点中提取共识、标注分歧、并给出可执行的当下配置建议。Kimi K3(88.3分)把牛市阶段压成估值修复→资金正反馈→盈利兑现三段框架,并清晰标注当前市场处于哪个阶段的判断依据。更重要的是,它把抽象的阶段判断落到了具体的配置动作:当前应加配什么、减配什么、观察什么信号确认阶段切换。
其他模型的典型失败模式:
此外,IRB测试集中还有若干有意思的测评结果,篇幅有限无法一一阐述。

图:IRB测评结果(部分)
通过 4 道题的横向对比,K3 的优势可以提炼为两个核心能力维度:
大多数模型面对长上下文时,倾向于平均引用所有材料,不区分新旧。K3 的做法不同:它会判断哪条证据代表最新市场状态,并让最新事实决定结论方向。债市资金面题中,它识别出 DR001 最新数据已经回升,没有被旧的极低利率拉偏方向。隔膜题中,它以 2025 年行业盈利底部为锚,而不是用 2023 年旧数据外推。这种时效意识在其他模型中极为罕见。K3 在时效纪律上对 GPT-5.5 和 OPUS-4.8 领先超过 25 分。
在投研场景中,比说错更危险的是编对了格式但事实不存在。K3 在多道题中展现出鲜明的边界意识:天孚通信题中主动承认没有看到实锤利空;隔膜题中区分上下文有支撑的数据和模型推算的假设;比索题中标注关键数据缺口。相比之下,GPT-5.5 和部分模型在证据不足时大量编造具体事件、公司回应和数据,输出看起来流畅完整但事实基础为零的分析。
一份真诚的测评不应只讲优势。
在两道典型题目上,K3 虽然表现优秀,但暴露了可以继续打磨的方向。
题面:Draft a Q4 earnings update for Wynn Macau, including actual vs consensus comparison, property-by-property operating performance, VIP/mass mix changes, and key follow-up points for upcoming quarters.
K3 得分 95.7 分,在所有参评模型中最高。它完整覆盖了题面的每一项要求,包括actual vs consensus 比较、分物业收入拆分、VIP 与大众赌收结构变化、运营效率指标,最终输出了一篇高完成度的当季 earnings update。但与 Fable 5 对比,差距体现在二阶跟踪框架上。K3 更像一份优秀的当季业绩回顾,数据完整、结构清晰、结论准确。Fable 5 则在此基础上多做了一层:它把成本中枢上移趋势、市场份额空窗期、以及后续季度需要验证的具体指标串成一条前瞻性跟踪链条。换句话说,K3 回答的是这个季度怎么样,Fable 5 还多回答了下一个季度盯什么、什么时候需要改变观点。
题面:作为一名专业投资者,请对东山精密进行 SOTP 分部估值:本体业务和索尔思光电分别如何定价?800G、1.6T 光模块、光芯片等产品线分别贡献多少收入和利润?
K3 得分 90.3 分,成功搭出 SOTP 框架。先把主业和索尔思拆开,再继续拆到索尔思内部的产品线,用出货量 × ASP → 收入 → 利润 → 估值倍数的推理链条完成建模。但与顶尖表现对比,差距体现在市值隐含预期的逆向验证上。K3 的模型是正向搭建的:从产品线收入往上推估值。但 Fable 5 在正向建模之外,还做了一步逆向验证。它把当前市值拆回去,指出市场大致已在交易 2026 年利润兑现,真正的分歧在 2027 年能否做到 150-200 亿元利润,以及光芯片外售能否成为独立估值增量。这种正向搭模型 + 逆向验市值的双向校验,是研究中相对成熟的估值做法。K3 已经能完成前半段,但从能建模到能用模型解释市场定价之间,还有一步进化空间。
总结一下,K3 在纪律性维度(时效、抗幻觉、纠错)上已达到全球第一梯队,在建模深度和前瞻性框架上仍有向顶尖模型学习的空间。这恰恰说明 K3 的提升路径清晰,这是从优秀分析师到资深研究员之间的最后一公里。
对于AlphaEngine用户来说,现在就可以亲身体验Kimi K3的威力。在桌面端,只需在AlphaClaw的模型选择界面切换至Kimi K3,点击添加模型,选择Kimi即可。

此外,还可以绑定微信,随时随地通过微信与Kimi K3交流。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc