来源:互联网 更新时间:2026-07-25 08:12
Kimi 公布 K3 API 详细计费规则:输入按缓存状态分两档,输出统一 100 元/百万 token,上下文按实际传入量计费
月之暗面(Moonshot AI)为其大语言模型 Kimi K3 的 API 制定了详细的计费方案。要准确预估单次调用成本,需同时考虑输入 token、输出 token、缓存命中状态和上下文窗口长度四个变量,遗漏任意一项都可能导致账单偏差超过 200%。
K3 API 的输入费用分为两档,取决于请求是否命中系统自动管理的 KV 缓存。缓存机制由 Mooncake 架构自动管理,开发者无法手动开关,但可通过稳定前缀和静态 system message 提升命中率。
所有生成内容,包括思考链(reasoning trace)、中间步骤和最终回答,均计入输出 token 总量。输出单价固定为
若配置 max_completion_tokens=131072(默认上限),满额输出对应成本约 1.31 元;若拉满至 100 万 token,单次输出费用达 10 元。
Kimi K3 支持完整 1M token 上下文,但这项能力不额外加收“长文本费”。计费方式为:按实际传入的上下文 token 数乘以单价 20 元/百万 token(与输入未命中档一致)。例如传入 50 万 token 文档,上下文费用为 1 元。
注意:只要传入上下文即开始按量计费,即使只读取其中部分内容。
单次调用总成本由以下四项叠加计算:
示例:20 万上下文 + 2000 输入(未命中)+ 2000 输出,成本 = (2000×20÷1000000) + (2000×100÷1000000) + (200000×20÷1000000) = 0.04 + 0.2 + 4 = 4.24 元。

本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作和政策可能继续变化,实际情况以相关主体最新公开信息为准。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
夸克浏览器AI画质增强功能在旧款手机上无法开启怎么办?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc