来源:互联网 更新时间:2026-08-25 14:33

这个问题其实很直观——LLM在自回归解码(decoding)阶段,每一次推理只用到当前的Q,这次用完了,下次就不会再用它了。但K和V不一样,当前这一步用到的K和V,下一步还得再重复用,而且还得把新生成的token的KV也加进去。所以缓存KV就能省去大量重复计算,而缓存Q则毫无意义。
道理说完了,但面试官往往会追问一句:“Attention公式里Q和K长得那么对称,凭什么只Cache K不Cache Q?” 那我们就从公式底层掰扯清楚。
先把Attention中的Q、K、V写成矩阵分块的形式。Q和K的转置做矩阵乘法,这一步看上去K和Q是可以互换的,对称得很漂亮。但到了下一步,V的引入就打破了这种对称。
忽略缩放系数,第i行的softmax结果简写为s_i,那么Attention的输出就是每个位置的softmax权重与对应V的加权和:
在没有Causal Mask(因果掩码)的情况下,这个操作天然是对称的——Q和K互换位置,结果形式不变。但一旦加入Causal Mask,情况就完全不一样了。
有Causal Mask时,当前token只能看到自己和之前的token,不能看到未来。这时候Attention计算变成:
写出通项公式:
关键差异就在这里:在序列的第t个位置,Q只有当前这个 q_t 参与了计算,而K和V却有t个位置(1到t)都参与。所以,我们需要缓存历史所有位置的K和V,但完全不需要缓存历史Q——它们早就没用过了。
值得一提的是,如果没有Causal Mask,计算第t个位置的Attention还需要用到未来位置的KV,这在自回归推理中根本不可能提前得到。加上Causal Mask之后,只需要1,2,…,t位置的KV,推理才能顺利进行。这也解释了为什么KV Cache不仅是一种优化,更是自回归解码能够高效运行的基础。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
腾讯ima知识库怎么分类管理?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc