热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >聊聊大模型采样策略

聊聊大模型采样策略

来源:互联网 更新时间:2026-08-19 14:44

在LLM推理过程中,控制生成结果的几个关键参数——贪心搜索、波束搜索、Top-K采样、Top-p采样和温度——其实都绕不开同一个本质:它们只是从离散概率分布中取token的不同方式。所有操作都基于模型输出的概率分布,只是“怎么选”的策略不同而已。

在Gradio这类工具里,这些参数也经常出现。调得好,输出才靠谱。下面逐个拆解。

Greedy search

贪心搜索的逻辑最简单:每一步都选概率最高的那个词。听起来很直接,对吧?但问题就出在这里——只看眼前,不看全局。你选了一个局部最优,很可能就把后面真正出彩的序列给丢了。举个不恰当的例子:你在分岔路口选了看起来最宽的隧道,结果发现它通向死胡同,而旁边那条窄一点的才是正路。

缺点:

  1. 每次只追求当前token的最高概率,完全不顾后续影响。很多情况下,一个低概率的前缀后面能接上高概率的精彩序列,但贪心搜索永远不会走到那一步。

Beam search

波束搜索是对贪心搜索的改良——它不再只看一个候选,而是每一步保留得分最高的k个序列,然后继续扩展。k是Beam Size,意味着搜索空间被放大了。理论上,这更容易找到全局最优解。

从设计思路来看,Beam Search确实抓住了贪心搜索的痛点,但别高兴太早。

缺点:

  1. 它仍然可能掉进局部最优的坑里,只是概率比贪心搜索小一些。
  2. 在需要多样性的场景(比如文本生成、对话系统)中,Beam Search容易吐出大同小异的答案——因为它总挑评分最高的那几个,多样性自然打了折扣。

维特比算法可以做到全局最优,但计算复杂度高,实际中很少直接用。

top-k采样

Top-K采样的思路是:只从概率最大的K个token里选,其他的直接忽略。然后把这K个token的概率重新归一化,再采样。K值设得越小,输出越保守;K值设得越大,多样性就越高。

top-p采样

Top-p采样(也叫核采样)和Top-K的思路类似,但筛选标准不一样:它不固定选多少个token,而是从概率累加刚好超过p的那个最小集合里采样。比如p=0.9,就把概率最高的token一个个累加,直到总概率达到90%,然后只从这些token里采样。

temperature

温度参数经常和前面几个策略搭配使用,但它本身不是采样策略——它是Softmax函数里的一个缩放因子,作用在模型最后一层输出上。

它的工作原理:

  1. 温度直接影响概率分布的形状。低温让概率分布变得更“陡峭”——高概率的token更高,低概率的更低;高温则让分布变得更“平坦”——所有token的概率更接近。
  2. 高温下,低概率的token也有机会被选中,输出会更随机、更有“创意”。
  3. 低温则放大了概率差异,模型更倾向于选最高概率的词,输出更确定、更保守。

一句话总结:温度控制的是“冒风险”的程度。调低它,模型会走保险路线;调高它,模型可能会给你意想不到的惊喜(或惊吓)。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc