中文标准名称:贪心解码 / 贪心搜索

一句话核心定义

大模型逐字生成文本时,每一步只挑选当前概率最高的词(argmax),选定之后不再回头、不保留其他备选方案,一条路走到结束

简单数字例子(完整链路串联)

上文:零部件库存不足 模型输出Logits → Softmax算出候选词概率: 缺货:0.62,物流:0.25,采购:0.10,发货:0.03 ✅ 贪心操作:直接选概率最高【缺货】 把「缺货」拼进句子,再把新完整句子喂回模型,继续预测下一个词。 不断循环,直到生成终止符<EOS>停止。

生活化业务类比

你开车前往目的地,每一个路口永远选择眼前看起来最近的道路,不预留其他路线备选。 优点:决策快;风险:只看眼前,有可能短路段好走,但整条大路最终走进死胡同。

✅ 优点

  1. 速度最快、算力开销最低
  2. 结果固定(确定性输出):相同输入每次生成一模一样文字,方便测试、对比实验;
  3. 逻辑极简:底层就是你刚学习的 argmax

❌ 致命缺点(重点考点)

  1. 目光短浅,局部最优 ≠ 全局最优 某一步次优词汇,后续能够拼接出更通顺完整的句子,贪心会直接舍弃;
  2. 极易重复文本 容易循环输出相同短语(例如:配件缺货、配件缺货、配件缺货……);
  3. 输出风格单调,缺少多样性。

完整串联你整条推理链路

Decoder计算 → Linear层输出 Logits → Softmax转换成词汇概率分布 → Greedy Decoding:执行argmax选出概率最高token索引 → 索引查表(Output Vocabulary)得到单词 → 单词追加到输入,循环生成直到结束

关键区分:训练阶段 VS 推理阶段

  1. 训练阶段:不用贪心解码 使用真实标准答案(one-hot标签)计算交叉熵损失,不做选词;
  2. 线上推理(生成文字):解码策略登场 贪心解码、束搜索(Beam Search)、Top-p采样都属于推理选词方案。

适用场景

适合追求稳定、低延迟、不需要创意的场景: 结构化输出、代码生成、机器摘要、标准化问答。

30秒汇报口述精简版

贪心解码是最简单的文本生成策略。模型每一步预测出所有词汇概率,直接用argmax挑选概率最高的单词,持续生成直到结束。 它运算速度快、输出结果稳定;缺点是只着眼当下选择,容易错过整体更通顺的句子,文本容易重复。

拓展预告(下一个常见概念)

Beam Search 束搜索:不会只保留一条路线,每一步同时保存多条高分候选句子,解决贪心“目光短浅”问题,但是消耗更多算力。

如果你需要,我给你整理【贪心解码 VS 束搜索】直观对比。