大模型生成时 logits、概率和 token 之间是什么关系?
简化版
大模型每一步不是直接吐出简要说,而是先对词表里每个 token 打一个 logit 分数,再用 softmax 变成概率分布,最后由 greedy、temperature、top-p 等解码策略选出下一个 token。理解这条链路,才能解释为什么同一个问题会有不同答案,也能定位重复、胡说、格式跑偏等生成问题。
详细版
- token 是模型读写文本的最小离散单元,可能是一个字、一个词片段或标点。
- logit 是归一化前的分数,大小表示当前上下文下模型偏向某个 token 的程度。
- softmax 把 logits 转成概率,temperature 会改变分布尖锐程度。
- 采样策略从概率分布中选 token,因此生成质量不仅取决于模型,也取决于解码参数。
- 面试中要能把“模型算分、概率化、抽样、拼回文本”这四步讲清楚。
完整版教学
这道题考察候选人是否理解 LLM 生成的最小闭环,而不是只会说“模型预测下一个词”。
一、这题真正考什么
这道题考察候选人是否理解 LLM 生成的最小闭环,而不是只会说“模型预测下一个词”。
面试官通常不是想听一个孤立定义,而是想看你能不能把概念、工程约束、质量风险和排查方法串起来。回答时先给边界,再讲机制,最后落到评估指标。
二、核心机制怎么工作
前向计算会得到一个长度等于词表大小的向量,向量中每个位置对应一个候选 token 的 logit。softmax 会让这些分数变成和为 1 的概率分布,解码器再根据业务目标选择保守或开放的生成方式。
需要特别注意的是,这类问题通常有“模型侧”和“系统侧”两层含义。模型侧解释原理,系统侧解释为什么上线后会遇到成本、延迟、质量或安全问题。
三、带数字的拆解
假设词表只有 5 个候选 token,logits 分别是 [6.0, 4.0, 2.0, 1.0, 0.0]。temperature=1 时第一个 token 已经明显占优;temperature=0.5 会进一步放大差距,输出更稳定;temperature=1.5 会拉平分布,输出更发散。
这个数字例子在面试里很有用,因为它能把抽象概念变成可估算的工程量。候选人如果能主动算出量级,通常比只背定义更有说服力。
p_i = exp(logit_i / T) / sum_j exp(logit_j / T)
T 越小,分布越尖锐;T 越大,分布越平。
greedy decoding = argmax(p_i)
四、流程图和工程落点
可以把它拆成下面这条链路来讲:
上下文 token ids
|
Transformer 前向计算
|
词表 logits
|
softmax + temperature/top-p/top-k
|
选择下一个 token 并追加到上下文
工程落点通常包括三件事:第一是输入输出边界,第二是运行时成本,第三是质量验收。只要这三件事没有闭环,原理讲得再漂亮也很难变成可靠系统。
五、和相近方案怎么区分
| 概念 | 作用 | 常见面试点 |
|---|---|---|
| token | 离散输入输出单元 | 为什么中文、英文长度估算不同 |
| logit | 模型未归一化偏好 | 为什么不能直接当概率 |
| probability | 可采样分布 | temperature 如何影响稳定性 |
| decoder | 选择 token 的规则 | 业务场景如何调参数 |
面试时不要只说“看场景”。更好的回答是先给出区分维度,再说明每个方案为什么适合或不适合某类约束。
六、上线或训练时最容易踩的坑
- 把 logit 当成概率会导致解释错误,因为 logit 可以为负,也不要求求和为 1。
- 只调 temperature 不能解决所有幻觉问题,检索、约束解码和答案校验同样重要。
- 只在 demo 样本上验证会低估真实风险,尤其是长文本、多轮、结构化输出和安全边界。
- 指标要和业务目标绑定,否则可能出现离线分数提升、线上体验下降的情况。
七、常见误区与追问
- 误区:token 就等于中文的一个字。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:概率最高的 token 一定组成最好的答案。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 误区:temperature 越高模型越聪明。 面试中要主动补上边界条件和工程后果,避免把概念讲成绝对结论。
- 追问:为什么 top-p 比 top-k 更适合开放式生成? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:如何用 logits 做结构化输出约束? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
- 追问:为什么同样 prompt 在不同服务端参数下结果不同? 可以从数据、算法、系统和评测四个角度展开,先说判断标准,再说取舍。
八、加强记忆
记住“分词进来,logits 出来,softmax 成概率,解码定风格”。面试时按这条链路讲,既能落到数学,也能落到工程调参。
复习时建议按“定义、机制、数字、流程、对比、风险”六步默写一遍。能把这六步讲顺,就能覆盖大多数追问。