什么是大模型的「涌现能力」?它真的存在吗?
简化版
涌现能力(emergent abilities) 指某些能力在小模型上几乎为零、随着规模增大到某个临界点后突然大幅出现的现象,比如多步算术、思维链推理、few-shot 完成新任务等——它们在小模型上练不出来,模型够大才「开窍」。这被视为「规模带来质变」的证据。但存在争议:Stanford 一项研究(2023)指出,很多所谓「涌现」其实是评测指标选得太苛刻造成的假象——换成平滑、连续的指标,能力其实是渐进提升的,只是「全对才算分」的指标让它看起来像突然跳变。所以要辩证看:规模确实带来能力跃升,但「是否真有不连续的相变」仍有学术分歧。
详细版
涌现能力的典型例子
- 少样本学习 / 上下文学习:给几个例子就能做新任务,小模型不行,大模型涌现。
- 思维链(CoT)推理:让模型「一步步想」能大幅提升数学/逻辑题正确率,但这只在足够大的模型上才有效,小模型加 CoT 反而更差。
- 多步算术、符号推理、指令遵循:都呈现「规模到了才出现」的模式。
主流叙事(Wei et al. 2022)
- 把某些任务的准确率对模型规模作图,会看到:小规模时几乎是随机水平(接近 0),越过某个规模后陡然上升。
- 结论:这些能力「无法从小模型外推」,是规模带来的质变/相变。
争议与反驳(Schaeffer et al. 2023)
- 观点:涌现可能是”指标的产物”,而非模型的真实相变。
- 原因:像「多位数加法全对才得分」这种非线性、全或无的指标,会把「模型其实在稳步变好」放大成「突然跳变」。
- 换用连续、平滑的指标(如按 token 计部分正确、用对数似然),同样的模型能力曲线变成平滑渐进,没有突变。
如何辩证看待
- 事实层面:大模型确实能做小模型完全做不了的事(这点没争议)。
- 机制层面:这种提升是”不连续的相变”还是”被指标放大的连续提升”,尚无定论。
- 实践启示:不能只看某个规模的表现就断言「能力天花板」,也不能迷信「再大一点就一定涌现某能力」。
完整版教学
一、涌现这个概念从哪来
「涌现」本是复杂系统里的概念:大量简单个体的相互作用,在数量达到一定规模后,会出现个体层面不存在的整体性质(如水分子涌现出「湿」、神经元涌现出「意识」)。大模型语境下,它被用来描述:单纯把模型和数据规模放大,会”免费”获得一些没有专门训练过的新能力。
这个叙事极具吸引力,因为它支撑了「Scaling 信仰」——只要继续放大,就可能涌现出更强的推理、规划乃至通用智能。所以涌现能力常被拿来论证「大力出奇迹」。
二、经典证据:能力曲线的”陡然跳升”
Wei 等人 2022 年系统整理了这一现象:在一批任务上,把「准确率」对「模型规模(参数量/训练算力)」画图,发现不少任务呈现同一模式——在某个规模阈值以下,表现几乎是随机猜(接近 0);越过阈值后,准确率陡然拉升。
典型如思维链(Chain-of-Thought):让模型「一步步推理再给答案」,在大模型上能显著提高数学题正确率;但在小模型上,加了 CoT 反而更差(因为它连每一步都写不对)。这类「小模型完全无效、大模型突然有效」的现象,构成了涌现的核心证据。
三、反转:涌现可能是”指标制造的幻觉”
2023 年 Stanford 的 Schaeffer 等人提出了有力的质疑,获得当年 NeurIPS 最佳论文。核心论点:很多”涌现”是评测指标的非线性造成的假象,而非模型能力的真实突变。
关键在指标的「全或无」特性。以「五位数加法」为例,常用指标是完全匹配(Exact Match)——五个数字全对才得 1 分,错一个就 0 分。设想模型对每一位的正确率在随规模平滑上升:
- 当每位正确率还不高时,「五位全对」的概率极低(几个小于 1 的数相乘),得分接近 0;
- 当每位正确率接近 1 时,「五位全对」的概率才骤然接近 1。
于是底层能力是平滑上升的,但被”全对才算分”的指标放大成了突然跳变。作者证明:把指标换成连续、部分给分的形式(如按正确位数、按对数似然),同样的数据画出来就是平滑单调的曲线,涌现的「拐点」消失了。
记忆钩子:「涌现」很多时候不是模型突然开窍,而是”全对才算分”的苛刻指标,把稳步的进步显示成了悬崖式跳升。
四、那到底该信哪个
两种观点其实不完全矛盾,要分层理解:
- 能力事实无争议:足够大的模型确实能完成小模型完全做不到的任务(多步推理、复杂指令)。这是客观现象。
- 是否”相变”有争议:这种获得是「数学上不连续的相变」,还是「连续提升被指标放大」,取决于你怎么定义和度量能力。用严苛离散指标看像相变,用平滑指标看是渐进。
- 务实结论:涌现是一个有用但需谨慎的概念。它提醒我们「规模能带来质的飞跃」,但不应据此神化「某个规模必然涌现某能力」,也不应用单一指标就下能力结论。
五、对实践的启示
- 评测要选合适指标:用「全或无」指标容易误判能力的有无和拐点;应结合连续指标、部分给分、对数似然,看清真实趋势。
- 别只看单点:一个规模上「不会」某任务,不代表更大规模也不会;反之亦然。要看曲线趋势而非某个点。
- 规模不是唯一变量:数据质量、训练方式(如是否加 CoT 数据、指令微调)同样能”解锁”能力,不必只押注参数量。
- 对”涌现”保持清醒:它是观察到的现象和有力的营销叙事,但机制尚未盖棺定论,答题时点出争议才显得专业。
六、面试拆解算例
预训练题最好落到预算账和稳定性账。假设训练一个 7B 模型,目标 token 数是 1T,按常见粗估 6 × 参数量 × token 数,训练计算量约为 6 × 7e9 × 1e12 = 4.2e22 FLOPs。如果有效集群算力是 1e18 FLOPs/s,理想情况下也要约 42,000 秒;现实还要扣通信、数据加载、checkpoint 和故障恢复的损耗。
training_flops ≈ 6 * N * D
N = 7e9 parameters
D = 1e12 tokens
training_flops ≈ 4.2e22
| 账本 | 关键变量 | 常见瓶颈 | 排查信号 |
|---|---|---|---|
| 数据账 | token 数、重复率、质量分 | 脏数据和污染 | eval 异常偏高 |
| 算力账 | GPU 数、利用率、通信 | MFU 低 | step time 抖动 |
| 显存账 | batch、序列长、优化器状态 | OOM | 激活占用过高 |
| 稳定性账 | 学习率、精度、梯度 | loss spike | overflow/NaN |
语料 -> 清洗去重 -> tokenization -> 分布式训练 -> checkpoint -> 评测
| | | | |
质量 覆盖率 吞吐 可恢复 能力验证
所以回答「什么是大模型的「涌现能力」?它真的存在吗?」时,不能只说某个技巧“省显存”或“加速”。要说明它省的是哪一笔账、牺牲了什么、线上训练日志里应该观察哪个信号。
七、常见误区与追问
- 误区:涌现能力是被证实的”相变”。 存在重大争议,可能是评测指标非线性造成的假象。
- 误区:模型一大就必然涌现某能力。 不能保证;涌现是回顾性观察,不能可靠预测具体能力何时出现。
- 追问:思维链为什么算涌现例子? 它只在大模型上有效,小模型加 CoT 反而更差,呈现规模阈值效应。
- 追问:为什么”全对才算分”会制造假涌现? 多位全对的概率是各位正确率之积,底层平滑上升会被乘积放大成突然跳变。
- 追问:怎么判断是不是真涌现? 换连续/部分给分指标看曲线是否仍有突变;平滑了就说明是指标产物。
- 追问:这对做产品有什么意义? 评测别只用苛刻离散指标,要看连续趋势;能力提升也可来自数据和训练方法,非只靠堆参数。
八、加强记忆
涌现能力记「小模型没有、够大突现」:典型是 few-shot、思维链推理、多步算术,被当作「规模带来质变」的证据(Wei 2022)。但要记住关键反转(Schaeffer 2023)——很多涌现是”全对才算分”的非线性指标制造的幻觉,换成连续指标后能力其实是平滑上升的。辩证结论钉死三句:大模型能做小模型做不到的事(无争议);是否真”相变”有争议(取决于指标);答题点出这个争议 + 提醒”评测别用苛刻离散指标、别神化规模”,就是专业水准。