← 返回题目列表

大模型的宽度与深度应该如何权衡?

高频 困难 第 11 / 25 题 更新于 2026/09/17
Transformer模型深度模型宽度Scaling Law

简化版

宽度 H 增加每层表示容量、矩阵并行度和参数量,深度 L 增加连续计算步骤与层级组合能力。对稠密 Transformer,主体参数粗略随 L·H² 增长,因此等参数下加宽必须减少层数。太深会使训练、流水线和逐层延迟变差,太宽会增大单层激活/通信并减少计算深度;应在等参数、等训练 FLOPs 和目标硬件下比较 loss、下游能力、吞吐和延迟,而不是套固定宽深比。

详细版

忽略词表和常数,每层 Attention+FFN 参数约为 cH²,总量约 P≈cLH²。固定 P 时,H 提高 2 倍会要求 L 约降到 1/4。宽模型有更大的 Head/FFN 容量和高效大 GEMM;深模型提供更多非线性变换,但每 token 必须串行经过更多层。

fixed P: L ∝ 1/H²
latency depth path: roughly O(L) sequential blocks

选型还受词表矩阵、Head 维、Tensor/Pipeline Parallel、激活显存和训练稳定性影响。实验需匹配参数、训练 token、优化器与 FLOPs,报告验证 loss、不同任务、MFU、通信、TTFT/吞吐和显存;小模型结论不能直接外推到大规模。

完整版教学

一、宽与深分别增加什么

宽度 H 是残差流维度,影响 Attention 投影、Head 数或维度、FFN 宽度;深度 L 是 block 数,决定信息被连续变换多少次。

宽增加同一步的通道容量,深增加计算步骤。它们都提高容量,却不是可完全互换的参数。

记忆钩子:宽度像每层有多少工位,深度像流水线有多少道工序;总工位相同,组织方式仍影响能力与速度。

二、等参数关系不是线性的

标准层的 Attention 权重约 4H²,FFN 若 4H 约 8H²,总计约 12H²;常数会随 GQA、SwiGLU 改变,但 H² 关系仍常见。

P_layers ≈ c × L × H²

若 H 从 1024 增到 2048,每层主体参数约四倍;保持总参数需把层数从 48 降到约 12。比较“加宽一点、少一层”常不是真正等预算。

词表 Embedding V×H 在小模型或大词表时占比显著,不能总忽略。

三、深度提供连续计算路径

某些算法和组合推理需要多步变换,更多层提供更长的串行计算图。层间残差还能逐步精炼表示。

代价是每层必须按序执行,单请求延迟很难像宽度矩阵那样完全并行。非常深的网络还面临梯度、初始化和残差尺度问题。

Pre-Norm、合适初始化和残差缩放改善稳定性,但不会消除串行延迟。

四、宽度更适合硬件并行但有边界

大矩阵乘法通常能更好利用 GPU,宽度增加会提升单层算术强度;Tensor Parallel 可切 H 或 Head。但过宽会增加跨卡 collective、单层激活和参数内存。

维度更深更宽
串行 block 数
单层 GEMM较小较大
Pipeline 划分更灵活stage 数受限
单层激活/通信较小较大

最佳硬件效率取决于 batch、序列、卡型与互联,不能只看 FLOPs。

五、Head 与 FFN 约束宽度选择

H 要能合理分成 Head,Head dim 常取硬件与 RoPE 友好值。过小 H 限制 Head 数或每头维度;过大 H 若 Head 数不变则单头过宽,未必有效。

FFN 中间维随 H 按比例增长,并需满足 Tensor Core、量化 group 和张量并行整除。一个数学合适的 H 可能在部署上产生难看的矩阵形状。

因此宽深搜索与 Head、FFN 和并行配置联合进行。

六、激活与模型状态的不同压力

固定总参数时参数/优化器状态近似不变,但激活不同。更深模型保存更多层边界;更宽模型每个 [B,S,H] 张量更大。Checkpointing 和序列并行会改变峰值。

假设等参数配置 A 为 L=32,H=4096,B 为 L=128,H=2048;基础激活项 L×H 分别约 131K 与 262K,深窄 B 可能保存更多线性激活,尽管参数相近。

实际还取决于 FFN、Attention kernel 与 pipeline micro-batch。

七、Scaling Law 只给区域性指导

经验研究可提出某规模下的宽深比例,但它依赖数据、训练 token、架构与优化器。将小模型消融直接扩到百倍规模可能失效。

比较应匹配训练 compute,而不只是参数。更深配置若 tokens/s 较低,在相同墙钟或 GPU 预算下看到的 token 更少,最终质量差可能来自训练不足。

使用多个规模点拟合趋势,比单一规模选赢家更可靠。

八、如何设计公平实验

构建 3~5 个近似等参数配置,统一 tokenizer、数据顺序、训练 token 和学习率调参预算。记录参数、真实 FLOPs、tokens/s、MFU、峰值显存与通信。

质量看验证 loss 之外,还看知识、代码、长上下文和推理切片。部署测 batch=1 延迟、批量吞吐、量化兼容和并行扩展。

若深模型 loss 好 0.02,但推理延迟高 60%,最终选择取决于服务 SLA,而不是单一排名。

九、常见误区与追问

  • 误区:同参数量的宽深模型计算完全相同。 激活、通信、kernel 和训练吞吐不同。
  • 误区:越深推理能力一定越强。 优化困难和预算分配可能抵消收益。
  • 误区:越宽 GPU 利用率一定越高。 跨卡通信与内存也会增加。
  • 误区:参数匹配就算公平实验。 还需匹配训练 token、FLOPs 与调参预算。
  • 误区:小模型最佳比例可直接用于大模型。 Scaling 关系需多规模验证。
  • 追问:固定参数 H 翻倍,L 怎么变? 主体近似 H²,L 约降到四分之一。
  • 追问:哪个对单请求延迟更敏感? 深度增加串行 block,通常更直接增加延迟。
  • 追问:词表参数何时不可忽略? V 大、H 大但 L 小的模型中占比明显。

十、加强记忆

宽深权衡记住 P≈cLH²:宽度翻倍每层参数约四倍,等参数必须显著减深;深度给更多连续计算步骤却增加串行延迟,宽度扩大通道容量和 GEMM 效率却增加单层激活与通信。最终联合 Head、FFN、并行与硬件,在等参数/等计算条件下比较质量、tokens/s、显存和服务延迟,不能迷信固定比例。