模型架构与注意力面试题25 题
25 题
- 01 什么是 KV Cache?它为什么能加速大模型推理?
- 02 什么是因果掩码(causal mask)?双向、因果、prefix 注意力有什么区别?
- 03 自注意力机制中的 Q、K、V 分别是什么?如何计算?
- 04 encoder-only、decoder-only、encoder-decoder 三种架构有什么区别?为什么大模型都用 decoder-only?
- 05 LayerNorm 和 RMSNorm 有什么区别?Pre-LN 和 Post-LN 呢?
- 06 MHA、MQA、GQA、MLA 有什么区别?为什么大模型要改注意力的 KV?
- 07 Transformer 的核心结构是什么?为什么它能取代 RNN?
- 08 Transformer 里的 FFN 有什么用?为什么现代大模型用 SwiGLU 激活?
- 09 Transformer 为什么需要位置编码?RoPE 相比绝对位置编码好在哪?
- 10 Transformer 相比 RNN 和 CNN 有什么优势?代价是什么?
- 11 大模型的宽度与深度应该如何权衡?
- 12 大模型的上下文窗口是如何扩展的?位置插值、NTK、YaRN 是什么?
- 13 多头注意力中为什么会出现冗余 Head?如何分析与裁剪?
- 14 什么是混合专家(MoE)?它如何做到参数多但计算不变?
- 15 为什么语言模型会共享输入 Embedding 与输出权重?
- 16 自注意力的计算复杂度是多少?FlashAttention 为什么能加速?
- 17 Activation Checkpointing 如何节省 Transformer 训练显存?
- 18 MoE 路由器如何做负载均衡?
- 19 Pre-Norm 与 Post-Norm 为什么影响 Transformer 训练稳定性?
- 20 Sliding Window Attention 的原理和局限是什么?
- 21 Transformer 的 FFN 扩展比例如何选择?
- 22 Transformer 训练中的激活显存由什么组成?
- 23 Transformer 中有哪些 Attention Mask?如何正确实现?
- 24 RoPE 做长上下文外推有哪些风险?
- 25 Tokenizer 的特殊 Token 应该如何设计?
没有符合条件的题目。