模型架构与注意力面试题25 题
- 01 什么是 KV Cache?它为什么能加速大模型推理?
- 02 什么是因果掩码(causal mask)?双向、因果、prefix 注意力有什么区别?
- 03 自注意力机制中的 Q、K、V 分别是什么?如何计算?
- 04 Attention Mask 有哪些类型?各自解决什么问题?
- 05 encoder-only、decoder-only、encoder-decoder 三种架构有什么区别?为什么大模型都用 decoder-only?
- 06 LayerNorm 和 RMSNorm 有什么区别?Pre-LN 和 Post-LN 呢?
- 07 MHA、MQA、GQA、MLA 有什么区别?为什么大模型要改注意力的 KV?
- 08 Transformer 的核心结构是什么?为什么它能取代 RNN?
- 09 Transformer 里的 FFN 有什么用?为什么现代大模型用 SwiGLU 激活?
- 10 Transformer 为什么需要位置编码?RoPE 相比绝对位置编码好在哪?
- 11 Transformer 相比 RNN 和 CNN 有什么优势?代价是什么?
- 12 大模型的上下文窗口是如何扩展的?位置插值、NTK、YaRN 是什么?
- 13 什么是混合专家(MoE)?它如何做到参数多但计算不变?
- 14 自注意力的计算复杂度是多少?FlashAttention 为什么能加速?
- 15 Transformer 训练中的激活显存主要花在哪里?
- 16 MoE 路由器如何做负载均衡?
- 17 RoPE 外推长上下文有什么风险?
- 18 Transformer 中激活重计算适合解决什么问题?
- 19 Transformer 中注意力头会不会冗余?如何分析?
- 20 Transformer FFN 的扩展倍率为什么通常很大?
- 21 大模型宽度和深度如何取舍?
- 22 大模型特殊 Token 设计要注意什么?
- 23 归一化位置为什么会影响 Transformer 训练稳定性?
- 24 滑动窗口注意力适合什么场景?
- 25 输入 Embedding 和输出层权重共享有什么作用?
没有符合条件的题目。