大模型推理部署面试题25 题
- 01 大模型服务 SLA 应该看哪些指标?
- 02 大模型推理的 Prefill 和 Decode 阶段有什么区别?为什么优化方法不同?
- 03 大模型推理中的 TTFT、TPOT、吞吐量和端到端延迟分别是什么?
- 04 如何估算大模型推理的显存占用、并发容量和 GPU 数量?
- 05 什么是 Continuous Batching?它为什么比静态批处理更适合大模型服务?
- 06 PagedAttention 的原理是什么?它如何降低 KV Cache 的内存浪费?
- 07 Prefix Caching 的原理是什么?它与普通 KV Cache 有什么区别?
- 08 Speculative Decoding 的原理是什么?为什么可以加速且保持目标模型分布?
- 09 大模型推理中的 Tensor Parallel、Pipeline Parallel 和 Data Parallel 如何选择?
- 10 为什么大模型推理 GPU 利用率不高?
- 11 Chunked Prefill 解决了什么问题?它如何平衡 TTFT、TPOT 和吞吐量?
- 12 Decode 阶段为什么难并行?如何优化?
- 13 KV Cache 量化是什么?它如何降低长上下文推理显存?
- 14 KV Cache 显存如何估算?
- 15 Prefill 阶段如何优化?
- 16 大模型服务为什么需要准入控制?
- 17 大模型推理冷启动如何优化?
- 18 大模型推理请求如何调度更公平?
- 19 多租户大模型推理如何隔离资源?
- 20 KV Cache 能不能淘汰?淘汰策略怎么设计?
- 21 大模型推理 Batch Size 如何调优?
- 22 多个请求如何复用相同 Prompt 前缀?
- 23 流式输出如何处理客户端背压?
- 24 模型副本应该如何放置到 GPU 上?
- 25 推理吞吐和延迟为什么经常冲突?
没有符合条件的题目。