大模型评估与安全面试题25 题
- 01 大模型幻觉可以分成哪些类型?
- 02 大模型上线后如何进行安全监控、漂移检测和事件响应?
- 03 大模型应用为什么需要回归测试?
- 04 困惑度 Perplexity 是什么?为什么不能只用它评估大模型?
- 05 如何建立一套完整的大模型评估体系?
- 06 如何评估大模型的安全对齐、拒答能力和过度拒答?
- 07 如何评估大模型的幻觉与事实性?常见指标有哪些局限?
- 08 什么是大模型 Benchmark 数据污染?如何检测和降低影响?
- 09 什么是大模型红队测试?如何设计一套有效的 Red Team 流程?
- 10 LLM-as-a-Judge 如何设计?常见偏差和校准方法有哪些?
- 11 安全策略和拒答边界如何设计?
- 12 大模型 Guardrail 应该如何设计?为什么需要纵深防御?
- 13 大模型评测集如何构建才可靠?
- 14 红队测试如何覆盖提示注入风险?
- 15 Prompt Injection 与 Jailbreak 有什么区别?直接和间接注入如何防御?
- 16 大模型 Golden Set 如何维护?
- 17 大模型安全风险分类体系如何设计?
- 18 大模型安全事故响应流程应该包含什么?
- 19 评测标注一致性如何衡量?
- 20 LLM Judge 为什么需要校准?
- 21 安全回归测试集应该覆盖哪些场景?
- 22 大模型评测成本如何控制?
- 23 模型发布前 Canary Evaluation 有什么作用?
- 24 如何评估大模型毒性和偏见?
- 25 提示注入 Benchmark 如何设计?
没有符合条件的题目。