大模型评估与安全面试题26 题
26 题
- 01 大模型上线后如何进行安全监控、漂移检测和事件响应?
- 02 困惑度 Perplexity 是什么?为什么不能只用它评估大模型?
- 03 如何建立一套完整的大模型评估体系?
- 04 如何评估大模型的安全对齐、拒答能力和过度拒答?
- 05 如何评估大模型的幻觉与事实性?常见指标有哪些局限?
- 06 什么是大模型 Benchmark 数据污染?如何检测和降低影响?
- 07 什么是大模型红队测试?如何设计一套有效的 Red Team 流程?
- 08 LLM-as-a-Judge 如何设计?常见偏差和校准方法有哪些?
- 09 大模型 Guardrail 应该如何设计?为什么需要纵深防御?
- 10 Prompt Injection 与 Jailbreak 有什么区别?直接和间接注入如何防御?
- 11 代码大模型的 pass@k 如何计算?为什么不等于上线成功率?
- 12 安全策略和拒答边界应该如何设计?
- 13 安全回归测试集应该覆盖哪些场景?
- 14 大模型 Golden Set 应该如何维护?
- 15 大模型安全风险分类体系应该如何设计?
- 16 大模型安全事故响应流程应该包含什么?
- 17 大模型幻觉可以分成哪些类型?
- 18 大模型评测成本应该如何控制?
- 19 大模型评测集如何构建才可靠?
- 20 大模型应用为什么需要回归测试?
- 21 红队测试如何覆盖提示注入风险?
- 22 模型发布前 Canary Evaluation 有什么作用?
- 23 评测标注一致性应该如何衡量?
- 24 如何评估大模型的毒性和偏见?
- 25 提示注入 Benchmark 应该如何设计?
- 26 LLM Judge 为什么需要校准?
没有符合条件的题目。