多模态大模型面试题25 题
- 01 多模态大模型如何把视觉特征接入 LLM?Projector、Q-Former 和 Cross-Attention 有什么区别?
- 02 多模态大模型如何处理高分辨率和不同宽高比的图像?
- 03 多模态大模型如何理解视频?抽帧、时序建模和长视频有哪些难点?
- 04 多模态大模型推理为什么更慢?如何优化视觉 Token、缓存和批处理?
- 05 多模态模型为什么更容易遇到上下文预算问题?
- 06 如何系统评估多模态大模型?常见指标和 Benchmark 有哪些局限?
- 07 什么是 Visual Grounding?它解决什么问题?
- 08 什么是多模态大模型?它与纯文本大模型有什么区别?
- 09 视觉 Token 是怎么进入大模型的?
- 10 CLIP 的对比学习原理是什么?为什么能做零样本分类?
- 11 OCR 和多模态大模型在文档理解中怎么配合?
- 12 ViT 如何把图像转换成 Token?分辨率和 Patch Size 有什么影响?
- 13 多模态大模型通常如何训练?预训练、对齐和指令微调分别解决什么问题?
- 14 多模态大模型为什么会产生视觉幻觉?如何评估和缓解?
- 15 图文对齐为什么是多模态模型的核心?
- 16 多模态模型如何平衡图像分辨率和 Token 预算?
- 17 多模态模型中 Cross-Attention 有什么作用?
- 18 多模态文档理解为什么需要布局信息?
- 19 视频理解中的抽帧策略如何设计?
- 20 音频文本对齐在多模态中解决什么问题?
- 21 多模态模型有哪些特殊安全风险?
- 22 多模态模型做 UI 自动化有什么难点?
- 23 视觉 Token 剪枝有什么收益和风险?
- 24 视觉定位能力如何评估?
- 25 OCR 错误会如何影响多模态问答?
没有符合条件的题目。