一个生产级大模型应用通常怎么分层架构?
简化版
生产级大模型应用不能只有一个 prompt 和一次 API 调用,通常要分成入口层、编排层、模型网关、工具/RAG 层、状态存储、评测监控和安全治理层。这样才能把能力、成本、权限、质量和故障隔离开。
详细版
- 入口层负责鉴权、限流、参数校验和多端协议适配。
- 编排层负责 prompt 拼装、RAG、工具调用、多轮状态和降级策略。
- 模型网关负责多模型路由、重试、超时、成本统计和供应商隔离。
- 状态层保存会话、记忆、缓存、审计日志和业务上下文。
- LLMOps 的核心是把不可完全确定的模型能力纳入可观测、可评测、可回滚的工程体系。
完整版教学
记忆钩子:大模型应用不是“接口转发器”,而是“有模型参与的分布式业务系统”。
一、这题真正考什么
记忆钩子:大模型应用不是“接口转发器”,而是“有模型参与的分布式业务系统”。
面试官真正想看的是你有没有生产工程视角:能不能把模型能力、业务流程、用户体验、成本和风险放在同一张图里思考。回答时不要只停留在工具名,而要讲出边界、链路和验收方式。
二、核心原理和工程边界
LLM 应用的复杂度来自两类不确定性:模型输出不确定,外部依赖不确定。分层架构的目的就是把这些不确定性分摊到不同模块里处理:入口层管用户和权限,编排层管任务流程,模型网关管模型选择,安全层管边界,监控层管质量反馈。
LLMOps 的难点在于模型行为不是传统函数调用,输入稍变、模型版本稍变、上下文稍变,都可能让输出分布变化。因此工程系统必须把“可变的模型行为”包进“可管理的发布、监控和回滚流程”。
三、带数字的工程算例
假设一个客服助手每天 10 万次请求,平均每次 3000 input token、800 output token。如果没有模型网关,模型升级、限流、成本统计和故障切换都会散落在业务代码里;一旦供应商超时率从 1% 升到 8%,排查会非常困难。
这个算例的作用不是追求精确到小数,而是帮助你在面试中建立量级感。只要能估出 token、并发、延迟、成本或错误率的数量级,你的回答就会从概念题变成工程题。
请求总成本 = input_tokens * 输入单价 + output_tokens * 输出单价
可用性 = 1 - 失败请求数 / 总请求数
生产级链路 = API 入口 + 编排 + 模型网关 + 工具/RAG + 监控评测
四、典型链路怎么跑
可以把这类问题拆成下面的链路来理解:
用户/业务系统
|
API 入口:鉴权、限流、参数校验
|
编排层:Prompt、RAG、Tools、Memory
|
模型网关:路由、重试、超时、成本
|
后处理:格式校验、安全过滤、审计
|
观测评测:日志、指标、Trace、反馈
链路图的价值在于暴露责任边界:哪一步做权限,哪一步算成本,哪一步可重试,哪一步必须审计。面试时能画出链路,通常就能自然回答故障排查和系统设计追问。
五、方案对比和选择标准
| 层次 | 职责 | 常见失败 |
|---|---|---|
| 入口层 | 鉴权、限流、协议 | 越权、流量打爆 |
| 编排层 | 任务流和上下文 | prompt 混乱、状态错 |
| 模型网关 | 模型访问和治理 | 重试风暴、成本失控 |
| 观测层 | 质量和稳定性闭环 | 线上问题不可解释 |
选择方案时要先说评估维度,再说取舍。LLMOps 面试很看重这种思维,因为真实系统没有银弹,只有在质量、成本、延迟、安全和维护成本之间做平衡。
六、上线后最容易出问题的地方
- 把所有逻辑塞进一个 prompt,会让权限、成本和故障处理都失控。
- 模型供应商接口稳定不等于业务稳定,业务还要处理超时、降级和输出错误。
- 只在少量 demo 上验证会低估风险,真实流量中的长尾输入、权限组合和外部依赖更复杂。
- 没有版本记录时,线上问题很难复现;prompt、模型、知识库、工具和配置都要纳入发布记录。
七、常见误区与追问
- 误区:大模型应用就是前端加一个聊天框。 要补充适用条件、失败模式和工程兜底,避免把局部经验讲成绝对规律。
- 误区:只要模型能力强,架构就可以简单。 要补充适用条件、失败模式和工程兜底,避免把局部经验讲成绝对规律。
- 误区:模型网关只是转发 API。 要补充适用条件、失败模式和工程兜底,避免把局部经验讲成绝对规律。
- 追问:为什么 LLM 应用需要单独的模型网关? 先给判断标准,再从数据、链路、权限、监控或评测角度说明落地方案。
- 追问:如何设计一次请求的 trace? 先给判断标准,再从数据、链路、权限、监控或评测角度说明落地方案。
- 追问:模型升级应该放在哪一层控制? 先给判断标准,再从数据、链路、权限、监控或评测角度说明落地方案。
八、加强记忆
按“入口、编排、模型、工具、状态、观测、安全”七个词记。面试时先画层次,再讲每层处理什么不确定性,最后用成本和故障例子落地。
复习 LLMOps 题时,可以固定用“目标、链路、预算、风险、观测、回滚”六步组织答案。这样既能回答原理,也能自然延伸到生产系统设计。