← 返回题目列表

多模型路由、降级和 fallback 应该如何设计?

高频 困难 第 14 / 25 题 更新于 2026/09/18
LLMOps模型路由降级Fallback高可用

简化版

多模型路由是在不同模型之间按任务、成本、延迟、质量和可用性选择执行路径。生产系统通常用规则、分类器或打分器路由,并设计超时重试、备用模型、降级答案和人工兜底,避免单个模型故障拖垮业务。

详细版

  • 简单任务可以走便宜快的小模型,复杂任务走强模型。
  • 路由依据包括任务类型、用户等级、上下文长度、风险等级和实时可用性。
  • fallback 要处理输出差异、能力差异和上下文窗口差异。
  • 降级策略可以返回模板答案、排队、人工处理或只读模式。
  • 多模型体系要有统一评测和日志,否则无法比较质量。

完整版教学

记忆钩子:模型路由像交通调度,目标不是永远走最强模型,而是在质量、成本和稳定性之间选路。

一、这题真正考什么

记忆钩子:模型路由像交通调度,目标不是永远走最强模型,而是在质量、成本和稳定性之间选路。

路由决定首选模型,fallback 处理首选失败后的受控替代。备用模型只有在输入协议、输出 schema、工具能力和安全策略兼容时才可直接切换,否则降级本身会制造新错误。

二、核心原理和工程边界

单模型系统简单但脆弱:价格波动、限流、超时和质量退化都会直接影响业务。多模型路由把请求分配给不同能力和成本的模型,再通过 fallback 处理失败。关键是提前定义哪些请求可以降级,哪些必须走强一致或人工确认。

三、带数字的工程算例

某系统 70% 请求是简单改写,20% 是知识问答,10% 是合规高风险分析。若全部走强模型,成本高;若全部走小模型,高风险质量不足。可以让改写走小模型,问答走中模型+RAG,高风险走强模型并人工抽检。

路由得分 = w1*质量预估 - w2*成本 - w3*延迟 - w4*风险
fallback 触发 = 超时 || 限流 || 校验失败 || 质量分低于阈值
有效可用性 ≈ 主模型成功率 + 主失败率 * 备用模型成功率

四、典型链路怎么跑

可以把这类问题拆成下面的链路来理解:

请求分类
   |
估计复杂度和风险
   |
选择主模型
   |
执行并校验
   | fail
选择备用模型或降级路径
   |
记录路由结果用于评估

五、方案对比和选择标准

策略优点风险
固定规则透明稳定覆盖不了复杂语义
分类器路由灵活分类器自身会错
成本优先省钱质量可能下降
质量优先稳定成本和延迟高

六、上线后最容易出问题的地方

  • fallback 模型如果上下文窗口更短,直接重试可能截断关键输入。

  • 不同模型输出风格不同,结构化 schema 和后处理必须保持统一。

  • 熔断应按供应商、模型和错误类型隔离;业务校验失败不能与网络超时使用同一 fallback 策略。

七、常见误区与追问

  • 误区:fallback 就是失败后换个模型再试一次。 必须判断错误是否可重试、备用能力是否兼容、剩余截止时间是否足够,并避免重复副作用。
  • 误区:最强模型永远应该作为主模型。 简单请求用强模型浪费成本和延迟,主模型应按任务质量门槛选择而非榜单排名。
  • 误区:路由只看成本就够了。 还要考虑任务能力、延迟、上下文、区域合规、工具支持和错误相关性。
  • 追问:如何评估路由器是否选对模型? 用每请求各模型的反事实标签评估 regret、困难样本漏路由率和总体成本—质量曲线。
  • 追问:备用模型输出不兼容怎么办? 在网关后增加统一 schema 校验和适配;无法保证语义一致时应返回明确降级而非伪装成功。
  • 追问:降级答案如何避免误导用户? 限制为可验证范围,标明能力受限;高风险场景宁可转人工或稍后重试,也不生成猜测。

八、加强记忆

按“分类、路由、校验、fallback、降级、记录”六步记。多模型不是堆模型,而是把每类请求送到合适的能力和成本档位。