← 返回题目列表

集成模型线上推理成本如何控制?

中等 第 21 / 25 题 更新于 2026/09/19
集成学习机器学习面试题模型训练

简化版

集成上线成本近似由成员推理、特征计算、并发调度和融合组成;串行延迟相加,并行延迟取慢成员但增加资源峰值。优化可用成员裁剪、级联、缓存或蒸馏,但必须在目标流量下比较精度—延迟—成本。

详细版

  • 不要只报模型 FLOPs,要测端到端 P50/P95/P99。

  • 并行调用减少墙钟时间,却放大 CPU/GPU 与网络占用。

  • 任一成员超时需定义降级权重和缺失预测策略。

  • 特征重复计算应共享,避免每个成员各走一遍。

  • 成员数增加还扩大版本、监控和回滚复杂度。

完整版教学

一、服务成本来自关键路径而非模型个数本身

三个模型串行执行时延迟近似相加;并行时关键路径由最慢者与融合等待决定。

系统是否值得并行取决于资源余量和尾延迟。

离线收益很小的成员可能占据大部分在线成本,应用边际贡献除以成本排序,而不是一刀切保留全部模型。

二、底层机制与公式

serial latency ~= sum_i L_i + L_fusion
parallel latency ~= max_i L_i + L_fusion
cost/request = sum_i resource_i * time_i

三、带数字的推演

三个成员耗时 10、20、50 ms,融合 3 ms:串行约 83 ms,并行理想值约 53 ms;但并行瞬时资源约为三者之和,且 50 ms 成员决定尾延迟。

四、方案对比

方案/对象核心特点代价或边界
串行资源峰值低延迟相加
并行延迟接近最慢成员资源峰值高
级联简单样本提前退出路由与校准复杂

五、执行流程

压测单成员 -> 测边际精度 -> 设计并行/超时 -> 共享特征
-> 全链路压测 -> 故障注入 -> 监控成员和融合输出

六、边界条件与工程代价

成员超时后把权重简单归一化,只有在剩余模型已按该组合验证时才安全;临时缺一个成员可能造成校准漂移。

批处理吞吐优化可能增加单请求等待,在线 SLA 应同时限制排队时间与计算时间。

记忆钩子:把在线集成画成关键路径:串行看求和,并行看最大值,外加融合与排队。

七、常见误区与追问

  • 误区:并行推理不会增加成本。 它减少墙钟但提高同时资源占用。

  • 追问:如何裁剪成员? 按 OOF 边际收益与在线增量成本做消融。

  • 误区:只看平均延迟即可。 最慢成员和排队会主导 P99。

  • 追问:成员超时怎么办? 预先验证降级组合并设置截止时间。

  • 追问:蒸馏价值是什么? 用单学生逼近集成,换取更低延迟和运维复杂度。

八、加强记忆

把在线集成画成关键路径:串行看求和,并行看最大值,外加融合与排队。

每个成员都要用边际精度证明自己的成本。