AI服务SLO不能只写可用率。生产级SLO应同时约束延迟、技术可用性、任务质量和单位成本,并按业务风险与任务类型分别设定。企业需要先定义服务对象和测量口径,再确定目标、误差预算、告警和处置机制。
本文讨论SLO设计,不提供通用目标数字。目标值必须来自业务要求和真实基线。
传统API主要关心是否响应和响应多快。AI服务还可能返回技术成功但业务无效的结果,也可能因模型、提示、数据或路由变化导致成本和质量波动。
| 维度 | 需要回答的问题 | 示例SLI |
|---|---|---|
| 延迟 | 用户要等多久 | 首Token时间、完整响应时间、超时率 |
| 可用性 | 服务是否可成功使用 | 成功请求率、错误率、限流率 |
| 质量 | 结果是否满足任务 | 任务通过率、格式遵从、人工接受率 |
| 成本 | 完成任务消耗多少 | 每成功任务成本、Token或GPU消耗 |
四个维度需要联合观察,但不能简单合并为一个分数。
SLO对象应是稳定的模型服务或业务能力,而不是一个底层实例。明确调用方、任务、输入范围、关键路径和失败后果。同一模型用于实时客服和离线摘要时,应设置不同SLO。
每项SLI应明确:
质量指标应基于任务评测与抽样复核,不能仅依赖接口返回码。
先观察真实负载,了解流量、延迟、失败、质量和成本分布。目标应能支持业务,又能让团队识别风险和做出取舍。没有基线就直接设置极高目标,往往只会产生噪声告警或昂贵冗余。
误差预算用于把可靠性目标转化为可操作边界。当错误、超时或质量失败消耗过快时,可以暂停高风险变更、限制非关键流量或启用降级策略。
质量和成本同样可以设置运行预算,例如评测失败比例或单位成本偏离范围。
SLO只有触发行动才有价值:
AGIOne知识库确认模型服务层涉及统一API、策略路由、Token计量和运营分析,算力运行层涉及资源监控与计量,公共治理域覆盖配额、账单和运营规则。这些数据维度可以为SLO测量和处置提供基础。
生产AI服务建议包含。否则接口返回成功但结果不可用时,SLO仍可能显示正常。
不是。更高目标通常意味着更多容量、冗余和运维成本,应与业务风险匹配。
不能。供应方SLA通常只覆盖其服务边界,企业还需测量自身应用、网络、路由、质量和成本。
当服务通过更昂贵的模型或频繁重试维持质量和可用性时,成本可以揭示不可持续的运行方式。
选择一个生产服务,用最近一个完整周期建立四维基线,再由业务、平台和运营团队共同确定目标与处置流程。