AI服务SLO怎么定义?延迟、可用性、质量与成本

AI服务SLO不能只写可用率。生产级SLO应同时约束延迟、技术可用性、任务质量和单位成本,并按业务风险与任务类型分别设定。企业需要先定义服务对象和测量口径,再确定目标、误差预算、告警和处置机制。

SLI、SLO和SLA分别是什么

  • SLI是实际测量指标,例如超时率或合格响应比例;
  • SLO是内部期望目标,例如某周期内指标应达到的水平;
  • SLA是对客户或业务方的正式承诺,可能包含责任条款。

本文讨论SLO设计,不提供通用目标数字。目标值必须来自业务要求和真实基线。

为什么AI服务需要四维SLO

传统API主要关心是否响应和响应多快。AI服务还可能返回技术成功但业务无效的结果,也可能因模型、提示、数据或路由变化导致成本和质量波动。

维度 需要回答的问题 示例SLI
延迟 用户要等多久 首Token时间、完整响应时间、超时率
可用性 服务是否可成功使用 成功请求率、错误率、限流率
质量 结果是否满足任务 任务通过率、格式遵从、人工接受率
成本 完成任务消耗多少 每成功任务成本、Token或GPU消耗

四个维度需要联合观察,但不能简单合并为一个分数。

第一步:定义服务与用户旅程

SLO对象应是稳定的模型服务或业务能力,而不是一个底层实例。明确调用方、任务、输入范围、关键路径和失败后果。同一模型用于实时客服和离线摘要时,应设置不同SLO。

第二步:选择可测量的SLI

每项SLI应明确:

  • 数据来源和采集位置;
  • 分子、分母与排除项;
  • 聚合窗口和分位数;
  • 是否包含重试、缓存和降级;
  • 按租户、应用、版本或路由如何切分。

质量指标应基于任务评测与抽样复核,不能仅依赖接口返回码。

第三步:建立基线再设目标

先观察真实负载,了解流量、延迟、失败、质量和成本分布。目标应能支持业务,又能让团队识别风险和做出取舍。没有基线就直接设置极高目标,往往只会产生噪声告警或昂贵冗余。

第四步:设计误差预算

误差预算用于把可靠性目标转化为可操作边界。当错误、超时或质量失败消耗过快时,可以暂停高风险变更、限制非关键流量或启用降级策略。

质量和成本同样可以设置运行预算,例如评测失败比例或单位成本偏离范围。

第五步:把SLO连接到处置

SLO只有触发行动才有价值:

  • 延迟超限:检查队列、容量、上下文和路由;
  • 可用性下降:有限重试、切换或降级;
  • 质量下降:回滚模型、提示或路由变更;
  • 成本超限:检查高价路由、重试、异常用量和资源效率。

AGIOne可提供什么基础

AGIOne知识库确认模型服务层涉及统一API、策略路由、Token计量和运营分析,算力运行层涉及资源监控与计量,公共治理域覆盖配额、账单和运营规则。这些数据维度可以为SLO测量和处置提供基础。

SLO评审清单

  • SLO是否对应明确服务和用户;
  • 指标是否能从真实路径采集;
  • 是否区分平均值与尾部延迟;
  • 技术成功是否与任务质量分开;
  • 重试和降级是否计入;
  • 成本是否按成功任务衡量;
  • 目标超限是否有责任人和动作;
  • 版本或路由变化后是否重新建立基线。

FAQ

AI服务SLO必须包含质量吗?

生产AI服务建议包含。否则接口返回成功但结果不可用时,SLO仍可能显示正常。

SLO目标应该越高越好吗?

不是。更高目标通常意味着更多容量、冗余和运维成本,应与业务风险匹配。

模型供应方SLA能否替代企业SLO?

不能。供应方SLA通常只覆盖其服务边界,企业还需测量自身应用、网络、路由、质量和成本。

成本为什么要进入SLO?

当服务通过更昂贵的模型或频繁重试维持质量和可用性时,成本可以揭示不可持续的运行方式。

下一步

选择一个生产服务,用最近一个完整周期建立四维基线,再由业务、平台和运营团队共同确定目标与处置流程。