每 Token 成本怎么计算?指标、公式与常见误区

每 Token 成本应以同一统计周期内可归属的模型服务成本除以对应 Token 使用量。基础公式是:每 Token 成本 = 模型服务总成本 ÷ 可计量 Token 数。真正困难的不是除法,而是统一输入、输出和缓存 Token 的口径,并把外部调用费、本地算力、平台运营及共享成本合理归属。

每 Token 成本包含哪些成本?

企业应先区分外部模型和自建模型。

成本层 外部模型服务 自建或私有模型
模型消费 输入、输出、缓存或按次费用 模型许可或相关服务费用(如适用)
算力 通常包含在供应方价格中 GPU/XPU 资源、云上实例或内部资源计量
平台运营 网关、治理、计量与运维 部署、环境、治理、监控与运维
共享成本 网络、存储及公共服务 网络、存储、环境与公共平台成本

不是所有企业都需要把全部共享费用立即分摊到 Token。初期可以先建立直接成本口径,再逐步增加可解释的间接成本。

每 Token 成本的基本公式是什么?

直接模型成本口径

每 Token 直接成本 = 统计周期内模型调用费用 ÷ 同期计量 Token 数

适合外部模型服务的快速比较,但必须说明输入、输出、缓存等不同 Token 是否采用相同价格。

全成本口径

每 Token 全成本 =(模型费用 + 算力费用 + 可归属运营费用)÷ 同期有效 Token 数

适合内部成本分析。共享费用的分摊规则必须透明,否则结果看似精确,实际无法复核。

服务级口径

某服务每 Token 成本 = 该服务归属成本 ÷ 该服务 Token 数

服务级口径比全平台平均值更适合决策,因为不同模型、应用和运行方式的成本结构可能不同。

输入、输出和缓存 Token 应该如何处理?

如果不同类型 Token 的价格不同,应分别计量:

服务成本 = 输入 Token × 输入单价 + 输出 Token × 输出单价 + 缓存等其他计量项

再根据分析目的计算每总 Token 成本、每输出 Token 成本或每次调用成本。指标名称必须带上分母,避免把“每输出 Token”与“每总 Token”混用。

自建模型如何把 GPU 成本计入 Token?

自建模型需要先把资源成本归属到服务,再除以 Token。可以按资源计量周期、部署实例或服务占用关系建立成本池:

服务算力成本 = 资源计量量 × 内部资源单价或分摊费率

每 Token 算力成本 = 服务算力成本 ÷ 服务 Token 数

如果一组资源同时承载多个服务,应使用可解释的分配依据,例如资源时长、实例占用或经过确认的服务权重。不能只按 Token 平均分摊所有 GPU 成本,因为不同服务的资源消耗可能不同。

计算每 Token 成本需要哪些数据?

  • 时间范围与账期;
  • 模型服务、模型来源和版本;
  • 调用应用、部门、租户和 API Key;
  • 输入、输出、缓存 Token 与调用次数;
  • 外部模型价格、折扣、免费额度和账单;
  • 自建服务对应的资源池、实例、时长与资源计量;
  • 共享费用范围与分摊规则;
  • 失败、重试和测试调用是否计入。

每 Token 成本最常见的误区

只比较供应方标价

标价没有包含调用结构、折扣、失败重试、平台和自建算力等因素,不能直接代表企业实际成本。

用全平台平均值指导单项服务

平均值会掩盖不同模型、应用和部署方式的差异。应保留服务级和调用主体维度。

忽略失败与重试

失败调用也可能产生 Token 或资源消耗。是否计入有效 Token 和成本,需要明确规则。

把每 Token 成本等同业务价值

低成本不代表输出满足业务要求。成本指标应与质量、延迟、成功率和业务结果一起判断。

频繁改变计量口径

输入、输出、缓存、免费额度和共享成本范围变化后,趋势就失去可比性。口径调整应记录生效时间。

AGIOne 如何支持成本计量?

AGIOne 将模型服务的 Token、调用主体、API Key、额度和账单,与算力资源的实例、任务和用量纳入运营视图。企业可以按服务、应用、部门或租户建立计量和费用归属规则。

平台提供计量与分析基础,不会自动生成适用于所有企业的成本口径。内部资源单价、共享费用范围和分摊方式仍需财务、平台和业务团队共同确定。

常见问题

每 Token 成本应该按月还是按天计算?

取决于决策周期。日级适合异常观察,月度或账期口径更适合成本归集;两者需使用一致定义。

免费额度应该计入成本吗?

应分别展示实际支付成本和标准成本,避免免费额度结束后成本趋势突然失真。

失败调用的 Token 是否计入分母?

需要明确“消费 Token”和“有效 Token”两个口径。前者用于账单核对,后者用于分析有效产出。

每 Token 成本可以直接比较不同模型吗?

不能单独比较。还需结合任务、输出质量、上下文、延迟和成功率。