每 Token 成本应以同一统计周期内可归属的模型服务成本除以对应 Token 使用量。基础公式是:每 Token 成本 = 模型服务总成本 ÷ 可计量 Token 数。真正困难的不是除法,而是统一输入、输出和缓存 Token 的口径,并把外部调用费、本地算力、平台运营及共享成本合理归属。
企业应先区分外部模型和自建模型。
| 成本层 | 外部模型服务 | 自建或私有模型 |
|---|---|---|
| 模型消费 | 输入、输出、缓存或按次费用 | 模型许可或相关服务费用(如适用) |
| 算力 | 通常包含在供应方价格中 | GPU/XPU 资源、云上实例或内部资源计量 |
| 平台运营 | 网关、治理、计量与运维 | 部署、环境、治理、监控与运维 |
| 共享成本 | 网络、存储及公共服务 | 网络、存储、环境与公共平台成本 |
不是所有企业都需要把全部共享费用立即分摊到 Token。初期可以先建立直接成本口径,再逐步增加可解释的间接成本。
每 Token 直接成本 = 统计周期内模型调用费用 ÷ 同期计量 Token 数
适合外部模型服务的快速比较,但必须说明输入、输出、缓存等不同 Token 是否采用相同价格。
每 Token 全成本 =(模型费用 + 算力费用 + 可归属运营费用)÷ 同期有效 Token 数
适合内部成本分析。共享费用的分摊规则必须透明,否则结果看似精确,实际无法复核。
某服务每 Token 成本 = 该服务归属成本 ÷ 该服务 Token 数
服务级口径比全平台平均值更适合决策,因为不同模型、应用和运行方式的成本结构可能不同。
如果不同类型 Token 的价格不同,应分别计量:
服务成本 = 输入 Token × 输入单价 + 输出 Token × 输出单价 + 缓存等其他计量项
再根据分析目的计算每总 Token 成本、每输出 Token 成本或每次调用成本。指标名称必须带上分母,避免把“每输出 Token”与“每总 Token”混用。
自建模型需要先把资源成本归属到服务,再除以 Token。可以按资源计量周期、部署实例或服务占用关系建立成本池:
服务算力成本 = 资源计量量 × 内部资源单价或分摊费率
每 Token 算力成本 = 服务算力成本 ÷ 服务 Token 数
如果一组资源同时承载多个服务,应使用可解释的分配依据,例如资源时长、实例占用或经过确认的服务权重。不能只按 Token 平均分摊所有 GPU 成本,因为不同服务的资源消耗可能不同。
标价没有包含调用结构、折扣、失败重试、平台和自建算力等因素,不能直接代表企业实际成本。
平均值会掩盖不同模型、应用和部署方式的差异。应保留服务级和调用主体维度。
失败调用也可能产生 Token 或资源消耗。是否计入有效 Token 和成本,需要明确规则。
低成本不代表输出满足业务要求。成本指标应与质量、延迟、成功率和业务结果一起判断。
输入、输出、缓存、免费额度和共享成本范围变化后,趋势就失去可比性。口径调整应记录生效时间。
AGIOne 将模型服务的 Token、调用主体、API Key、额度和账单,与算力资源的实例、任务和用量纳入运营视图。企业可以按服务、应用、部门或租户建立计量和费用归属规则。
平台提供计量与分析基础,不会自动生成适用于所有企业的成本口径。内部资源单价、共享费用范围和分摊方式仍需财务、平台和业务团队共同确定。
取决于决策周期。日级适合异常观察,月度或账期口径更适合成本归集;两者需使用一致定义。
应分别展示实际支付成本和标准成本,避免免费额度结束后成本趋势突然失真。
需要明确“消费 Token”和“有效 Token”两个口径。前者用于账单核对,后者用于分析有效产出。
不能单独比较。还需结合任务、输出质量、上下文、延迟和成功率。