看懂用量:费用的构成
用量页将费用拆分到模型与 token 类型两个维度。理解这张表后,即可自行判断某一天费用偏高的原因,也便于有针对性地控制成本。
查看位置
桌面端点击侧栏 用量;网页版位于 /console 的「用量」页。 默认提供预设区间(今天 / 近 7 天 / 近 14 天 / 近 30 天),也可自行选择起止日期。
用量 · 近 7 天
总 Token
1,690,620
总花费
¥ 38.72
| 模型 | 合计 | 花费 |
|---|---|---|
| gpt-5.6-sol | 1,284,502 | ¥ 32.10 |
| gpt-5.6-terra | 406,118 | ¥ 5.42 |
| gpt-image | — | ¥ 1.20 |
四类 token 的含义
这四项直接决定费用,值得先行了解。
输入
本次发送的内容。需要注意的是,AI 编程工具在每一轮都会重新发送完整的对话历史, 因此对话越长,每一轮的输入量越大。
输出
模型返回的内容。单价通常为输入的数倍,但数量一般远小于输入。
缓存写入
首次将一段上下文存入缓存,会产生少量额外成本。
缓存命中
本次输入中从缓存读取的部分,按远低于正常输入的价格计费。
因此缓存命中占比越高,费用越低。在同一会话中连续对话、避免频繁新建会话, 即可提高命中率,这是最易实施的控制成本的方式。
按模型分列的原因
各模型的单价差异较大。表格按模型分列,便于确认成本集中在何处。 常见情况是:多数费用来自能力最强的一个模型,而该模型只承担了少部分请求。
gpt-image 等图片模型按张计费而非按 token 计费, 因此该行的 token 数为空,只显示花费。
数据不一致时的排查
以下三种情况较为常见,多数并非故障:
- 刚发送请求,用量未更新。用量按上游回传的实际结算入库,存在一定延迟,稍后刷新即可。
- 用量表中的花费与余额的减少量不一致。请先确认当前消耗是否在套餐额度内。套餐额度内的消耗不扣除余额, 总览页可查看当前窗口的剩余额度。
- 「实时请求」显示的体积较大,但花费不高。体积指传输大小,与计费无关,两者本就不成比例。详见《高速模式》中的字段说明。
若确认存在异常(例如未使用的时段出现大额消耗),请截取用量页并联系客服。 重装客户端无法解决计费问题,反而会增加排查难度。
