一个月到底要花多少
单价看不出花多少钱,换算成月账单才有感觉。下表按三种用量规模算出月成本,并把命中缓存的输入单独计价——对编程 agent 来说,输入里绝大部分是重复上下文。
三档用量的假设
轻度
每月输入 500 万 + 输出 100 万 token,输入的一半命中缓存。约等于个人一周用几天 agent。
常规
每月输入 3000 万 + 输出 600 万 token,输入 70% 命中缓存。约等于一个开发者每天都在用。
重度
每月输入 1.5 亿 + 输出 3000 万 token,输入 80% 命中缓存。小团队,或一个长跑 agent。
| 模型 | 轻度 | 常规 | 重度 |
|---|---|---|---|
claude-sonnet-5 | $14.72 | $78.09 | $364.80 |
claude-opus-5 | $36.81 | $195.23 | $912.00 |
claude-haiku-4.5 | $7.36 | $39.05 | $182.40 |
gpt-5.4 | $20.78 | $111.86 | $527.25 |
deepseek-v4-pro | $1.96 | $9.55 | $42.15 |
deepseek-v4-flash | $0.63 | $3.07 | $13.57 |
kimi-k2.7-code | $6.51 | $34.71 | $162.73 |
qwen3-coder-plus | $14.40 | $77.76 | $367.20 |
glm-5.2 | $6.16 | $31.31 | $142.42 |
minimax-m2.7 | $1.54 | $8.00 | $36.94 |
按当前目录价算出的月成本(美元)。命中缓存的输入按缓存读价计,其余输入按输入价计。
换成你自己的数字
算法不藏着:把你的月 token 量拿来,按重复上下文的占比拆分输入,再套目录里的每百万单价即可。
月成本
月成本 =
(input_M x (1 - cached_share) x input_price)
+ (input_M x cached_share x cache_read_price)
+ (output_M x output_price)
# input_M / output_M = millions of tokens per month
# prices = USD per 1M tokens, from the catalog缓存命中率比单价更能决定账单
缓存读按输入价的 10% 计,缓存写不加价——首遍按正常输入价走,不额外收费。当负载里大部分输入都是重复上下文时,这一项对账单的影响远大于单价上省下的那几个百分点。
所以上面三档的缓存命中率是递增的:agent 用得越重,重复的上下文占比越高,「按单价拍脑袋估」与「实际账单」之间的差距也就越大。
以上是按公开目录价与上述假设估算的结果,不构成报价。每次请求的实际单价与真实用量以控制台为准。
常见问题
这些价格从哪来?
与模型页同一份目录,价格变动时从生产价目表重新生成。页面上没有任何手打的价格。
在这之外还有订阅费或席位费吗?
没有。用预付余额按 token 以美元计费,没有席位费、没有月度低消、也没有订阅时间窗。
如果我的缓存命中率没这么高呢?
用上面的公式换成你自己的比例。完全不走缓存就把命中比例设为 0,输入全部按输入价计。
建一把 Key,从第一次调用起,控制台就会按这套价格显示你的真实用量。