自带密钥 BYOK 上线——每月 1,000,000 次免费 BYOK 请求,无需充值 了解详情 →

一个月到底要花多少

单价看不出花多少钱,换算成月账单才有感觉。下表按三种用量规模算出月成本,并把命中缓存的输入单独计价——对编程 agent 来说,输入里绝大部分是重复上下文。

三档用量的假设

轻度

每月输入 500 万 + 输出 100 万 token,输入的一半命中缓存。约等于个人一周用几天 agent。

常规

每月输入 3000 万 + 输出 600 万 token,输入 70% 命中缓存。约等于一个开发者每天都在用。

重度

每月输入 1.5 亿 + 输出 3000 万 token,输入 80% 命中缓存。小团队,或一个长跑 agent。

模型轻度常规重度
claude-sonnet-5$14.72$78.09$364.80
claude-opus-5$36.81$195.23$912.00
claude-haiku-4.5$7.36$39.05$182.40
gpt-5.4$20.78$111.86$527.25
deepseek-v4-pro$1.96$9.55$42.15
deepseek-v4-flash$0.63$3.07$13.57
kimi-k2.7-code$6.51$34.71$162.73
qwen3-coder-plus$14.40$77.76$367.20
glm-5.2$6.16$31.31$142.42
minimax-m2.7$1.54$8.00$36.94

按当前目录价算出的月成本(美元)。命中缓存的输入按缓存读价计,其余输入按输入价计。

换成你自己的数字

算法不藏着:把你的月 token 量拿来,按重复上下文的占比拆分输入,再套目录里的每百万单价即可。

月成本

月成本 =
  (input_M x (1 - cached_share) x input_price)
+ (input_M x cached_share       x cache_read_price)
+ (output_M                     x output_price)

# input_M / output_M = millions of tokens per month
# prices = USD per 1M tokens, from the catalog

缓存命中率比单价更能决定账单

缓存读按输入价的 10% 计,缓存写不加价——首遍按正常输入价走,不额外收费。当负载里大部分输入都是重复上下文时,这一项对账单的影响远大于单价上省下的那几个百分点。

所以上面三档的缓存命中率是递增的:agent 用得越重,重复的上下文占比越高,「按单价拍脑袋估」与「实际账单」之间的差距也就越大。

以上是按公开目录价与上述假设估算的结果,不构成报价。每次请求的实际单价与真实用量以控制台为准。

常见问题

这些价格从哪来?

与模型页同一份目录,价格变动时从生产价目表重新生成。页面上没有任何手打的价格。

在这之外还有订阅费或席位费吗?

没有。用预付余额按 token 以美元计费,没有席位费、没有月度低消、也没有订阅时间窗。

如果我的缓存命中率没这么高呢?

用上面的公式换成你自己的比例。完全不走缓存就把命中比例设为 0,输入全部按输入价计。

建一把 Key,从第一次调用起,控制台就会按这套价格显示你的真实用量。

获取 API Key 查看全部模型与价格 编程接入

更新日期:2026-08-04