自带 Key(BYOK)已上线,每月 1,000,000 次免费 BYOK 请求,不需要充值了解详情

使用场景

一个 API,运行编程 agent

编程 agent 整天都在跑:发送长上下文,发起大量工具调用。BoostRail 用同一个 Key 提供 Anthropic Messages、OpenAI Responses 和 Chat Completions 三种格式,agent 本身不用改,只换 base URL。

有现成配置的工具
6
文本模型
59
接口格式
OpenAI + Anthropic
组织请求上限
600 次 / 分钟

这类负载需要什么

  • 长会话中上下文反复出现,提示词缓存和缓存读取的价格很关键。
  • 工具调用和多轮历史,在每次请求中都保持完整。
  • 可以按任务切换模型,不需要重新接入。
  • 团队可以按开发者、项目或流水线设置花费上限。

BoostRail 怎么处理

  • Claude Code 走 /v1/messages,Codex CLI 走 /v1/responses,Cline、OpenCode、Continue 和 Aider 走 Chat Completions,全部用同一个 Key、同一个目录。
  • 设置 ANTHROPIC_MODEL,就能让 Claude Code 使用目录里的任意文本模型;换模型只改一个 ID。
  • 缓存读取按每款模型公布的缓存读取价计费,用量里会报告命中缓存的输入。
  • 每个 API Key 可以单独设每日或每月花费上限,以及每分钟请求上限,在控制台设置。
  • 如果线路在回复开始之前出错,请求会换到同一模型的另一条线路。

怎么设置

  1. 给每位开发者或每条流水线各建一个 Key,在控制台设好花费上限。
  2. 从编程工具页复制你所用工具的配置。
  3. 开始长会话之前,先运行编程工具页上的那条检查命令。

需要了解的限制

当前的实际行为,与文档一致。

  • POST /v1/messages/count_tokens 返回 404,Claude Code 会改用本地估算。
  • 思考设置会生效,但思考内容不会以 thinking 块返回。
  • 工具结果里的图片会换成一小段文字占位。
  • /v1/responses 是无状态的:不支持 previous_response_id 和 store: true。
  • 每个组织每分钟最多发 600 次请求。

接着看

获取 API Key

Claude Code、Codex CLI、Cline 等工具共用一个 Key,每个 Key 可以单独设花费上限。

更新日期:2026-10-05