使用场景
一个 API,运行编程 agent
编程 agent 整天都在跑:发送长上下文,发起大量工具调用。BoostRail 用同一个 Key 提供 Anthropic Messages、OpenAI Responses 和 Chat Completions 三种格式,agent 本身不用改,只换 base URL。
- 有现成配置的工具
- 6
- 文本模型
- 59
- 接口格式
- OpenAI + Anthropic
- 组织请求上限
- 600 次 / 分钟
这类负载需要什么
- 长会话中上下文反复出现,提示词缓存和缓存读取的价格很关键。
- 工具调用和多轮历史,在每次请求中都保持完整。
- 可以按任务切换模型,不需要重新接入。
- 团队可以按开发者、项目或流水线设置花费上限。
BoostRail 怎么处理
- Claude Code 走 /v1/messages,Codex CLI 走 /v1/responses,Cline、OpenCode、Continue 和 Aider 走 Chat Completions,全部用同一个 Key、同一个目录。
- 设置 ANTHROPIC_MODEL,就能让 Claude Code 使用目录里的任意文本模型;换模型只改一个 ID。
- 缓存读取按每款模型公布的缓存读取价计费,用量里会报告命中缓存的输入。
- 每个 API Key 可以单独设每日或每月花费上限,以及每分钟请求上限,在控制台设置。
- 如果线路在回复开始之前出错,请求会换到同一模型的另一条线路。
怎么设置
- 给每位开发者或每条流水线各建一个 Key,在控制台设好花费上限。
- 从编程工具页复制你所用工具的配置。
- 开始长会话之前,先运行编程工具页上的那条检查命令。
需要了解的限制
当前的实际行为,与文档一致。
- POST /v1/messages/count_tokens 返回 404,Claude Code 会改用本地估算。
- 思考设置会生效,但思考内容不会以 thinking 块返回。
- 工具结果里的图片会换成一小段文字占位。
- /v1/responses 是无状态的:不支持 previous_response_id 和 store: true。
- 每个组织每分钟最多发 600 次请求。
接着看
获取 API Key
Claude Code、Codex CLI、Cline 等工具共用一个 Key,每个 Key 可以单独设花费上限。
更新日期:2026-10-05