API 中转站怎么计费?输入、输出、缓存 token 与「官方 1 折」实算
披露:LLM API Guide 由 SeedRouter 团队维护,文中价格来自 SeedRouter 官网 2026-10-08 的价格表,之后可能调整,请以 SeedRouter 官网实时价格为准。
三种 token,三个单价
| 类型 | 含义 | 计费特点 |
|---|---|---|
| 输入(input) | 发给模型的提示词、历史对话、文件内容 | 编程场景用量最大 |
| 输出(output) | 模型生成的回答和代码 | 单价通常是输入的 3 到 5 倍 |
| 缓存读取(cache read) | 与之前请求相同、命中缓存的输入前缀 | 单价远低于普通输入 |
价格通常以「每百万 token(1M tokens)」标价。计算公式:
费用 = 未命中缓存的输入 × 输入单价
+ 命中缓存的输入 × 缓存单价
+ 输出 × 输出单价
「官方 1 折 / 3 折」是什么意思
指同一种 token 按官方公开单价的 10% 或 30% 收费。以 SeedRouter 首页 2026-10-08 的价格表为例(单位:美元 / 每百万 token):
| 模型 | SeedRouter 输入 / 输出 | 官方输入 / 输出 | 折扣 |
|---|---|---|---|
| gpt-6.1-sol | $0.2 / $1 | $2 / $10 | 官方 1 折 |
| gpt-6-astra | $1 / $5 | $10 / $50 | 官方 1 折 |
| claude-opus-5-5 | $1.2 / $6 | $4 / $20 | 官方 3 折 |
| claude-sonnet-5-5 | $0.6 / $3 | $2 / $10 | 官方 3 折 |
| grok-4.7 | $0.6 / $1.8 | $2 / $6 | 官方 3 折 |
| gemini-3.8-flash | $0.225 / $1.125 | $0.75 / $3.75 | 官方 3 折 |
对比基于标准短上下文 token;长上下文、优先级、工具、存储等特殊计费另计。
实算:一个月的 Codex 用量
假设一位开发者一个月用 gpt-6.1-sol:
- 输入 1 亿(100M)token,其中 70% 命中缓存
- 输出 500 万(5M)token
gpt-6.1-sol 的缓存读取单价:官方 $0.1,SeedRouter $0.01(每百万 token)。
| 项目 | 用量 | 官方费用 | SeedRouter 费用 |
|---|---|---|---|
| 未缓存输入 | 30M | 30 × $2 = $60 | 30 × $0.2 = $6 |
| 缓存命中 | 70M | 70 × $0.1 = $7 | 70 × $0.01 = $0.7 |
| 输出 | 5M | 5 × $10 = $50 | 5 × $1 = $5 |
| 合计 | $117 | $11.7 |
同样的用量,按官方单价约 $117,按 SeedRouter 价格约 $11.7。你也可以在 SeedRouter 首页的费用计算器里调整月用量、输入输出比例和缓存比例自己算。
省钱的三个习惯
- 提高缓存命中:让项目说明、规则文件这类固定内容放在提示词前部,尽量少改,长会话比频繁新开会话更容易命中缓存。
- 按任务选模型:日常改代码用便宜的模型,复杂架构问题再切到旗舰模型。
- 定期看用量日志:按模型、按 Key 查看消耗,发现异常的 Key 及时停用。
小结
看懂计费只需要记住三个单价和一个公式。比较中转站价格时,同时比较输入、输出和缓存三个单价,并用自己的真实用量估算,而不是只看一个“几折”。
常见问题
为什么 Codex、Claude Code 的输入 token 特别多?
编程 Agent 每一轮都会把对话历史、文件内容和工具结果再次发送给模型,所以输入远多于输出,缓存命中率对成本影响很大。
缓存写入要额外收费吗?
取决于模型。Claude 系列通常对写入缓存单独计价,GPT 系列一般只对缓存读取计价。以网关价格表和用量日志为准。
首页价格和实际扣费不一致怎么办?
价格表按标准短上下文 token 对比,长上下文、优先级、工具调用等特殊计费另计。实际以控制台用量日志为准,有疑问可以联系客服核对。