大模型 API 计费指南: Token 价格是怎么算的

面向第一次接大模型 API 的开发者与产品经理 · 结合 2026 年国内主流平台的现行计费规则

先弄懂 token 是什么

大模型不是按"字数"计费的, 而是按 token。token 是模型处理文本的最小单位: 一个短英文单词大约 1 个 token, 一个汉字大约 1~2 个 token, 标点和空格也占 token。你发给模型的全部内容(系统提示词、对话历史、文档片段)算输入 token, 模型生成的回复算输出 token, 两者分开计价——输出价格通常是输入的 2~8 倍。

所有正规平台都会在控制台里返回每次调用的实际 token 用量, 拿它乘以单价, 就是这次调用的成本。

核心公式

费用 = 输入 token 数 ÷ 1,000,000 × 输入单价 + 输出 token 数 ÷ 1,000,000 × 输出单价

单价即各平台公布的"每百万 tokens 价格", 在我们的价格总表里可以逐模型查到。举例: 用输入 2 元、输出 8 元的模型跑一次对话, 输入 5,000 token、输出 1,000 token, 费用 = 0.005 × 2 + 0.001 × 8 = 0.018 元。看起来极少, 但乘上百万级调用量就是真金白银, 所以"选对模型档位"是降本的第一步。

四种常见的省钱(或踩坑)机制

1. 缓存命中折扣

多数平台对重复出现的输入前缀(固定的系统提示词、知识库片段)提供缓存命中价, 通常比正常输入便宜 5~10 倍。把不变的指令放在 prompt 开头、变化的内容放后面, 就能稳定吃到这个折扣。DeepSeek、Kimi、千问、Claude 都支持。

2. 高峰 / 空闲分时

DeepSeek 现行价格区分高峰时段(约 08:30-00:30)与空闲时段(约 00:30-08:30), 空闲档便宜一半。能离线跑的批处理任务(数据清洗、摘要、评测)挪到深夜, 成本直接减半。

3. 长上下文分档

千问等平台按"单次请求输入 token 落在哪一档"计价, 例如 0-128K 一档、128K-256K 一档, 超档后全部 token 按高档单价结算——注意是全部, 不是超出部分。控制单次输入长度, 可能比换模型更省钱。

4. Batch 批处理五折

不要求实时返回的任务用 Batch 接口, 阿里云百炼等平台直接五折。适合离线打标、批量翻译、评测跑分。

一个月要花多少钱: 快速估算

拿一个客服机器人举例: 每天 1 万次对话, 每次输入 3,000 token(含历史)、输出 500 token, 用输入 2 元 / 输出 8 元的模型:

日成本 = 1 万 × (0.003×2 + 0.0005×8) = 1 万 × 0.01 = 100 元; 月成本约 3,000 元

如果换用输入 0.8 元 / 输出 2 元的中档模型, 月成本降到约 1,200 元。如果命中率 60% 且输入全部走缓存命中价 0.2 元, 输入部分再省一半以上。不同档位模型的质量差异, 在简单任务上往往可以忽略——这也是价格对比表存在的意义。

调价频繁, 怎么第一时间知道?

2024 年以来主流模型经历过数轮大幅降价, 每一轮都会重塑"性价比之王"的排序。TokenPlan 每日自动比对各官方定价页, 变动会记入价格变动记录, 价格总表则永远保持最新一版。