大模型 API 价格总表

全部价格单位: 元 / 百万 tokens (1M tokens)。数据更新日期 2026-09-19, 每日自动比对官方定价页。缓存命中、分时、分档等规则见各厂商备注, 最终以官方页面为准。

DeepSeek

更新于 2026-09-19 · 官方定价页 ↗ · 2 个模型 · 输入/输出区分高峰(08:30-00:00)与空闲(00:30-08:30)时段; 硬盘缓存命中大幅优惠

模型计费项(元/百万 tokens)上下文
deepseek-flash (1) 输入·缓存命中·空闲0.02 输入·缓存命中·高峰0.04 输入·缓存未命中·空闲1 输入·缓存未命中·高峰2 输出·空闲4 输出·高峰8
deepseek-v4-pro (2) 输入·缓存命中·空闲0.15 输入·缓存命中·高峰0.3 输入·缓存未命中·空闲4.5 输入·缓存未命中·高峰9 输出·空闲13.5 输出·高峰27

智谱 GLM

更新于 2026-09-06 · 官方定价页 ↗ · 15 个模型 · GLM-5 系列价格按上下文长度分档; GLM-5.3-Flash 为限时 5 折价

模型计费项(元/百万 tokens)上下文
glm-5.3 输入8 输出28 输入·缓存命中2 1M
glm-5.3-flash 输入·限时5折(原价0.8)0.4 输出·限时5折(原价2.8)1.4 输入·缓存命中·限时5折(原价0.23)0.115 1M
glm-5.2 输入8 输出28 输入·缓存命中2 1M
glm-5.1 输入·0-32K6 输出·0-32K24 输入·缓存命中·0-32K1.3 输入·32K+8 输出·32K+28 输入·缓存命中·32K+2 1M
glm-5 输入·0-32K4 输出·0-32K18 输入·缓存命中·0-32K1 输入·32K+6 输出·32K+22 输入·缓存命中·32K+1.5 1M
glm-5-turbo 输入·0-32K5 输出·0-32K22 输入·缓存命中·0-32K1.2 输入·32K+7 输出·32K+26 输入·缓存命中·32K+1.8 1M
glm-5v-turbo 输入·0-32K5 输出·0-32K22 输入·缓存命中·0-32K1.2 输入·32K+7 输出·32K+26 输入·缓存命中·32K+1.8 1M
glm-4.7 输入·入<32K·出<0.2K2 输出·入<32K·出<0.2K8 输入·缓存命中·入<32K·出<0.2K0.4 输入·入<32K·出≥0.2K3 输出·入<32K·出≥0.2K14 输入·缓存命中·入<32K·出≥0.2K0.6 输入·入32-200K4 输出·入32-200K16 输入·缓存命中·入32-200K0.8 200K
glm-4.7-flashx 输入0.5 输出3 输入·缓存命中0.1 200K
glm-4.7-flash 输入(免费)0 输出(免费)0 200K
glm-4.6v 输入·0-32K1 输出·0-32K3 输入·缓存命中·0-32K0.2 输入·32-128K2 输出·32-128K6 输入·缓存命中·32-128K0.4 128K
glm-4.6v-flashx 输入·0-32K0.15 输出·0-32K1.5 输入·缓存命中·0-32K0.03 输入·32-128K0.3 输出·32-128K3 输入·缓存命中·32-128K0.03 128K
glm-4.6v-flash 输入(免费)0 输出(免费)0 128K
glm-4.5v 输入·0-32K2 输出·0-32K6 输入·缓存命中·0-32K0.4 输入·32-64K4 输出·32-64K12 输入·缓存命中·32-64K0.8 64K
glm-4.5-air 输入·入<32K·出<0.2K0.8 输出·入<32K·出<0.2K2 输入·缓存命中·入<32K·出<0.2K0.16 输入·入<32K·出≥0.2K0.8 输出·入<32K·出≥0.2K6 输入·缓存命中·入<32K·出≥0.2K0.16 输入·入32-128K1.2 输出·入32-128K8 输入·缓存命中·入32-128K0.24 128K

Kimi (月之暗面)

更新于 2026-09-19 · 官方定价页 ↗ · 4 个模型

模型计费项(元/百万 tokens)上下文
kimi-k3 输入·缓存命中2 输入·缓存未命中20 输出100 1,048,576 tokens
kimi-k2.7-code 输入·缓存命中1.3 输入·缓存未命中6.5 输出27 262,144 tokens
kimi-k2.7-code-highspeed 输入·缓存命中2.6 输入·缓存未命中13 输出54 262,144 tokens
kimi-k2.6 输入·缓存命中1.1 输入·缓存未命中6.5 输出27 262,144 tokens

阿里云百炼 Qwen

更新于 2026-09-19 · 官方定价页 ↗ · 40 个模型 · 按输入 Token 长度分档计价; Batch 调用五折; 收录华北2(北京)实时调用价

模型计费项(元/百万 tokens)上下文
qwen3.8-max-prime 输入·0-1M·非思考和思考模式24 输出·0-1M·非思考和思考模式72
qwen3.8-max 输入·0-1M·非思考和思考模式12 输出·0-1M·非思考和思考模式36
qwen3.8-max-0902 输入·0-1M·非思考和思考模式12 输出·0-1M·非思考和思考模式36
qwen3.7-max 输入·0-1M·非思考和思考模式12 输出·0-1M·非思考和思考模式36
qwen3.7-max-2026-06-08 输入·0-1M·非思考和思考模式12 输出·0-1M·非思考和思考模式36
qwen3.7-max-2026-05-20 输入·0-1M·非思考和思考模式12 输出·0-1M·非思考和思考模式36
qwen3.7-max-preview 输入·0-1M·仅思考模式12 输出·0-1M·仅思考模式36
qwen3.7-max-2026-05-17 输入·0-1M·仅思考模式12 输出·0-1M·仅思考模式36
qwen3.6-max-preview 输入·0-128K·非思考和思考模式9 输出·0-128K·非思考和思考模式54
qwen3-max 输入·0-32K·非思考和思考模式2.5 输出·0-32K·非思考和思考模式10
qwen3-max-2026-01-23 输入·0-32K·非思考和思考模式2.5 输出·0-32K·非思考和思考模式10
qwen3-max-2025-09-23 输入·0-32K·仅非思考模式6 输出·0-32K·仅非思考模式24
qwen3-max-preview 输入·0-32K·非思考和思考模式6 输出·0-32K·非思考和思考模式24
qwen3.7-plus-2026-05-26 输入·0-256K2 输出·0-256K8
qwen3.6-plus 输入·0-256K2 输出·0-256K12
qwen3.6-plus-2026-04-02 输入·0-256K2 输出·0-256K12
qwen3.5-plus 输入·0-128K0.8 输出·0-128K4.8
qwen3.5-plus-2026-04-20 输入·0-128K0.8 输出·0-128K4.8
qwen3.5-plus-2026-02-15 输入·0-128K0.8 输出·0-128K4.8
qwen-plus 输入·0-128K0.8 输出·0-128K2
qwen-plus-latest 输入·0-128K0.8 输出·0-128K2
qwen-plus-2025-12-01 输入·0-128K0.8 输出·0-128K2
qwen-plus-2025-09-11 输入·0-128K0.8 输出·0-128K2
qwen-plus-2025-07-28 输入·0-128K0.8 输出·0-128K2
qwen-plus-2025-07-14 输入·无阶梯计价0.8 输出·无阶梯计价2
qwen-plus-2025-04-28 输入·无阶梯计价0.8 输出·无阶梯计价2
qwen3.8-flash 输入·0-1M·非思考和思考模式0.8 输出·0-1M·非思考和思考模式2.7
qwen3.7-flash 输入·0-32K·非思考和思考模式0.2 输出·0-32K·非思考和思考模式0.8
qwen3.7-flash-2026-07-15 输入·0-32K·非思考和思考模式0.2 输出·0-32K·非思考和思考模式0.8
qwen3.6-flash 输入·0-256K·非思考和思考模式1.2 输出·0-256K·非思考和思考模式7.2
qwen3.6-flash-2026-04-16 输入·0-256K·非思考和思考模式1.2 输出·0-256K·非思考和思考模式7.2
qwen3.5-flash 输入·0-128K·非思考和思考模式0.2 输出·0-128K·非思考和思考模式2
qwen3.5-flash-2026-02-23 输入·0-128K·非思考和思考模式0.2 输出·0-128K·非思考和思考模式2
qwen-flash 输入·0-128K·非思考和思考模式0.15 输出·0-128K·非思考和思考模式1.5
qwen-flash-2025-07-28 输入·0-128K·非思考和思考模式0.15 输出·0-128K·非思考和思考模式1.5
qwen3-coder-plus 输入·0-32K4 输出·0-32K16
qwen3-coder-plus-2025-09-23 输入·0-32K4 输出·0-32K16
qwen3-coder-plus-2025-07-22 输入·0-32K4 输出·0-32K16
qwen3-coder-flash 输入·0-32K1 输出·0-32K4
qwen3-coder-flash-2025-07-28 输入·0-32K1 输出·0-32K4

MiniMax

更新于 2026-09-06 · 官方定价页 ↗ · 3 个模型 · M3 系列永久五折, 表中为折后结算价; 标准/优先为官方两档服务模式

模型计费项(元/百万 tokens)上下文
minimax-m3 输入·≤512K·标准·永久五折(刊例4.20)2.1 输出·≤512K·标准(刊例16.80)8.4 缓存读取·≤512K·标准(刊例0.84)0.42 输入·>512K·标准·永久五折(刊例8.40)4.2 输出·>512K·标准(刊例33.60)16.8 缓存读取·>512K·标准(刊例1.68)0.84 输入·≤512K·优先(刊例6.30)3.15 输出·≤512K·优先(刊例25.20)12.6 输入·>512K·优先(刊例12.60)6.3 输出·>512K·优先(刊例50.40)25.2 512K+
minimax-m2.7 输入2.1 输出8.4 缓存读取0.42 缓存写入2.625
minimax-m2.7-highspeed 输入4.2 输出16.8 缓存读取0.42 缓存写入2.625

阶跃星辰

更新于 2026-09-19 · 官方定价页 ↗ · 7 个模型

模型计费项(元/百万 tokens)上下文
step-1o-audio 输入·缓存命中5 输入·缓存未命中25 输出60
step-1o-turbo-vision 输入·缓存命中0.5 输入·缓存未命中2.5 输出8
step-3.5-flash 输入·缓存命中0.14 输入·缓存未命中0.7 输出2.1
step-3.5-flash-2603 输入·缓存命中0.14 输入·缓存未命中0.7 输出2.1
step-3.7-flash 输入·缓存命中0.27 输入·缓存未命中1.35 输出8.1
step-audio-2 输入·缓存命中2 输入·缓存未命中10 输出70
step-audio-r1.5 输入·缓存命中2 输入·缓存未命中10 输出105