主流 AI 模型 API 价格对比:每百万 Token 谁更划算?
目录
先看懂这三个价格
第一次打开 API 价格表,最容易被“每百万 Token”吓到。它只是标价单位,不是要求你一次买一百万。Token 可以理解成模型处理内容时的计量单位,一个 Token 不固定等于一个汉字或一个单词。
先记住两个数就够了:输入价,是把材料交给模型处理的价格;输出价,是模型生成并计费的内容的价格。读很长的文件、只要一段摘要,输入占比可能更大;让它写长报告,输出成本也不能忽略。
第三个数是缓存读取价。它只适用于满足平台规则、命中缓存的那部分输入,不是所有请求都能享受。新手先按不命中缓存来估算,再根据真实账单调整,比较容易理解。
| 项目 | 可以怎样理解 | 比较时注意 |
|---|---|---|
| 输入 | 模型这次需要处理的材料 | 可能包含历史消息、文件和工具返回内容 |
| 输出 | 模型生成并计费的内容 | 可能包含推理用量,不只看屏幕上的字数 |
| 缓存读取 | 重复输入命中缓存后的价格 | 只算命中部分,写入或存储可能另收费 |
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则
主流模型各是多少钱
理解了计费项目,就可以看下面这张表了。单位统一为美元/百万 Token,输入列指普通、未命中缓存的输入。这里选取四家平台的代表模型,方便筛预算,不表示这些模型能力相同,也不是全部在售模型。
OpenAI 使用 Standard 短上下文价,DeepSeek 使用高峰价;Gemini 3.8 Flash 是有效至 2026 年底的当前价格。搜索、图片、缓存写入和存储等不在这几列里,后面会说明它们怎么影响总价。
| 模型 | 输入 | 缓存读取 | 输出 | 口径 |
|---|---|---|---|---|
| GPT-6 Luna [1] | $0.1 | $0.01 | $0.5 | Standard · 短上下文 |
| GPT-6.1 Sol [1] | $2 | $0.1 | $10 | Standard · 短上下文 |
| GPT-6 Astra [1] | $10 | $1 | $50 | Standard · 短上下文 |
| Claude Fable 5.1 [2] | $10 | $0.25 | $50 | 标准价 |
| Claude Haiku 4.5 [2] | $1 | $0.1 | $5 | 标准价 |
| Claude Sonnet 5.5 [2] | $2 | $0.2 | $10 | 标准价 |
| Claude Opus 5.5 [2] | $4 | $0.2 | $20 | 标准价 |
| Gemini 3.8 Flash [3] | $0.75 | $0.075 | $3.75 | Standard · 至 2026-12-31 |
| Gemini 3.5 Flash-Lite [3] | $0.3 | $0.03 | $2.5 | Standard · 文本 |
| DeepSeek-V4.1-Flash [4] | $0.3 | $0.006 | $1.2 | 高峰价 · deepseek-flash |
| DeepSeek-V4-Pro-0813 [4] | $1.32 | $0.044 | $3.96 | 高峰价 · deepseek-v4-pro |
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则
换成一次任务是多少钱
百万单价不够直观,我们换成一次请求:假设计费输入 10,000 Token、计费输出 2,000 Token,不用缓存,也不调用额外付费工具。计算时,把输入量和输出量分别除以一百万,再乘各自的单价,最后相加。
按这个例子,GPT-6.1 Sol 是 $0.04,Astra 是 $0.20。图里条越长,费用越高。但它只统一了计费量,没有保证答案质量相同;实际做同一件事,各模型可能生成不同长度的内容,也可能需要不同次数的重试。
线性刻度:0–0.2 美元
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则
哪些条件会改变账单
价格表里的数字都没看错,账单却不同,往往是计费条件变了。最常见的有四类:命中缓存、输入特别长、换了处理档位,以及遇到限时价格。
比如 GPT-6.1 Sol:输入超过 272K Token 后,整次请求进入长上下文档,输入和缓存费率变为短上下文的 2 倍,输出为 1.5 倍。别把“能放下这么多内容”和“放进去还是同样单价”当成一回事。
缓存也不是只看读取价。Claude 区分缓存写入和读取;Gemini 的缓存还可能按存储时间收费。内容只用一次、很快就不再复用时,未必能省下钱。
DeepSeek 低谷价为高峰价的一半。官方英文价目表列出的高峰时间换成北京时间,是周一至周五 09:00–12:00、14:00–18:00,中国公共假日除外;其余为低谷。能等待的批量任务,可以把这个时间差算进去。
Gemini 3.8 Flash 当前 Standard 输入/输出价为 $0.75/$3.75,有效至 2026-12-31;官方列出的 2027-01-01 起价格是 $1.50/$7.50。做长期预算时,不能一直沿用现在的优惠价。
缓存值得看真实请求记录。CCdocs 的编码案例里,大量输入是重复上下文;这种工作就不能只比较普通输入价。但如果你的请求每次都换一份新材料,也别照搬别人的缓存收益。先看自己的命中比例,再计算写入、读取和存储的完整费用。
| 条件 | 可能发生什么 | 怎么处理 |
|---|---|---|
| 长上下文 | 超过阈值后,整次请求费率可能提高 | 先看该模型的长度阈值 |
| 缓存 | 读取便宜,但写入和存储可能收费 | 按复用次数算完整成本 |
| Batch、Flex 或加速 | 价格和等待方式不同 | 比较相同处理档位 |
| 限时价与峰谷价 | 同一模型在不同时间价格不同 | 月度预算按实际使用时段和日期算 |
| 工具、图片与音频 | 不一定按这张文字价格表收费 | 另查所用能力的计费单位 |
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则[6] CCdocs:真实编码工作中的长上下文成本案例
估算自己的月度费用
到这里,可以把你的真实用量填进下面的计算器了。还没接过 API,就先用一小批任务试跑,从用量记录里取平均输入和输出,再乘预计每月的请求次数。不要直接把字数当成 Token 数。
例如每次仍是 10,000 输入、2,000 输出,每月 100 次,就填 100 万输入和 20 万输出。若一个任务平均调用三次,应统计这三次的总用量,而不是只填最后一次。
计算器估的是表中价格下、未命中缓存的文字费用;人民币按你填写的汇率换算。它不包含工具、缓存写入、长上下文加价等额外支出,也不等于第三方平台的最终报价。
默认 7 仅为预算示例,并非实时汇率。请按实际支付汇率修改。
1 = 100 万 Token。含计费推理输出;无缓存、工具、税费及长上下文加价。
- GPT-6 Luna
- $0.20 / 月约 ¥1.40 / 月
- DeepSeek-V4.1-Flash
- $0.54 / 月约 ¥3.78 / 月
- Gemini 3.5 Flash-Lite
- $0.80 / 月约 ¥5.60 / 月
- Gemini 3.8 Flash
- $1.50 / 月约 ¥10.50 / 月
- Claude Haiku 4.5
- $2.00 / 月约 ¥14.00 / 月
- DeepSeek-V4-Pro-0813
- $2.112 / 月约 ¥14.78 / 月
- GPT-6.1 Sol
- $4.00 / 月约 ¥28.00 / 月
- Claude Sonnet 5.5
- $4.00 / 月约 ¥28.00 / 月
- Claude Opus 5.5
- $8.00 / 月约 ¥56.00 / 月
- GPT-6 Astra
- $20.00 / 月约 ¥140.00 / 月
- Claude Fable 5.1
- $20.00 / 月约 ¥140.00 / 月
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则
最后怎么选才省钱
按上面的相同用量例子,表里 Luna 的文字费用最低,但这不等于所有任务都该交给它。规则简单、结果容易抽查,可以先试低价模型;任务复杂、错误会让你大幅返工,就应比较更强的模型。
GPT-6.1 Sol 和 Claude Sonnet 5.5 的普通输入/输出单价同为 $2/$10,只看这两列没有价格差别。下一步应该比较同一批任务的合格率、实际 Token 消耗和重试次数,而不是继续纠结哪个名字更划算。
还要认准具体版本。DeepSeek 的旧 Flash 名称目前会转到 V4.1-Flash;其更新日志又明确说明 V4 Pro 会继续提供 API 服务。网上旧发布稿和当前规则可能不一致,接入时看现行价目表与更新日志。
最后,给自己留一张简单的记录:这批任务共花了多少钱,有多少结果可以直接用。把调用、重试和人工修改都算上,再除以合格数量,才知道真正做好一件事要花多少。
低单价是不是一定省钱?DeepSeek V4.1 的用户讨论刚好给了两个方向:有开发者觉得编码调试快、花费低;也有人在 Flash 的文档和代码任务中遇到更多修改、调用和等待。它们都是个人体验,不是统一条件下的测评。对你来说,真正该比较的是“得到一份合格结果花了多少钱”,包括重试,而不是只比较每百万 Token。
先说清什么样才算做好
明确哪些错误不能接受,避免只看生成速度。
拿同一批任务试两款模型
按实际计费量记录结果,不预设贵的一定值得。
算一算做好一件事花多少钱
模型费 + 重试费 + 人工修改成本,再除以合格数量。
本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[4] DeepSeek:模型、峰谷价格及时间规则[5] DeepSeek:版本变更与 V4 Pro 继续服务说明[7] Reddit:DeepSeek V4.1 编码体验(用户自述)[8] Reddit:DeepSeek V4.1 Flash 的任务总成本(用户自述)