主流 AI 模型 API 价格对比:每百万 Token 谁更划算?

目录

先看懂这三个价格

第一次打开 API 价格表,最容易被“每百万 Token”吓到。它只是标价单位,不是要求你一次买一百万。Token 可以理解成模型处理内容时的计量单位,一个 Token 不固定等于一个汉字或一个单词。

先记住两个数就够了:输入价,是把材料交给模型处理的价格;输出价,是模型生成并计费的内容的价格。读很长的文件、只要一段摘要,输入占比可能更大;让它写长报告,输出成本也不能忽略。

第三个数是缓存读取价。它只适用于满足平台规则、命中缓存的那部分输入,不是所有请求都能享受。新手先按不命中缓存来估算,再根据真实账单调整,比较容易理解。

输入、输出与缓存
项目可以怎样理解比较时注意
输入模型这次需要处理的材料可能包含历史消息、文件和工具返回内容
输出模型生成并计费的内容可能包含推理用量,不只看屏幕上的字数
缓存读取重复输入命中缓存后的价格只算命中部分,写入或存储可能另收费

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则

主流模型各是多少钱

理解了计费项目,就可以看下面这张表了。单位统一为美元/百万 Token,输入列指普通、未命中缓存的输入。这里选取四家平台的代表模型,方便筛预算,不表示这些模型能力相同,也不是全部在售模型。

OpenAI 使用 Standard 短上下文价,DeepSeek 使用高峰价;Gemini 3.8 Flash 是有效至 2026 年底的当前价格。搜索、图片、缓存写入和存储等不在这几列里,后面会说明它们怎么影响总价。

模型单价(美元 / 百万 Token)
模型输入缓存读取输出口径
GPT-6 Luna [1]$0.1$0.01$0.5Standard · 短上下文
GPT-6.1 Sol [1]$2$0.1$10Standard · 短上下文
GPT-6 Astra [1]$10$1$50Standard · 短上下文
Claude Fable 5.1 [2]$10$0.25$50标准价
Claude Haiku 4.5 [2]$1$0.1$5标准价
Claude Sonnet 5.5 [2]$2$0.2$10标准价
Claude Opus 5.5 [2]$4$0.2$20标准价
Gemini 3.8 Flash [3]$0.75$0.075$3.75Standard · 至 2026-12-31
Gemini 3.5 Flash-Lite [3]$0.3$0.03$2.5Standard · 文本
DeepSeek-V4.1-Flash [4]$0.3$0.006$1.2高峰价 · deepseek-flash
DeepSeek-V4-Pro-0813 [4]$1.32$0.044$3.96高峰价 · deepseek-v4-pro

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则

换成一次任务是多少钱

百万单价不够直观,我们换成一次请求:假设计费输入 10,000 Token、计费输出 2,000 Token,不用缓存,也不调用额外付费工具。计算时,把输入量和输出量分别除以一百万,再乘各自的单价,最后相加。

按这个例子,GPT-6.1 Sol 是 $0.04,Astra 是 $0.20。图里条越长,费用越高。但它只统一了计费量,没有保证答案质量相同;实际做同一件事,各模型可能生成不同长度的内容,也可能需要不同次数的重试。

单次请求费用估算
GPT-6 Luna0.002 美元
DeepSeek-V4.1-Flash0.0054 美元
Gemini 3.5 Flash-Lite0.008 美元
Gemini 3.8 Flash0.015 美元
Claude Haiku 4.50.02 美元
DeepSeek-V4-Pro-08130.02112 美元
GPT-6.1 Sol0.04 美元
Claude Sonnet 5.50.04 美元
Claude Opus 5.50.08 美元
GPT-6 Astra0.2 美元
Claude Fable 5.10.2 美元

线性刻度:0–0.2 美元

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则

哪些条件会改变账单

价格表里的数字都没看错,账单却不同,往往是计费条件变了。最常见的有四类:命中缓存、输入特别长、换了处理档位,以及遇到限时价格。

比如 GPT-6.1 Sol:输入超过 272K Token 后,整次请求进入长上下文档,输入和缓存费率变为短上下文的 2 倍,输出为 1.5 倍。别把“能放下这么多内容”和“放进去还是同样单价”当成一回事。

缓存也不是只看读取价。Claude 区分缓存写入和读取;Gemini 的缓存还可能按存储时间收费。内容只用一次、很快就不再复用时,未必能省下钱。

DeepSeek 低谷价为高峰价的一半。官方英文价目表列出的高峰时间换成北京时间,是周一至周五 09:00–12:00、14:00–18:00,中国公共假日除外;其余为低谷。能等待的批量任务,可以把这个时间差算进去。

Gemini 3.8 Flash 当前 Standard 输入/输出价为 $0.75/$3.75,有效至 2026-12-31;官方列出的 2027-01-01 起价格是 $1.50/$7.50。做长期预算时,不能一直沿用现在的优惠价。

缓存值得看真实请求记录。CCdocs 的编码案例里,大量输入是重复上下文;这种工作就不能只比较普通输入价。但如果你的请求每次都换一份新材料,也别照搬别人的缓存收益。先看自己的命中比例,再计算写入、读取和存储的完整费用。

计费条件检查
条件可能发生什么怎么处理
长上下文超过阈值后,整次请求费率可能提高先看该模型的长度阈值
缓存读取便宜,但写入和存储可能收费按复用次数算完整成本
Batch、Flex 或加速价格和等待方式不同比较相同处理档位
限时价与峰谷价同一模型在不同时间价格不同月度预算按实际使用时段和日期算
工具、图片与音频不一定按这张文字价格表收费另查所用能力的计费单位

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则[6] CCdocs:真实编码工作中的长上下文成本案例

估算自己的月度费用

到这里,可以把你的真实用量填进下面的计算器了。还没接过 API,就先用一小批任务试跑,从用量记录里取平均输入和输出,再乘预计每月的请求次数。不要直接把字数当成 Token 数。

例如每次仍是 10,000 输入、2,000 输出,每月 100 次,就填 100 万输入和 20 万输出。若一个任务平均调用三次,应统计这三次的总用量,而不是只填最后一次。

计算器估的是表中价格下、未命中缓存的文字费用;人民币按你填写的汇率换算。它不包含工具、缓存写入、长上下文加价等额外支出,也不等于第三方平台的最终报价。

默认 7 仅为预算示例,并非实时汇率。请按实际支付汇率修改。

1 = 100 万 Token。含计费推理输出;无缓存、工具、税费及长上下文加价。

GPT-6 Luna
$0.20 / 月约 ¥1.40 / 月
DeepSeek-V4.1-Flash
$0.54 / 月约 ¥3.78 / 月
Gemini 3.5 Flash-Lite
$0.80 / 月约 ¥5.60 / 月
Gemini 3.8 Flash
$1.50 / 月约 ¥10.50 / 月
Claude Haiku 4.5
$2.00 / 月约 ¥14.00 / 月
DeepSeek-V4-Pro-0813
$2.112 / 月约 ¥14.78 / 月
GPT-6.1 Sol
$4.00 / 月约 ¥28.00 / 月
Claude Sonnet 5.5
$4.00 / 月约 ¥28.00 / 月
Claude Opus 5.5
$8.00 / 月约 ¥56.00 / 月
GPT-6 Astra
$20.00 / 月约 ¥140.00 / 月
Claude Fable 5.1
$20.00 / 月约 ¥140.00 / 月

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[3] Google:Gemini Developer API 价格[4] DeepSeek:模型、峰谷价格及时间规则

最后怎么选才省钱

按上面的相同用量例子,表里 Luna 的文字费用最低,但这不等于所有任务都该交给它。规则简单、结果容易抽查,可以先试低价模型;任务复杂、错误会让你大幅返工,就应比较更强的模型。

GPT-6.1 Sol 和 Claude Sonnet 5.5 的普通输入/输出单价同为 $2/$10,只看这两列没有价格差别。下一步应该比较同一批任务的合格率、实际 Token 消耗和重试次数,而不是继续纠结哪个名字更划算。

还要认准具体版本。DeepSeek 的旧 Flash 名称目前会转到 V4.1-Flash;其更新日志又明确说明 V4 Pro 会继续提供 API 服务。网上旧发布稿和当前规则可能不一致,接入时看现行价目表与更新日志。

最后,给自己留一张简单的记录:这批任务共花了多少钱,有多少结果可以直接用。把调用、重试和人工修改都算上,再除以合格数量,才知道真正做好一件事要花多少。

低单价是不是一定省钱?DeepSeek V4.1 的用户讨论刚好给了两个方向:有开发者觉得编码调试快、花费低;也有人在 Flash 的文档和代码任务中遇到更多修改、调用和等待。它们都是个人体验,不是统一条件下的测评。对你来说,真正该比较的是“得到一份合格结果花了多少钱”,包括重试,而不是只比较每百万 Token。

  1. 先说清什么样才算做好

    明确哪些错误不能接受,避免只看生成速度。

  2. 拿同一批任务试两款模型

    按实际计费量记录结果,不预设贵的一定值得。

  3. 算一算做好一件事花多少钱

    模型费 + 重试费 + 人工修改成本,再除以合格数量。

本节依据:[1] OpenAI:API Standard、缓存与长上下文价格[2] Anthropic:当前模型与 API 官方价格[4] DeepSeek:模型、峰谷价格及时间规则[5] DeepSeek:版本变更与 V4 Pro 继续服务说明[7] Reddit:DeepSeek V4.1 编码体验(用户自述)[8] Reddit:DeepSeek V4.1 Flash 的任务总成本(用户自述)

参考资料

继续阅读