
GPT、Claude、DeepSeek API价格与使用成本对比别只看每百万Token单价调用大模型 API 时价格通常是模型选型最先被关注的因素之一。但实际业务中每百万 Token 单价最低不一定意味着完成一次任务的成本最低。除了输入和输出价格推理 Token、Prompt Cache、长上下文、重复调用、任务成功率甚至模型使用的 Tokenizer 都会影响最终账单。本文根据2026 年 8 月 14 日官方 API 定价对 GPT、Claude 和 DeepSeek 当前主要模型进行一次价格和实际使用成本对比。需要特别说明的是DeepSeek 已经公布新的峰谷定价方案将于 **2026 年 8 月 17 日 00:00北京时间**生效因此本文会同时列出当前价格和即将生效的新价格。本文主要比较官方直接 API 的文本 Token 价格不计算 Fast Mode、云厂商区域溢价、Web Search、Code Interpreter 等额外服务费用。一、GPT、Claude当前API价格对比先看最容易理解的标准文本 Token 价格。OpenAI 当前 GPT-5.6 系列主要包括 Sol、Terra 和 Luna。官方将 Sol 定位为复杂专业任务的旗舰模型Terra 强调能力与成本平衡Luna 则面向成本敏感和高调用量场景。在标准模式、短上下文下GPT-5.6 的价格如下厂商模型100万输入Token100万缓存输入Token100万输出TokenOpenAIGPT-5.6 Sol$5.00$0.50$30.00OpenAIGPT-5.6 Terra$2.00$0.20$12.00OpenAIGPT-5.6 Luna$0.20$0.02$1.20以上均为每百万 Token 的标准 API 价格。Anthropic 当前主要模型则包括 Claude Fable 5、Opus 5、Sonnet 5 和 Haiku 4.5。标准输入、缓存命中和输出价格如下厂商模型100万输入Token100万缓存命中Token100万输出TokenAnthropicClaude Fable 5$10.00$1.00$50.00AnthropicClaude Opus 5$5.00$0.50$25.00AnthropicClaude Sonnet 5$2.00$0.20$10.00AnthropicClaude Haiku 4.5$1.00$0.10$5.00其中 Claude Sonnet 5 当前的 $2 / $10 已经确定为正式价格Anthropic 原计划 2026 年 9 月 1 日调整到 $3 / $15 的方案已经取消。二、DeepSeek当前价格与8月17日新价格截至2026 年 8 月 14 日DeepSeek 当前主要 API 模型为deepseek-v4-flash deepseek-v4-pro官方文档显示当前对应版本分别为 DeepSeek-V4-Flash-0731 和 DeepSeek-V4-Pro-0813两者均支持 1M 上下文。目前价格为模型100万缓存命中输入Token100万缓存未命中输入Token100万输出TokenDeepSeek V4 Flash0.02元1元2元DeepSeek V4 Pro0.025元3元6元不过这套价格只维持到2026 年 8 月 16 日。从 2026 年 8 月 17 日开始DeepSeek 将采用峰谷定价高峰时段为北京时间9:00 - 12:00和14:00 - 18:00其他时间按空闲时段收费。新的价格为模型时段缓存命中输入缓存未命中输入输出DeepSeek V4 Flash空闲0.05元1.5元4.5元DeepSeek V4 Flash高峰0.10元3元9元DeepSeek V4 Pro空闲0.15元4.5元13.5元DeepSeek V4 Pro高峰0.30元9元27元以上均为每百万 Token。DeepSeek 官方同时明确空闲时段价格为高峰时段的一半。如果现在正在做 8 月下旬或更长期的 API 成本预算建议直接按照8 月 17 日之后的新价格计算。三、假设100万输入 20万输出需要多少钱为了方便理解先做一个简单的理论计算。假设某项业务累计产生Token类型数量输入Token100万输出Token20万暂时假设输入全部没有命中缓存也不计算工具调用、缓存写入和其他附加费用。计算公式为总成本 输入Token数量 × 输入单价 输出Token数量 × 输出单价对于 GPT 和 Claude模型100万输入成本20万输出成本合计GPT-5.6 Sol$5.00$6.00$11.00GPT-5.6 Terra$2.00$2.40$4.40GPT-5.6 Luna$0.20$0.24$0.44Claude Fable 5$10.00$10.00$20.00Claude Opus 5$5.00$5.00$10.00Claude Sonnet 5$2.00$2.00$4.00Claude Haiku 4.5$1.00$1.00$2.00这些结果按照各厂商当前官方标准 Token 单价计算。DeepSeek 如果按照8 月 17 日之后的新价格计算同样假设 100 万输入全部缓存未命中模型时段100万输入20万输出合计DeepSeek V4 Flash空闲1.5元0.9元2.4元DeepSeek V4 Flash高峰3元1.8元4.8元DeepSeek V4 Pro空闲4.5元2.7元7.2元DeepSeek V4 Pro高峰9元5.4元14.4元价格依据 DeepSeek 官方即将生效的峰谷定价计算。这里没有把美元统一换算成人民币因为汇率每天都会发生变化。实际做预算时可以按照结算当天汇率再统一换算。四、但“相同100万Token”不等于“相同业务成本”这是 API 价格对比中特别容易被忽略的问题。上面的表只能回答如果各模型都消耗100万输入Token和20万输出Token分别需要多少钱但不能直接回答同一个真实任务分别使用这些模型需要多少钱原因之一就是不同模型使用的 Tokenizer 并不完全相同。例如 Anthropic 官方明确说明Claude 4.7 及之后的模型采用了新的 Tokenizer对于相同文本生成的 Token 数量大约会增加 30%实际比例会根据内容和任务有所变化。因此不能简单理解成Claude Sonnet 5$2 / 百万输入Token GPT-5.6 Terra$2 / 百万输入Token 所以输入同一段文本一定一样贵即使每百万 Token 单价相同同一段文本经过不同 Tokenizer 后产生的 Token 数也可能不同。更可靠的方式是直接拿自己的真实 Prompt 和业务数据分别调用模型再读取 API 返回的实际 Token Usage。五、OpenAI还有一个容易漏掉的成本长上下文GPT-5.6 的标准价格还需要区分短上下文和长上下文。当输入超过272K Token时OpenAI 当前对 GPT-5.6 Sol、Terra、Luna 的整个请求按照更高价格计费输入价格变为短上下文的 2 倍输出价格变为 1.5 倍。对应价格为模型长上下文输入长上下文缓存输入长上下文输出GPT-5.6 Sol$10.00$1.00$45.00GPT-5.6 Terra$4.00$0.40$18.00GPT-5.6 Luna$0.40$0.04$1.80以上均为每百万 Token 的标准模式长上下文价格。例如一个 RAG、代码仓库分析或者长文档 Agent一旦经常把几十万 Token 的上下文整体塞入模型就不能继续按照短上下文单价估算 GPT-5.6 成本。Claude 当前的情况不同。Anthropic 官方说明Claude 4.6 及之后支持 1M 上下文的模型在整个上下文窗口内继续按照标准 Token 单价收费没有额外的长上下文溢价。因此在真正的长上下文业务里只比较普通输入价格是不够的。六、缓存为什么可能明显影响API账单如果业务每次请求都需要重复发送相同的大段内容例如固定 System Prompt、代码仓库背景、知识库说明或者 Agent 工具定义那么大量输入 Token 实际上是重复的。这时候 Prompt Cache 就会直接影响成本。GPT-5.6 的标准短上下文价格例如模型普通输入缓存输入GPT-5.6 Sol$5.00$0.50GPT-5.6 Terra$2.00$0.20GPT-5.6 Luna$0.20$0.02也就是缓存输入 Token 当前只有普通输入 Token 价格的十分之一。但还有一个容易漏掉的地方写入缓存本身也可能收费。OpenAI 当前 GPT-5.6 的 Cache Write 按普通输入价格的 1.25 倍计费例如 Terra 短上下文缓存写入价格为 $2.50 / 百万 Token而缓存命中后则是 $0.20 / 百万 Token。Claude 同样区分普通输入、缓存写入和缓存命中。以 Claude Sonnet 5 为例类型每百万Token价格普通输入$2.005分钟缓存写入$2.501小时缓存写入$4.00缓存命中$0.20Anthropic 的缓存写入和命中价格根据缓存持续时间有所区别。所以缓存并不是开启以后所有输入自动永久打九折。真正应该关注的是缓存写入成本 缓存命中次数 缓存命中的Token数量如果一段 Prompt 只会复用一次缓存收益可能有限如果同一段长上下文会被反复调用很多次缓存价值就会明显增加。七、推理Token也是实际成本的一部分现在很多模型在返回最终答案之前还会产生内部推理 Token。这部分内容用户未必能完整看到但仍然可能参与计费。OpenAI 官方明确说明Reasoning Token 会按照输出 Token计费。Claude 的 Thinking Token 同样属于计费输出 Token即使内部思考内容没有直接返回给用户实际推理消耗仍然会计入账单。因此复杂推理任务中不能只根据用户最终看到的回答长度估算成本。例如最终输出只有几百 Token但模型内部实际进行了更长的推理那么用户看到的输出长度 ≠ 实际计费输出Token对于代码 Agent、复杂分析、多步骤规划等任务这一点尤其需要单独记录。八、便宜模型不一定带来更低的任务成本假设模型 A 单次 API 请求只需要 0.01 元而模型 B 一次需要 0.03 元模型单次请求成本完成任务需要调用最终任务成本模型A0.01元5次0.05元模型B0.03元1次0.03元如果低价模型经常出现结果不符合要求需要不断重试、修改 Prompt 或重新调用那么最终任务成本完全可能超过单次价格更贵的模型。所以真正值得比较的指标不是一次API请求多少钱而是成功完成一次业务任务需要多少钱例如 AI 客服应该看成功解决一个用户问题的模型成本代码 Agent 更适合看完成一个有效开发任务的模型成本而不是只比较每百万 Token 的官方标价。九、批量任务还可以关注Batch价格如果任务不要求实时返回例如离线文本分类、批量摘要、批量数据处理可以进一步考虑 Batch API。OpenAI 当前 GPT-5.6 的 Batch Token 价格约为标准模式的一半例如 GPT-5.6 Terra 短上下文标准价格是输入$2 / 百万Token 输出$12 / 百万TokenBatch 对应输入$1 / 百万Token 输出$6 / 百万TokenAnthropic 的 Batch 定价同样约为标准 Token 价格的一半例如 Claude Sonnet 5模式输入输出标准API$2$10Batch$1$5所以对于大规模、非实时任务模型选择之外调用方式本身也可能直接改变一半左右的 Token 成本。十、真实业务应该怎么比较GPT、Claude和DeepSeek最可靠的方法不是直接根据价格表选模型而是准备一批自己的真实业务样本让不同模型执行同样的任务。测试时可以统一记录指标作用输入Token实际Prompt消耗缓存输入Token判断缓存收益输出Token判断生成成本推理Token判断复杂任务额外消耗单次调用成本查看API单次成本平均调用次数判断是否频繁重试任务成功率判断模型能不能真正完成任务平均响应时间判断是否满足线上需求单任务成本最终成本指标最终可以计算单任务成本 一定周期内该任务产生的全部API费用 ÷ 成功完成的任务数量这个数字通常比“每百万 Token 多少钱”更适合做生产环境模型选型。十一、多模型组合往往比所有请求只用一个模型更值得测试实际业务不一定需要把所有任务都交给同一个模型。例如可以按照业务难度做不同模型实验任务类型可以优先测试的模型档位分类、提取、格式转换成本优先模型普通问答、摘要中等成本模型复杂推理、代码任务高能力模型高能力模型调用失败备用模型OpenAI 官方本身就将 GPT-5.6 Luna 定位为成本敏感、高调用量场景Terra 用于平衡能力和成本Sol 则面向复杂专业工作。如果实际业务同时调用 GPT、Claude 和 DeepSeek随着模型数量增加还会逐渐出现不同 API Key、Base URL、Model ID、调用日志、限流和费用统计的管理问题。这时候可以考虑在业务代码和不同模型服务之间增加统一 API 层再通过模型路由决定不同任务使用哪个模型。但模型路由真正应该优化的目标不是永远调用最便宜的模型而应该是在满足任务质量要求的前提下 尽量降低成功完成任务的平均成本十二、总结API价格到底应该怎么看从当前官方 Token 单价来看不同模型之间的价格差距确实非常明显。例如 GPT-5.6 系列内部仅标准短上下文输入价格就从 Luna 的 $0.20 / 百万 Token 到 Sol 的 $5 / 百万 Token相差 25 倍输出则从 $1.20 到 $30同样相差 25 倍。Claude 当前则从 Haiku 4.5 的 $1 / $5一直到 Fable 5 的 $10 / $50不同能力档位也存在明显价格差异。DeepSeek 从 2026 年 8 月 17 日起还会加入峰谷定价相同模型在不同调用时段的 Token 成本也会不同。因此真正进行 API 成本评估时至少应该同时考虑成本因素为什么重要输入单价决定基础Prompt成本输出单价通常明显高于输入实际Token数量不同Tokenizer结果可能不同长上下文部分模型会出现价格变化推理Token内部推理也可能计费缓存命中率重复上下文可能大幅降本缓存写入建立缓存本身可能有成本重试次数无效请求会继续花钱Batch非实时任务可能显著降低单价任务成功率决定真正的单任务成本所以“GPT、Claude、DeepSeek 哪个 API 最便宜”其实没有一个脱离业务场景的固定答案。只看价格表可以判断调用一次理论上多少钱。而真正决定生产环境成本的是完成一次有效业务任务最终一共花多少钱。当 API 调用量逐渐扩大之后模型选型、缓存、Batch、任务路由和失败重试带来的成本差异往往会比单纯比较每百万 Token 的标价更值得关注。