API 成本

2026 年主流大模型 API 定价对比:OpenAI、Claude、Gemini 与 DeepSeek

对比 OpenAI、Anthropic Claude、Google Gemini 与 DeepSeek 主流文本模型的输入、输出和缓存 Token 标准 API 价格。

模型能力决定一个方案能不能做,API 成本则决定它能不能稳定上线。每百万 Token 看起来只是几美元,但真实应用还会加入系统指令、历史消息、检索资料、工具定义、失败重试和长篇输出,调用量增加后,这些细节会直接影响月度账单。

本文对比 OpenAI、Anthropic、Google 和 DeepSeek 公布的部分标准文本 API 价格。金额统一为每 100 万 Token 的美元价格,数据于 2026 年 8 月 16 日从厂商官方页面核对。模型名称、费率、上下文门槛和服务等级都可能调整,正式预算或对外报价前应再次打开文末官方来源确认。

配套免费工具AI Token 与成本估算器

在浏览器本地验证文章中的估算或清理流程,无需上传内容。

打开工具

2026 年标准 API 价格对比

下表尽量采用按需、标准文本推理价格,不把 ChatGPT、Claude 或 Gemini 的个人订阅价格与开发者 API 混在一起。缓存输入只在厂商提供可直接比较的数据时列出;DeepSeek 的常规输入列采用缓存未命中价格,缓存列采用命中价格。

多数模型的输出 Token 明显贵于输入 Token,因此回答长度、推理输出与重试次数都是成本控制的重要变量。输入很便宜的模型,如果持续生成长报告或大段代码,最终费用仍可能由输出部分主导。

部分标准文本价格,美元/100 万 Token,核对日期 2026-08-16
厂商与模型输入缓存输入输出规划说明
OpenAI GPT-5.6 Luna$1.00$0.10$6.00成本较低的 OpenAI 通用选项
OpenAI GPT-5.6 Terra$2.50$0.25$15.00适合更复杂任务的均衡型号
Anthropic Claude Sonnet 5$2.00$0.20 缓存命中$10.00能力与成本较均衡
Anthropic Claude Sonnet 4.6$3.00$0.30 缓存命中$15.00较早分词器,标准价格更高
Google Gemini 3.5 Flash$1.50$0.15$9.00思考 Token 计入输出费用
DeepSeek Chat$0.27 缓存未命中$0.07$1.10低成本对话模型,需核对可用性与合规要求
DeepSeek Reasoner$0.55 缓存未命中$0.14$2.19推理模型,缓存命中价格独立

所有价格对比背后的计算公式

一次基础文本请求的预计费用,等于输入 Token 数乘以输入单价,再加上输出 Token 数乘以输出单价,两个结果都除以 100 万。例如处理 10 万输入 Token 和 2.5 万输出 Token,模型输入价为 1 美元、输出价为 6 美元,则预计费用为 0.10 美元加 0.15 美元,共 0.25 美元。

生产账单往往不只包含输入框里看得到的文字。系统指令、消息历史、检索文档、图片或音频 Token、工具 Schema、内部思考 Token、缓存写入与存储、联网搜索和区域处理都可能增加费用。简单计算器应当作为规划基线,之后还要用有代表性的测试与厂商用量报表校准。

  • 统计完整请求,不只计算最后一条用户消息。
  • 单独估算输出,因为输出单价通常更高。
  • 把缓存命中、缓存写入和缓存存储分开计算。
  • 为失败重试和超时重发预留预算。
  • Prompt 超过长上下文门槛时重新核对价格。

四家厂商的计价结构有什么不同

OpenAI 将标准输入、缓存输入和输出分开计价,同时提供 Batch 等服务模式。交互式产品应先以标准价格为基准;只有任务允许延迟、并且符合批处理规则时,才能把 Batch 的折扣纳入预算。

Anthropic 会列出基础输入、不同缓存写入时长、缓存命中和输出价格。重复的 Prompt 前缀在缓存后可能更省,但写缓存本身并非免费。Claude 工具调用还会加入系统 Prompt Token,因此 Agent 请求的真实输入量可能大于聊天窗口中可见的文字。

Google 为 Gemini 提供标准、批处理、Flex、Priority 和缓存存储等不同条款,Gemini 3.5 Flash 的思考 Token 计入输出费用。DeepSeek 则明确区分缓存命中与未命中的输入单价,重复上下文和缓存策略对估算结果影响明显。不同服务档位不能直接混用,必须对照实际调用的端点。

三种工作负载会得出完全不同的选择

短文本分类通常输入多、输出极少,例如输入 2,000 Token,只返回 50 Token。此时输入价格和延迟更重要,小型快速模型往往更合适。客服对话会携带越来越长的历史记录,每轮输出数百 Token,历史摘要和稳定指令缓存会更有价值。研究或编程 Agent 还会发送工具定义、检索文件、命令输出与长推理内容,输出价格和工具开销可能成为主要成本。

不存在适用于所有任务的“绝对最便宜模型”,因为不同模型并不保证同等质量。价格低但需要更多重试、更长提示词或第二次验证的模型,每个成功任务的真实费用可能更高。更合理的指标是每个被接受结果的成本,例如正确分类一张工单、生成一份可用回答或完成一次通过测试的代码修改。

不同工作负载应关注的指标
工作负载主要成本来源可行优化
分类与信息提取重复输入缩短 Schema、使用小模型、适合时批处理
客服对话历史消息摘要历史、缓存稳定指令、限制回答长度
研究与编程 Agent工具与长输出任务路由、限制检索上下文、监控重试

把 Token 单价转换成月度预算的可靠方法

先采集真实样本,不要从最乐观的平均值开始。至少记录普通、很短和异常长任务的输入与输出 Token,并观察中位数、P90 和最大值,避免少量超长请求拖高账单。用每次请求成本乘以预计成功请求量,再独立加入重试、评测、内部测试与开发流量。

为每个模型保存价格、官方来源和核对日期。不要在没有限定工作负载的情况下写死“每次永远不到一分钱”之类的宣传。厂商侧设置账单提醒,应用侧设置单请求限制。若产品允许上传任意文档,上线前必须限制文件大小、抽取文本长度、最大输出 Token 和自动重试次数。

  • 分别记录输入与输出 Token 的 P50、P90 和最大值。
  • 把正常流量、重试、评测和内部测试分开预算。
  • 同时设置月度厂商限额和单请求应用限额。
  • 按固定周期检查模型与价格变化。
  • 扩大流量前,用真实账单校准估算。

按业务价值选模型,而不是只看单价

从自己的真实任务中抽取一组小型基准,统一评估回答质量、结构化输出稳定性、延迟、安全要求、区域可用性、速率限制和总成本。让候选模型处理相同样本,再计算每个被接受结果的费用,才能看清价格与质量的权衡,避免拿不适用的服务档位宣传价做决定。

RunAIToolkit 估算器适合完成第一轮比较,因为样本文本留在浏览器本地,并且输入与预计输出分开计算。但它仍是规划值:厂商分词器和隐藏请求组件可能不同。确定模型前,建议再使用厂商 Token 统计接口和账单面板复核。

常见问题

这些价格包含 ChatGPT、Claude 或 Gemini 订阅吗?

不包含。个人或团队订阅与开发者 API 是不同产品,本文只比较部分开发者文本 API 价格。

为什么输出 Token 通常更贵?

模型需要逐个生成输出 Token,厂商通常因此设置更高的输出费率,具体比例因模型而异。

Prompt 缓存一定省钱吗?

不一定。缓存写入与存储可能收费,只有足够多内容在厂商规则内重复使用时,缓存才可能降低总成本。

所有任务都能直接选最便宜的模型吗?

不能。质量失败、额外重试与二次验证可能抵消单价优势,应比较每个成功结果的总成本。

官方来源

价格可能变化,请在制定预算前重新核对以下页面。