AI服务的价格比较,正从“每百万Token多少钱”转向“完成一项工作要花多少钱”。OpenAI在7月发布的文章中提出,判断AI投入不能只看Token单价,还应观察完成了多少有用工作、一个成功任务的成本、结果可靠性,以及规模使用后的单位产出。该公司在GPT-5.6相关材料中也延续了按任务衡量效率的表述,并说明不同模型在速度、价格和任务表现之间的定位。
Anthropic的公开研究采用了另一条观察路径。其2026年6月经济指数报告将对话映射到工作任务和职业类别,再根据输入、输出及内部推理消耗的Token估算计算成本。报告显示,工作任务的计算投入与对应职业报酬之间存在正相关,也有明显例外。这并非一张统一的服务报价表,而是用来观察模型使用行为和计算消耗如何随任务类型变化的方法。
两家公司材料的共同点在于,单次输入或输出的价格并不能完整代表工作流成本。长任务可能包含多次调用、内部推理、工具操作和人工复核;价格较高的模型若能减少失败或返工,整项工作的总成本未必更高。相反,若“成功任务”缺少清晰定义,每任务成本也难以成为可比较的指标。因此,现有公开材料呈现的是一种评估方向,而非可跨企业直接套用的固定排名。
对企业采购者而言,这一计量方式把注意力放回具体业务结果。同一项文档处理、客服分类或实现任务,需要结合完成率、人工返工、调用时延和总消耗判断成本。模型厂商则需把定价、评测和工作流工具放在同一框架中说明,帮助客户判断更高能力是否能够降低单位工作成本。
从Token单价到任务成本,AI软件的竞争维度改变
采购指标转向成功任务成本后,模型供应商的竞争不再只取决于输入和输出单价,也取决于模型能否减少重试、缩短处理时间并降低人工复核。对应用软件公司而言,这会推动产品将评测、路由和质量控制嵌入工作流:简单任务可采用成本更低的模型,关键任务则配置更高能力模型和更严格的结果标准。企业若能把“成功”定义为可审计的业务结果,模型选择、调用策略与人工复核的安排就能围绕同一目标调整;若缺少这一基础,Token价格下降本身未必会转化为实际成本节约。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 围绕成功任务成本和可靠性优化,有助于模型服务从单纯价格竞争转向工作流效率竞争;企业软件需要把模型选择、评测与人工复核结合,形成面向具体任务的产品能力。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
