7月17日凌晨,Kimi 发布 K3,引发市场对高端模型定价体系的新一轮讨论。Axios称,K3 的定价远低于它所挑战的高端模型,这让美国 AI 公司高价策略还能维持多久,成了外界关注的问题。
几乎同一时间,OpenAI 和 Anthropic 正在围绕用户与使用量展开一场更直接的竞争。此前,OpenAI CEO Sam Altman 在 X 上发文,开头先承认过去 12 个月公司的表现“不够好”,并将主要责任归于自己。随后他又表示,OpenAI 即将迎来“有史以来最出色的 12 个月”,团队正在获得令自己满意的结果。
OpenAI 几天内新增 300 万活跃用户
围绕 Altman 这番表态,外界最直接的猜测之一,是 OpenAI 是否将在近期推出更重要的新模型。
与这条推文相呼应的是,OpenAI Codex 负责人 Tibo 在 7 月 16 日披露了一组新数据:Codex 和 ChatGPT Work 合计活跃用户数已突破 900 万。
按他给出的时间线,2 月时 Codex 活跃用户还不到 100 万;到 7 月 12 日升至 600 万,7 月 14 日升至 800 万,7 月 16 日则超过 900 万。仅 4 天时间,活跃用户新增 300 万。

Tibo 表示,团队原本想更早恢复额度,但为保证系统不崩溃、维持稳定运行,工程团队一直在处理“数以百万计的任务”。他还称,额度会在几分钟后恢复,并提醒用户别总刷推特,回去忙自己的工作。
这组数据反映出的情况很直接:用户增长速度过快,工程团队正在承受系统稳定性的压力。
类似情况此前也出现在 Anthropic。根据原文引用,Anthropic CEO Dario Amodei 今年 5 月在开发者大会上提到,公司原本按每年 10 倍增长规划,但一季度收入和使用量按年化计算增长了 80 倍,算力压力也随之上升。他当时半开玩笑地表示,希望这种 80 倍增速不要继续,回到“区区 10 倍”会更容易承受。
同一周,两家公司都在上调或重置额度
Altman 发出上述推文时,OpenAI 与 Anthropic 的竞争已进入一轮消耗战。
ChatGPT Work 发布后不久,OpenAI 临时取消了 Plus、Pro、Business 的 5 小时使用限制,并连续多轮重置用户额度。按原文披露,OpenAI 先向约 50 万用户开放,之后又扩展到 700 万用户,进行更大范围的额度补充。

Anthropic 也同步加码。该公司将 Claude Fable 5 的付费访问再次延长,同时把 Claude Code 的周额度上调 50%,两项调整都延续到 7 月 19 日。
一边是 OpenAI 取消限制并反复重置额度,另一边是 Anthropic 提高访问上限并延长期限。表面看,两家公司都在给用户更多可用资源;从竞争层面看,目标仍是争夺更多用户与更高使用频率。
原文认为,在智能体时代,这更像一场围绕真实长任务数据展开的竞赛。用户让智能体连续工作数小时所产生的真实使用数据,成为关键资源。谁的额度更宽松,谁就更可能积累更多用户、更多使用量,以及更多真实任务反馈。
OpenAI 拿出成本账本:每美元买到多少有用智能
在推动使用量的同时,OpenAI 也在试图改写市场衡量 AI 价值的方式。
就在 Altman 发文当天,OpenAI 官网上线了 CFO Sarah Friar 的一篇文章。Friar 在文中称,她频繁听到各家 CFO 提出同一个问题:怎样让 AI 投入更划算。对此,她提出了一项新指标:Useful Intelligence per Dollar,也就是“每美元买到多少有用的智能”。

她认为,过去软件行业看重的是采纳率,例如买了多少席位、多少人活跃、续费情况如何;而 AI 产品更该看“干成了多少活”。
Friar 还明确指出,token 单价最低,并不等于最终完成结果的成本最低。便宜模型虽然单次调用更低,但可能需要更多尝试、更多时间,也需要更多人工审查;价格更高的模型如果能一次通过,整体成本反而可能更低。
她给出的全成本公式是:
- 全成本 = (模型调用费用 + 计算资源 + 人工审查时间 + 重试次数 + 返工成本)÷ 成功达标任务数
按这一口径,决定性价比的,不是单次 token 价格,而是完成一次合格任务的完整成本。
Friar 在文中将 GPT-5.6 家族分为 Sol、Terra 和 Luna 三档,其中 Sol 为旗舰版本,Terra 主打平衡,Luna 主打高速低价。她还举例称,支持团队的“完成”是客户问题被解决,工程团队的“完成”是代码改动通过测试,法务团队的“完成”则是合同审阅完毕且没有错误。

OpenAI 与 Anthropic 同时用价格和额度争夺客户
OpenAI 也将这套思路用于与 Anthropic 的直接对比。根据原文引用,OpenAI 给出的口径显示,在长周期工程任务基准 DeepSWE v1.1 上,最高推理档的 GPT-5.6 Sol 得分为 72.7%,高于 Claude Fable 5 的 69.9%;与此同时,预估 API 成本比后者低 36.2%。
原文还提到,GPT-5.6 Sol 在输出 token 数量上减少了 54%,预估 API 成本降低 36.2%。这种表述指向的是同一个核心问题:同样的预算,模型究竟能完成多少工作。
而在几乎同一时间,被点名比较的 Anthropic 选择了另一种打法:继续延长 Claude Fable 5 的付费访问,并把 Claude Code 的周额度再提高 50%,两项都持续到 7 月 19 日。一个用图表强调性价比,另一个直接提高可用额度,让用户自己比较体验。
这也解释了,为什么两家公司即便承受系统压力,仍在推动更高强度的真实使用。对智能体产品来说,大规模、持续性的任务数据本身就是竞争壁垒的一部分。
经济学者 Jeremy Nguyen 在评论“Codex 和 Claude Code 同一天重置额度”时表示,也许很多年后,人们会回头谈起早期这场“智能体 token 大战”,并记得当时 token 补贴有多激进。他还提及互联网泡沫时期的一些旧案例:当时有创业公司为了让用户在电脑上挂广告条,每月甚至会倒贴几百美元。他提出的问题是,如果这样的窗口只有一次,用户该如何把 Codex 和 Claude Code 用到“值回票价”。

竞争焦点从模型参数转向工作流入口
按原文梳理,Anthropic 在今年年初率先出手。Claude Code 在开发者群体中迅速走红,随后推出的 Cowork 又把智能体从程序员场景扩展到更广泛的知识工作者场景,在“AI 办公”方向抢占先机。
OpenAI 则在 7 月 9 日发布 ChatGPT Work,产品定位与 Cowork 高度接近,并内置 Codex,同时上线当天发布的 GPT-5.6 Sol。原文举例称,用户只需提出“帮我建个项目追踪表”,系统就能生成一张包含 18 个项目、29 个待办事项的甘特图。这种变化不再只是对话,而是直接交付结果。
原文认为,这轮变化的关键不在参数,而在产品形态。过去用户使用 ChatGPT,多数是提问并等待回答;现在用户只需给出目标,系统会自行拆分任务、调用工具、读取文件和应用,并持续工作数小时,直到实际完成任务。
OpenAI 的官方说法是,ChatGPT 不再只是回答问题的机器,而是处理复杂工作的伙伴。
原文还提到,OpenAI 已经在内部大规模使用 ChatGPT Work 和 Codex,覆盖从财务到销售的几乎 100% 团队。

相比 Anthropic,OpenAI 还拥有更明显的分发优势。Cowork 需要用户主动下载桌面端,而将智能体能力直接整合进 ChatGPT,意味着超过 9 亿周活跃用户只要打开熟悉的应用,就已经进入智能体使用场景。
Altman 也提到,agentic 产品的使用量周环比增长了 2.5 倍。原文认为,这条增长曲线正是他判断“下一年最强”的底气之一。
回到 Altman 的表态,原文给出的判断是,他押注的未必是一款名为 GPT-6 的新模型,而更像是一次产品形态的切换:让 AI 从“回答问题”转向“替你干活”。与之对应,Friar 提出的“每美元有用智能”这把尺子,也是在为这场转变准备新的衡量标准——当 AI 开始直接完成工作,衡量它的方式也会从参数和 token,转向完成了多少任务、花了多少成本。
参考资料包括 Sam Altman 与 Jeremy Nguyen 在 X 上的公开发言。原文来自微信公众号“新智元”,作者为 ASI启示录,编辑为元宇 Aeneas,由 MarsBit 发布。

