OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式

N
News Editor
2026-08-13 23:52:09
OpenAI 于 8 月 14 日凌晨联合 AI 芯片厂商 Cerebras 预览 GPT-5.6 Sol 的「超高速模式」。该模式最高输出速度可达 750 tokens/s,较标准模式约 53 tokens/s 提升最高 14 倍。OpenAI 表示,该模式将率先上线 API,并已向部分客户开放有限预览。Cerebras 披露,GPT-5.6 Sol Ultrafast 在 HLE 测试中用 11 小时 11 分钟完成 2500 道题,Claude Fable 5 用时 78 小时 27 分钟。

8 月 14 日凌晨,OpenAI 联合 AI 芯片厂商 Cerebras 正式预览旗舰模型 GPT-5.6 Sol 的新服务层级「超高速模式」(Ultrafast Mode)。

按照 OpenAI 披露的数据,GPT-5.6 Sol 在该模式下的输出速度最高可达 750 tokens/s,相比当前 Standard(标准)模式约 53 tokens/s 的推理基线,速度提升最高达 14 倍,且质量不降低。横向对比中,GPT-5.6 Sol 加速后比 Fable 5 快 11 倍,比 Opus 4.8 的 Fast 模式快 5 倍。

Ultrafast 模式将率先在 OpenAI API 中推出,目前已向部分客户开放有限预览版。OpenAI 与 Cerebras 还整理了一张当前先进大模型在速度与智力维度上的对比表,其中 GPT-5.6 Sol Ultrafast 处于领先位置。

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 3

HLE 测试中用时 11 小时 11 分钟完成 2500 道题

在 Cerebras 博客中,工程人员介绍了模型在「人类最后的考试」(Humanity's Last Exam,HLE)上的测试结果。HLE 是一项高难度模型基准,包含 2500 道题,通常只有化学、经济学、文学等领域的博士才能解答。

根据披露,GPT-5.6 Sol 的超高速模式用 11 小时 11 分钟回答完全部题目。作为直接对手的 Claude Fable 5 用时 78 小时 27 分钟,超过 3 天连续计算才完成同样任务。在准确率相近的情况下,GPT 超高速模式的速度接近 Claude Fable 的 7 倍。

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 4

OpenAI 列出法律、金融、工程等使用场景

OpenAI 表示,随着模型能力提升,快速推理的适用范围也会扩大。GPT-5.6 Sol 是 OpenAI 迄今在法律文书、金融模型和工程报告方面表现最好的模型。在 GDP-Val 这一衡量经济价值知识工作任务的基准上,Ultrafast 实现了 5.6 倍的端到端速度提升,质量未受影响。

OpenAI 给出的应用场景包括:

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 5

  • 事件响应和可靠性:在关键系统故障时,分析应用日志、最近的代码变更和工程师报告,定位可能原因,并在故障仍在发生时协助准备修复方案。
  • 金融研究与安全:在市场形势快速变化时,分析市场信号、评估交易并识别可疑活动。
  • 客户支持和语音:实时处理复杂客户问题,即使答案涉及多个步骤或系统,也不打断对话。
  • 商务:在用户尚未放弃购物车前,回答产品问题、检查库存、提供个性化推荐并处理结账问题。
  • 实时研究和实验:把过去需要过夜完成的研究,缩短为可交互的工作会议流程,让团队在不中断工作流的情况下测试想法、检查结果并调整方法。

在 OpenAI 内部测试中,事件响应是 Ultrafast 的一个典型用例。警报触发后,工程师需要在系统与证据持续变化时迅速建立准确的事件图景。OpenAI 称,借助 Sol 级别的智能,团队可以快速读取日志、分析追踪信息、汇总对话、确定下一步检查内容,并协助准备或验证修复方案。Ultrafast 模式缩短了从发现信号、验证假设到选择下一步行动之间的延迟,但最终判断和部署仍由工程师负责。

在研究场景中,OpenAI 团队使用 Ultrafast 快速搜索知识库、查询数据,并整理和汇总来自不同工具的信息。过去常见的流程是夜间启动一批实验,第二天早上查看结果;采用 Ultrafast 后,这一发现流程被缩短,支持团队在一个工作日内进行多次迭代。

Cerebras 以晶圆级架构突破推理解码带宽瓶颈

OpenAI 与 Cerebras 将这次提速归因于对传统 GPU 集群在大模型推理解码阶段内存带宽瓶颈的突破,其实现主要依赖 Cerebras 的晶圆级硬件架构。

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 6

按照文章介绍,Cerebras 的方案与常见 AI 芯片路线不同,其历代芯片采用整片晶圆制造,在单片上集成大量计算核心与超高速互联网络。

传统 GPU 在运行大模型自回归解码生成 Token 时,受限于显存带宽,需要不断在片外 HBM 和计算核心之间搬运庞大的模型权重;多卡切分还会带来跨芯片互连,例如 PCIe/NVLink 的通信延迟。

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 7

而 Cerebras 最新的晶圆级芯片 WSE-3 集成了 4 万亿晶体管、125 petaflops 的 AI 算力,以及最高 44 GB 的片上高速 SRAM。模型参数可以直接常驻在高带宽片上 SRAM 中,减少反复从片外内存加载权重带来的等待时间。

对于 GPT-5.6 Sol 这类前沿旗舰模型,完整参数规模显然高于单芯片容量。Cerebras 还提供「多晶圆流水线并行」(Pipelined across wafers)机制,将模型不同网络层分布到多颗晶圆上,各层参数分别常驻在对应芯片的 SRAM 中,使 Token 能在晶圆之间流水传输。

OpenAI 联合 Cerebras 预览 GPT-5.6 Sol 超高速模式 8

旗舰模型提速后,部分任务不必再切换次级模型

文章提到,对大模型用户来说,旗舰模型达到 14 倍速,意味着过去不少必须切换到次级模型,如 Luna 和 Terra,才能完成的任务,现在可能可以直接使用满性能版本执行。对需要多轮工具调用、代码生成与排错、复杂链式思考的 Agent 任务,原本耗时数小时的流程可被压缩到数分钟。

文末提到,AI 社区也已经开始期待 Luna 和 Terra 版本的超高速模式能否推出,但 Cerebras 的芯片供给是否足够,文中未给出更多信息。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
440

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。