与OpenAI携手加速GPT-5.6 Sol Ultrafast
今天,Cerebras 和 OpenAI 联手带来 Ultrafast Mode 的抢先预览。这是一个由 Cerebras 提供支持、率先在 OpenAI API 中上线的新服务层级。Ultrafast 最初仅向部分精选客户开放,并会随着时间的推移逐步扩大访问范围。Cerebras 为 Ultrafast 模式下的 GPT-5.6 Sol 提供算力支持,每秒可输出高达 750 个 Token,且不牺牲任何质量,让 Sol Ultrafast 能够加速你对时效性要求最高、最关键的任务。

以空前速度呈现的前沿智能
AI 开发者一直需要在速度与智能之间做出取舍。随着模型的规模和智能不断提升,它们会带来更高的计算和数据移动成本,从而拖慢响应时间。用户往往要么等待高质量结果,要么在更短时间内接受较差的结果。
GPT-5.6 Sol Ultrafast 化解了这一两难困境,将前沿智能带到了每一秒都至关重要的产品和工作流程中。与 Artificial Analysis 报告的输出速度相比,Ultrafast 模式下的 GPT-5.6 Sol 运行速度比 Fable 5 快 11 倍,比 Fast 模式下的 Opus 4.8 快 5 倍。

在 Cerebras,我们让 Ultrafast 与多款热门模型在 Humanity's Last Exam 上正面交锋,检验其性能。HLE 是一项极具挑战性的模型基准测试,包含 2,500 道通常只有化学、经济学和文学等领域博士才能回答的问题。
在我们的评估中,Ultrafast 模式下的 GPT-5.6 Sol 在 11 小时 11 分钟内回答了全部 2,500 道 HLE 问题。Claude Fable 5 则需要 78 小时 27 分钟——超过三天的持续计算——才能得出同样的结论。换句话说,Ultrafast 在一个工作日内就遍历了人类知识的前沿,速度快了近 7 倍,准确率也相当。
Humanity's Last Exam 基准测试
基准测试由 Cerebras 于 7 月 10 日使用 GPT 5.6 Sol Ultrafast(xhigh 推理模式,配合 Codex)执行,并于 7 月 13 日至 15 日使用 Claude Fable 5(xhigh 推理模式,配合 Claude Code)执行。
随着模型能力的持续进步,快速推理的应用范围也在不断扩大。GPT-5.6 Sol 是 OpenAI 目前在法律文书、金融模型和工程报告方面表现最好的模型。在 GDP-Val(一个面向具有经济价值的知识工作任务的基准测试)上,Ultrafast 实现了 5.6 倍的端到端加速,且没有任何质量下降,展示了更快的推理如何加速具有经济价值的工作。

基准测试由 Cerebras 于 2026 年 7 月 31 日执行,使用 GPT 5.6 Sol 和 GPT 5.6 Sol Ultrafast,在 Codex 中采用 medium 推理模式。
高速智能驱动高风险工作
更快的智能改变了个体和组织的可能性边界。借助 Ultrafast,你现在可以将 AI Agent 置于分秒必争问题的关键路径之上。
“借助 GPT-5.6 Sol Ultrafast,Cerebras 让 AI 能够跟上你的思考、编码和协作节奏。我们非常期待看到 Ultrafast 推理将如何改变工作流程和应用。”
—— Rohan Varma,OpenAI 产品团队
对于使用前沿 AI 快速响应不断涌入的信息的组织而言,Ultrafast 是一种持续的竞争优势。运营 Web 服务的公司可以利用 Ultrafast 快速定位并解决生产故障,从而维护客户信任、避免收入损失,并减少 SLA 范围内的停机时间。而在对抗激烈、高风险的网络攻击中,Ultrafast 是安全团队不可或缺的工具,他们必须快速检测并响应恶意行为者,以遏制灾难性损失。
更广泛地说,Ultrafast 开启了与 AI Agent 协作的全新模式。它提供实时洞察和更新,因此你无需在多个并行会话之间频繁切换上下文,即可充分利用你的 AI Agent。
“以前我可能需要等上几分钟才能完成一项任务,现在甚至在我有机会切换上下文之前,任务就已经完成了。这让我的工作效率大大提高。”
—— Jeffrey Wang,OpenAI 研究员
借助 Ultrafast,研究人员和工程师可以将注意力留给最关键的问题,深入钻研,同时继续使用 Standard 处理模式并行化处理常规任务。Cerebras 非常兴奋能够为下一波 AI 创新提供算力支持,提升个体和组织借助响应式 AI 所能取得的成就上限。
突破性创新成就惊人速度
Ultrafast 模式下的 GPT-5.6 Sol 由 Cerebras 革命性的 Wafer-Scale Engine 架构提供支持,该架构专为前沿 AI 工作负载而设计。快速的前沿推理本质上是一个数据移动问题:在 GPU 上,大模型的推理受限于内存带宽,因为要生成一条模型响应中的连续 Token,模型权重必须在片上内存和片外存储之间反复传输。
Cerebras 采用了逆向思维来消除这种低效的数据移动:我们在每个晶圆级芯片上封装了 44 GB 的 SRAM。权重始终留在片上,Token 则不间断地流经跨晶圆流水线化的模型层。这种技术方案能够随模型规模平滑扩展,为未来前沿模型持续保持速度优势铺平了道路。
Ultrafast:限量预览现已开启
Ultrafast 模式下的 GPT-5.6 Sol 今天以限量预览形式向部分精选客户开放。随着算力容量的增长,访问范围将逐步扩大。
- 原文链接: cerebras.ai/blog/acceler...
- 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明
本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。
鸿途知科网
发表评论:
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。