
750 tokens每秒。这是GPT-5.6 Sol在超高速模式下跑出的数字。14倍。你没看错,不是1.4倍,是14倍。而它的小弟Luna,把单次任务成本从33.27美元干到了1.33美元。暴降25倍。
2026年8月14日凌晨,OpenAI联合芯片厂商Cerebras正式预览了GPT-5.6 Sol的「超高速模式」(Ultrafast Mode)。这个消息在开发者社区炸开了锅,因为它意味着一个根本性的变化:旗舰级AI模型的推理速度,第一次跨过了人类实时交互的门槛。
快到什么程度?
简单说,标准模式下GPT-5.6 Sol的推理速度约53 tokens/s,这已经是行业前列。但超高速模式直接拉到750 tokens/s,速度提升最高14倍,而且——注意这个前提——不降低任何质量。横向对比,比Claude Fable 5快11倍,比Opus 4.8的Fast模式快5倍。
这不是阉割版。这是满血加速。
📊 14倍速背后:晶圆级芯片打破内存墙
为什么能这么快?答案藏在Cerebras的硬件架构里。传统GPU运行大模型时,最大的瓶颈不是算力,而是内存带宽。模型权重需要在HBM显存和计算核心之间反复搬运,每次生成一个Token都要把庞大的参数从片外内存加载到计算单元,这个来回搬运的时间远超实际计算时间。
Cerebras的方案很暴力也很优雅。
他们用整片晶圆做芯片。最新的WSE-3晶圆级芯片集成了4万亿晶体管、125 petaflops算力和44GB片上SRAM。模型参数直接常驻在超高带宽的片上SRAM中,省掉了反复从片外内存加载权重的等待。对于参数量超过单芯片容量的旗舰模型,Cerebras还设计了「多晶圆流水线并行」机制——把模型各层分布到多颗晶圆上,Token在晶圆间无缝流水传输。
说白了,就是用硬件暴力消除了软件优化的天花板。
🧪 人类最后的考试:11小时 vs 78小时
在Cerebras的博客中,工程团队用「人类最后的考试」(Humanity’s Last Exam, HLE)做了一个直接对比。HLE包含2500道题,通常只有化学、经济学和文学领域的博士才能解答。
GPT-5.6 Sol超快模式用了11小时11分钟回答全部问题。
Claude Fable 5呢?78小时27分钟。
超过三天的连续计算,才得出相近的结论。GPT超快模式仅用一个工作日就走完了人类知识的前沿领域,速度几乎是Claude Fable的7倍。在准确率相近的前提下,这个差距已经不是量的差异,而是质的代差。
对于需要多轮迭代的科研场景,这意味着什么?以前研究员晚上启动一批实验,第二天早上看结果。现在,一个工作日内可以完成多次迭代。发现问题、调整方法、重新实验,整个流程不断档。
💰 Luna:25倍成本压缩的”超小杯”
如果说Sol的14倍速是给极客看的,那Luna的25倍成本压缩就是给钱包看的。
OpenAI同日发布《GPT-5.6构建者指南》,其中Luna的表现让所有人意外。在BrowseComp测试中,Luna拿下84.04%的成绩,直逼GPT-5.5的84.36%——差距只有0.32个百分点。但成本呢?从33.27美元降到1.33美元。
1.33美元。
一杯咖啡的钱,跑一次接近旗舰水平的复杂浏览任务。对于初创团队来说,这基本改写了AI应用的成本结构。OpenAI还贴心地附上了「保姆级」教程,教小团队如何以更低成本跑GPT-5.6。这哪里是技术发布,分明是对整个AI调用市场的价格屠杀。
🧠 ARC-AGI-3:从13.3%到38.3%的飞跃
回到GPT-5.6 Sol本身的能力指标。在ARC-AGI-3基准上,Sol的性能从13.3%飙到38.3%,同时输出Token暴降6倍。这意味着什么?用更少的计算量,拿到更高的分数。
效率的提升比绝对能力的提升更值得关注。
因为绝对能力的提升总有边际递减的一天,但效率的提升会直接解锁新的应用场景。当模型足够快、足够便宜,以前因为成本或延迟无法落地的想法,突然变得可行了。
GPT-5.6 Sol是OpenAI迄今为止在法律文书、金融模型和工程报告方面表现最佳的模型。在GDP-Val(衡量经济价值知识工作任务的基准)上,Ultrafast实现了5.6倍的端到端速度提升,质量未受影响。这组数据直接回答了一个问题:更快的推理速度如何加速经济价值工作?
⚡ 事件响应:当故障还在发生时
OpenAI列举了超高速模式的几个核心应用场景,其中事件响应最能体现速度的价值。
想象一下:关键系统突然故障,警报触发,工程师需要在系统和证据还在变化的情况下,快速构建准确的事件图景。以前这个过程可能需要数小时——读取日志、分析跟踪信息、汇总对话、确定下一步检查、准备修复方案。
现在呢?
Sol级别的智能加上Ultrafast的速度,可以在故障仍在发生时就完成上述全部流程。从观察信号到验证假设再到选择行动方案,中间的延迟被压缩到分钟级。工程师仍然负责判断和部署,但AI已经把所有信息整理好了。
这不是效率提升。这是工作方式的根本改变。
📈 金融研究的实时化
金融研究是另一个被彻底改写的场景。市场形势瞬息万变,分析市场信号、评估交易、识别可疑活动——这些任务以前需要分析师盯着屏幕跑几个小时模型。
超高速模式下,这些分析可以实时完成。
想象一个交易员在盘中发现异动,需要快速评估某个板块的风险敞口。以前他要么等分析师跑完报告,要么凭经验做判断。现在他可以直接问AI,在对话过程中实时获得分析结果,包括底层逻辑和数据支撑。
速度消灭了信息不对等。
但同时也意味着,没有接入高速AI工具的参与者,将在信息获取上处于绝对劣势。这场军备竞赛的门槛,又被抬高了一截。
🛒 实时商务:在犹豫变成放弃之前
电商场景的应用更加接地气。当购物者在商品页犹豫不决时,AI需要回答产品问题、检查库存、提供个性化推荐,还要解决结账环节的问题。如果AI响应太慢,犹豫就会变成放弃,购物车就被丢弃了。
750 tokens/s的输出速度,意味着AI可以在用户还在思考下一句话的时候,就已经把产品参数、库存状态、搭配推荐全部组织好了。对话不会中断,体验接近真人客服。
这对转化率的提升是实打实的。
有数据显示,页面加载时间每增加1秒,转化率下降约7%。AI响应速度同理——从等待5秒到几乎无感,中间差的是真金白银。
🔬 研究范式的转变:从过夜实验到实时迭代
OpenAI内部团队已经在用Ultrafast模式加速研发。以前研究团队的常见流程是:晚上启动一批实验,第二天早上看结果,根据结果调整方向,晚上再跑一批。这个循环最快也是24小时。
Ultrafast把循环压缩到了小时级。
团队可以在工作日内测试想法、检查结果、调整方法,然后立刻进行下一轮实验。工作流程不断档,创意不被等待时间打断。这种改变看似细微,但对科研效率的影响是指数级的。一年下来,同样时间能完成的实验迭代次数可能翻几倍。
这才是14倍速真正的意义。不是某个benchmark数字好看,而是工作流变了。
🔮 竞争格局:Cerebras成关键变量
这次发布的另一个主角是Cerebras。OpenAI选择与Cerebras合作而非英伟达,本身就是一个信号。传统GPU集群在大模型解码阶段的内存带宽瓶颈,是整个行业的心病。英伟达的HBM方案虽然在不断升级,但架构上的根本限制还在——权重搬运的时间开销无法消除。
Cerebras用晶圆级芯片绕过了这个问题。
4万亿晶体管、44GB片上SRAM、模型参数全部常驻——这套方案在架构上就是为高速推理设计的。OpenAI的背书给了Cerebras巨大的 credibility。如果Ultrafast模式反响良好,Cerebras很可能成为AI推理芯片市场的重要玩家,打破英伟达的垄断格局。
当然,产能是问题。晶圆级芯片的良率和产能远不如传统GPU,能否满足大规模商用需求还是问号。AI社区已经在期待Luna和Terra版本的超高速模式了,就是不知道Cerebras的芯片够不够用。
⚡ 写在最后
14倍速。25倍成本压缩。6倍Token节省。38.3%的ARC-AGI-3分数。
这些数字单独看都足够震撼,放在一起则描绘了一个清晰的图景:AI推理正在从「能用」走向「好用」,从「等待」走向「实时」。当旗舰模型可以在一个工作日内跑完人类博士级考试,当最小模型的成本降到一杯咖啡的价格,AI应用的边界正在以前所未有的速度扩张。
而那些还在用「AI会不会取代人类」这种框架思考问题的人,可能需要换个角度了。真正的问题从来不是取代,而是:当AI快到你看不见它思考的过程时,你和它的协作方式会发生什么改变?















