新智元报道


(资料图片)

GPT-5.6再次刷新AI智能天花板!

今天,OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。

在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。

另一边,「超小杯」Luna表现同样惊艳:

在BrowseComp测试中,它以84.04%性能直逼GPT-5.5(84.36%),更将成本从33.27 美元打到1.33美元。

此外,官方还附上了「保姆级」教程,教初创团队如何以更低成本跑GPT-5.6。

GPT-5.6实力大涨

输出Token砍6倍

仅一个月的时间,GPT-5.6 Sol内部悄悄完成进化。

一直以来,ARC-AGI-3是顶尖AI还未拿下50%的最难测试,测试规则非常简单——

把AI丢进一堆没见过的2D小游戏里,不给说明书,让它自己摸索规则怎么玩。

结果,GPT-5.6 Sol在官方榜上只拿了7.8%,而GPT-5.5仅有0.4%。

就拿上一代对比来看,同一个Sol在ARC-AGI-2上考了92.5%分,还通关了《宝可梦·火红》。

为此,OpenAI两位研究员Ilan Bigio和Ted Sanders去查了原因,问题出现在harness上。

ARC官方的「通用harness」干了两件事:每走一步,就把模型的私有推理过程丢掉;上下文一满,就从最老的开始截断。

也就是说,模型每走一步,记忆就会被清空,然后再重来一遍。

于是,团队把harness换成Responses API,打开两个开关「推理保留」和「压缩」,重新跑了一遍公开题集。

没想到,GPT-5.6 Sol从13.3%飙到38.3%,且输出Token减少6倍。

「超小杯」Luna

成本更低了

这份《建造者指南》里,最抓眼球的一组对比,来自BrowseComp。

这是OpenAI自己打造的,一个专考「能不能在全网输出冷门事实」的榜单。

三个月前,GPT-5.5开到Extra High档,拿下84.36%,总花费33.27美元。

现在,GPT-5.6家族里最小最便宜的Luna,同样Extra High,拿下84.04%,花了1.33美元。

虽然成绩仅差0.32%,但成本砍了足足25倍。

当然了,OpenAI想要说的是——

三个月前,只有旗舰GPT才能干的活儿,现在最低档的小模型Luna,也能做到八九不离十。

让GPT-5.6自写代码、调工具

指南中,OpenAI还给出了另外三种方式,都是让GPT-5.6实现更低成本部署。

第一个,是程序化工具调用(Programmatic Tool Calling)。

以前的Agent像个事必躬亲的老板:每收到一份材料,都需亲自过目一遍,才能说下一步干什么——

调100次工具,就得来回100趟。

现在模型可以直接写一段JavaScript,在沙箱里把工具批量调完、筛完、汇总完,只把最后那张表拿回自己眼前。

金融研究公司Rogo的实测结果,质量打平的前提下,输入Token少用了21%。

第二个,是「原生多智能体」。

主模型当工头,把活拆给一群子模型并行去干,最后收回来汇总。

ChatGPT里那个ultra档位,本来就是这么跑的,默认四个agent同时开工。

产品公司Obvious的联创Jon Bell说,他们一口气扔了六份需求进去,边写边搭边讨论,全程没散架。

第三个,是「提示词缓存」。

缓存有效期拉长到至少30分钟,断点还能自己指定位置。

AI公司Ploy的工程师给一段29000 token的共享提示词加了断点和工作区专属键,未命中缓存的输入直接少了28%。

每秒750个token

加速14倍

同一天,OpenAI放出了Ultrafast模式预览版。

GPT-5.6 Sol,最高14倍速,每秒吐出750个token,先在OpenAI API上线。

这件事的分量在于,它撕掉了一条用了两年的潜规则——想要实时响应,就得退而求其次换个小模型。

现在不用了,Ultrafast跑的还是那个Sol,智能水平一点没减。

Cerebras自己做了一组对照,选的题是Humanity"s Last Exam——2500道通常只有博士才答得上来的题。

Sol Ultrafast跑完全部2500题,用时11小时11分。

Claude Fable 5跑同一批题,用了78小时27分,三天多。

准确率相当,速度差了近7倍。

提分、降本、提速,短短一个月的时间,GPT-5.6完成了一次真正意义上的全方位进化。

参考资料:

https://openai.com/index/builders-guide-to-gpt-5-6

编辑:桃子

推荐内容