新智元披露
GPT-5.6将AI智能高度再次抬高
今日,OpenAI发布《GPT-5.6构建者指南》,展示出一份出色的成果。
在ARC-AGI-3测试中,GPT-5.6 Sol的表现从13.3%跃升至38.3%,输出Token数量骤减6倍。
另一面,「小巧版」Luna的展示同样令人赞叹:
在BrowseComp考核中,其以84.04%的成绩紧随GPT-5.5(84.36%),并将成本从33.27 美元降至1.33美元。
另外,官方还提供了详尽的指导,指导初创团队如何以较低成本运行GPT-5.6。
GPT-5.6性能大幅提升
输出Token减少6倍
短短一个月内,GPT-5.6 Sol悄然完成了内部进化。
一直以来,ARC-AGI-3被视为顶尖AI尚未达到50%难度的测试,测试规则相当简单——
把AI放入一组全新的2D小游戏里,不提供使用说明,让它自行摸索游戏规则。
结果,GPT-5.6 Sol在官方排行榜上获取了7.8%的分数,GPT-5.5仅有0.4%。
比较上一代产品来看,同一Sol在ARC-AGI-2上获得了92.5%的得分,还成功通过了《宝可梦·火红》。
为此,OpenAI研究员Ilan Bigio和Ted Sanders调查了原因,毛病出在harness上。
ARC官方的「通用harness」完成了两大任务:每执行一步,就把模型的私人推理进程舍弃;上下文满载时,就从中剔除最旧的记录。
换言之,模型每执行一步,记忆就会被清零,然后重新开始。
因此,团队将harness换为Responses API,开启「推理保留」与「压缩」两个选项,再次运行公开题集。
意外的是,GPT-5.6 Sol从13.3%提升至38.3%,且输出Token削减了6倍。
「小型」Luna
成本更为低廉
《建造者指南》中最引人注目的对比,来源于BrowseComp。
这是OpenAI创建的,专门测试「能否在网上输出特殊事实」的排行榜。
三个月之前,GPT-5.5开到Extra High级别,取得了84.36%的成绩,总计花费33.27美元。
如今,GPT-5.6系列中最小最经济的是Luna,以同样Extra High模式,获得84.04%的成绩,花费1.33美元。
尽管成绩仅相差0.32%,但成本大幅削减了25倍。
当然,OpenAI想要强调的是——
三个月之前,只有旗舰GPT才能完成的任务,现在最低配置的Luna也能实现八九不离十的效果。
让GPT-5.6自行编写代码、运用工具
指南中,OpenAI还提供了三种方式,都是实现GPT-5.6更低成本运行的方法。
首个方法是程序化工具调用(Programmatic Tool Calling)。
以往的Agent如同事无巨细的老板:每收到资料,都必须亲自审阅一遍,才能确定下一步行动——
调用100次工具,就得往返100回。
现在模型能够直接编写Java代码,在沙盒中批量调用、筛选、整合工具,只拿出最终表格返回给模型。
金融研究公司Rogo的测试显示,在质量持平的条件下,输入Token减少了21%。
第二种方式是「原生多智能体」。
主模型扮演工头角色,将任务拆分给多个子模型并行处理,最后汇总结果。
ChatGPT里的ultra级别,原本就是用这种模式运行的,默认设定四个agent同步工作。
产品公司Obvious的联合创始人Jon Bell说,他们一次性输入了六份需求,边编写边搭建边讨论,整个过程未出现混乱。
第三种是「提示词缓存」。
缓存有效期延长至至少30分钟,还能自行设置断点位置。
AI公司Ploy的工程师给29000 token的共享提示词增加了断点和工作区专属键,未命中的输入直接减少了28%。
每秒处理750个token









网友评论