新智元发布信息
AI自主科研浪潮汹涌澎湃
18款世界级顶尖大模型,被切断了网络连接,关入独立的计算机环境,连续开展研究长达8天。
谁能料到,实力最强的Fable 5脱颖而出——
耗费数十位精英工程师数月心血才铸就的纪录,它竟一鼓作气达到人类82%的境界。
同一年,OpenAI和Anthropic相继将「AI自主创造AI」的日程定在2028年。
这标志着首次有人用计算资源和时间,实际衡量了它和目标之间的距离。
研究成果一公布,立刻点燃AI圈子,连OpenAI的高层都赶来近距离观察。
有人评论,这堪称迈向「AI独立进行科研」的关键节点。「AI辅助」和「AI发现」之间的最后障碍,正被迅速消除!
全球顶级AI「闭关」钻研课题
断网持续8天
就在最近,Prime Intellect披露了一项空前的前沿AI自主科研实验。
早在五月时分,他们曾开展过一次尝试。
当时只动用了Opus 4.7和GPT-5.5两个模型,执行了约1万次运算、消耗了14000个H200 GPU小时,Opus获得2930步的成果。
这次直接动用了18个模型,进行了153场完全独立的实验,规模扩大了十几倍。
核心任务聚焦于「高难度挑战」:nanoGPT优化器速通挑战赛。
这条赛道声名显赫,由OpenAI研究员Keller Jordan在2024年5月亲自设立。
主赛道(Track 1)较量的是「实际耗时的钟表时间」。
过去两年里,人类工程师将训练一个124M参数GPT的时间从45分钟压缩至1.35分钟。
但AI这次比拼的是规则极为苛刻的纯优化器赛道(Track 3)。
在此赛道中,模型架构和训练数据均受限制,仅可调整优化器、学习率安排和初始化参数。目标是,以最少的步骤将GPT训练至验证损失值3.28以下。
人类目前的最高纪录定格在2600步。
这是几十位杰出工程师连续数月不懈努力后的成果,目前仍保存在一个未合并的代码库Pull Request中。
而AI的起始点是3290步。模型知晓「存在改进方案」,但每一步的优化路径必须自主探索。
实验环境设定为,每场试验独占一个8xH200计算节点,在bwrap+网络命名空间构建的「沙盒」内部运行。
智能体只能访问自用的工作目录、只读数据集和Python环境。
全程无法联网,唯一开放的网络接口仅限于一个用于日志传递的代理,仅能用于调用模型API。
验证标准更为严格。每条纪录必须在8个预设的随机种子上重复执行,八次算术平均值需低于3.27859。侥幸成功的概率不足千分之一。
研究团队还部署了专门的LLM审核员,每小时对所有运行状况进行监察,生成100多份报告,确认未发现作弊行为后才终止实验。
人类数月攻关的课题
Fable 5只差88%
实验启动时,系统仅下达明确指令——
读取program.md并严格执行。完全独立运作,不暂停也不提问。目标:用最少的train_steps达成验证损失平均值<3.28,持续刷新最佳表现。
Fable 5最终得到2726步,将690步的差距缩短了82%,仅余126步便可追平人类纪录。
Opus 5取得2920步,缩小54%。表现最差的GPT-5.5仅完成3234步,仅超越8%。
而且这项领先并非「单纯依靠连跑时间」得来。
在「统一资源消耗」对比中,将每个模型的最佳实验记录,全部控制在相同的时间/实验次数/输出token条件下进行评估。
无论是按照小时计算、实验次数计算还是输出token计算,排名几乎保持不变。
造成差距的,正是实验操作方法
此次实验最令人意外之处在于:所有模型无一提出全新研究思路。
它们使用的技巧,如优化预处理环节、调整梯度幅值界限、延长高学习率训练期、训练末期进行权重平均等,均可在文献资料中找到。
真正产生显著影响的是实验策略
模型性能的缺陷特别明显










网友评论