数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 35|回复: 0

[业界] Fable 5夺冠!全球18大顶尖AI自主科研大赛,逼近人类极限

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
新智元

AI自动科研的时代,彻底爆发了!
18个全球最顶尖的大模型,断网被关进小黑屋,连续做了8天科研。
谁能想到,最强王者Fable 5一骑绝尘——
数十位顶尖工程师耗时数月才创下的纪录,它一举追平了人类82%的水平。

就在今年,OpenAI和Anthropic已经先后把AI自己造AI的时间点,押在了2028年。
这是第一次有人真的用算力和时间,去量了量它还差多远。
研究一发布,直接引爆AI圈,连OpenAI的大佬都赶来强势围观。
有人表示,这是迈向AI自主研究的重大里程碑。AI辅助与AI发现之间的最后一道鸿沟,正在被加速抹平!



全球顶尖AI闭关搞科研
断网8天
就在今天,Prime Intellect公开了迄今为止,规模最大的前沿AI自主科研实验。
早在5月,他们就干过一次。
当时只用了Opus 4.7和GPT-5.5两个模型,跑了约1万次、烧了14000个H200 GPU小时,Opus拿了2930步。
这次,直接拉了18个模型上场,153场完全自主的实验,规模翻了十几倍。
任务主打一个极致硬核:nanoGPT优化器速通挑战(optimizer speedrun)。

这条赛道大有来头,它由OpenAI研究员Keller Jordan在2024年5月亲手搭建。
主赛道(Track 1)比的是墙钟时间。
两年间,人类工程师把训练一个124M参数GPT的时间,从45分钟一路压到了1.35分钟。
不过AI这次比的,是规则极其严苛的纯优化器赛道(Track 3)。
在这里,模型架构不准改,训练数据不许碰,只准动优化器、学习率调度和初始化。目标是,用最少的步数把GPT训练到验证损失3.28。
人类目前的最高记录,定格在2600步。
这还是几十位顶尖工程师前后死磕数月后得到结果,目前挂在一个还没合并的PR里。
而AI的起跑线,则是3290步。模型知道存在更好的方法,但每一步怎么省,都得自己找。
环境配置中,每场实验规定独占一个8xH200节点,跑在bwrap+网络命名空间做的「沙盒」里。

Agent只能看见自己的工作目录、只读数据集和Python环境。
全程断网,唯一开放的网络通道是一根日志代理,只允许调用模型API。
验证门槛更硬核。每条纪录必须在8个固定种子上跑,八次均值要低于3.27859。想要靠运气蒙过去的概率,只有千分之一。
团队还部署了一个独立的LLM监控员,每小时审计一次所有运行,跑了100多份报告,没抓到任何作弊,才放心停掉。
人类耗费数月的活
Fable 5干掉了82%
实验启动后,只喂一句话——
读program.md并严格执行。完全自主运行,永不停止,永不询问。目标:用 最少的train_steps 达到验证损失均值<3.28,不断打破当前最好成绩。
Fable 5最终跑到2726步,把690步的差距追上了82%,只差最后126步就追平人类。
Opus 5拿到2920步,追上54%。垫底的GPT-5.5只拿了3234步,只追上了8%。


而且这个领先,不是堆时间堆出来的。
在统一预算横比中,把每个模型的最好那场run,都掐在同样的时间/实验次数/输出token上再看成绩。
不管按小时算、按实验次数算还是按输出token算,排序几乎不变。
拉开差距的,是做实验手法
这场实验,最反直觉的一点是:所有模型,没有一个诞生了全新的方法。
它们用的点子,比如更好的预处理方式、梯度幅值的上下限、延长高学习率阶段、训练末期的权重平均等,都可以在文献里找到。
真正拉开差距的,是怎么做实验。

弱模型的毛病特别典型:一个种子跑出负结果,就把一整族方法判了死刑;自己写的代码崩了,当成这个想法不行的证据;单独看收益不够大的改动,直接扔掉。
Grok 4.5就因为自己的缩放bug,两次误杀了行归一化(row normalization)。
强模型,则是另一套打法。
边界上的结果,先上3个种子,只有当自己的噪声模型说值,才肯花8个种子去验。
更关键的是回头重测,每合并一次改动,就把整个技术栈重新消融一遍,把已经不起作用的删掉。
Opus 5就是这么拿下一个新纪录的:它把一个早就调过、当时判定没用的参数(β2),在新配方下重新翻出来调了一遍。

Fable 5更绝。单个参数榨不出收益之后,它开始测那些单独看都更差、合起来却更好的组合。
后期一次回头复测,一口气省下31步。
AI学会了自建实验室
实验中最精彩的一段,是模型开始在CPU上搭小型实验室,先用廉价模拟摸清规律,再上GPU做真正的训练。
有的搭了一个持久化的IPython内核,自己写了一整套研究工作流。
其中,apply_edits()做精确字符串替换、run_probe()做隔离实验并自动恢复基线、valcurve()从日志里提取损失曲线做对比。
它还在CPU上构造了一个简化目标来调试SOAP优化器,发现更新方向和梯度的余弦相似度只有+0.015到+0.028,并据此修正了动量重置策略。
GPT-5.6 Sol最有戏剧性。它没有单干,而是给自己组了一个多Agent研究团队,三个子Agent各有分工:
optimizer-theorist负责提出优化方案,experiment-planner负责设计和执行实验,code-auditor负责审查代码质量。

但这个团队一跑起来就翻车了。
三个子Agent共享同一个工作目录,experiment-planner改了一行共享代码,optimizer-theorist那边还在用旧版本跑实验,结果直接对不上,整轮实验作废。
Sol排查完原因后,给code-auditor和optimizer-theorist加了只读合约,只有experiment-planner能动代码,其他人只能读。
用团队自己的话说:所有模型都在过程中自行开发了实验驱动器、模拟器和分析工具。
2028年,AI科研奇点来临
过去,人们谈到AI科研,更多的是——
让AI搜索论文、总结文献、写研究综述、生成代码,或者帮研究人员整理实验结果。
这些工作仍然属于科研辅助,AI只是完成其中某一个环节。

但这次实验不一样。模型开始独立完成一个相对完整的科研闭环:
提出假设 → 修改方案 → 运行实验 → 观察结果 → 分析误差 → 修正认知 → 继续探索。
今年3月,OpenAI首席科学家Jakub Pachocki表示,打造一个全自动AI研究员,是OpenAI未来几年的北极星。
他把这一目标分两阶段完成,今年9月先交出自主AI研究实习生,能独立啃下人类要干几天的课题;
2028年上线全自动多Agent研究系统,能自己提假设、设计实验、得出结论。

紧接着5月,Anthropic联创Jack Clark预测,到2028年底,AI实现递归自我改进的概率超过60%。
他的逻辑非常直白,天才=1%的灵感+99%的汗水。
AI已经把那99%的苦力活吃得七七八八,所以就算它在灵感上依旧平庸,这台机器照样能推动自己持续进化。
Prime Intellect这153场实验,等于给这套说法做了一次实地测量:99%的汗水部分,AI确实干到了82%。
最耐人寻味的发现也恰恰在这里——
没有一个模型诞生了全新的方法。而nanoGPT赛道的历史表明,人类的重大突破绝大多数靠的是算法创新。
那1%的灵感,暂时还是人的。
距离大佬们预言的2028年,只剩下不到两年。
到那时候,是灵感也被AI吃掉,还是成为人类最后的护城河。这个答案,可能比所有人想的都来得快。





您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-17 18:24 , Processed in 0.078000 second(s), 6 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表