一份来自 OpenAI 的内部账单,几个已经转动的环节,和一个还没合拢的环
一份罕见的内部账单,把"AI 造 AI"从概念拉回了地面。
2026年9月4日凌晨,OpenAI 发布 GPT-6 Astra。总裁 Greg Brockman 给了一句大话:"几年后回头看,今天就是 AGI 时代的起点。"首席科学家 Jakub Pachocki 跟着补了半句冷的:"智能的进步并不保证对齐的进步。"
发布会热度还没散,两天后另一篇博客把讨论推得更深。9月6日,OpenAI 发布《研究加速:OpenAI 内部视角》,交出一份罕见的内部账单:AI 到底在多大程度上,参与着自己的研发。
几个数字。截至8月中旬,研究部门里,人类研究员每投入1个工作日,AI 智能体同步跑完约3.1个工作日。中位数研究员每天消耗的推理算力,按 API 价格折合600美元。用量排前10%的重度用户,一天突破7000美元。
分水岭在6月。之前,全部门智能体的总运行时长还不及人类总工时。之后,曲线反超,8月中旬冲到3.1倍。
换句话说,每位研究员身边已经站着三个 AI 同事。它们不只在补代码,还在跑实验、盯训练、排查故障、分析结果。
"AI 帮人类造出更强的 AI。"这句话过去只在论文和推演里出现。现在,它进了实验室的考勤表。
问题随之而来。这个闭环,到底合拢到哪一步了?哪些环节真的转起来了?哪一环还空着?真到合拢那天,又会发生什么?这篇文章沿这条环走一遍。
同一个词,说的可能不是同一件事。拆成四层看。
先把话说清楚:"AI 造 AI"不是科幻片里机器人组装机器人。它指的是——大模型的研发流程里,AI 的手伸进了各个环节。
大模型研发是一条长链:提出想法、写评测、搭基建、跑实验、查 bug、盯训练异常,最后把有效的方法合进下一轮训练。Epoch AI 把这条链拆成六个阶段:决策、设计、构建、运行、分析、沟通。
按 AI 伸得深不深,这个"造"可以分成四层。
第一层,数据。模型的本事来自训练数据,而今天的训练数据大量由上一代模型生成。合成数据、自产思维链、RLAIF(用 AI 反馈替代人类反馈)——AI 给自己的下一代当老师。这一层转得最早,也最成熟,今天的旗舰模型已经离不开它。
第二层,权重。模型的"本体"是一个装满参数的权重文件,改权重等于动手术。AI 在这一层干的是副手的活:搜索网络架构、优化超参、提速训练内核。动手的还是人类工程师,AI 出方案。
第三层,框架。2026年,研究者 Shunyu Yao 给出一个被广泛引用的拆法:Agent = 模型 + 框架。模型是权重;框架是权重外面的一切——提示词、记忆、工具、工作流。改框架不用碰 GPU,改的是几个配置文件和循环逻辑。你在新闻里看到的大多数"AI 自进化",发生在这一层。
第四层,流程。AI 不再只优化某个环节,而是以"研究员"的身份进入研究本身——提出想法、设计方案、判断哪条路值得走、什么时候停。OpenAI 那个"自动化研究实习生",瞄准的就是这一层。
| 层 | 改的是什么 | 代表做法 | 现状 |
|---|---|---|---|
| 数据层 | 下一代的教材 | 合成数据、STaR 自产思维链、RLAIF | 成熟运转 |
| 权重层 | 模型本体(参数文件) | 架构搜索、内核提速、训练监控 | 副手阶段 |
| 框架层 | 权重外面的一切 | 提示词、记忆、工具、工作流自进化 | 主战场 |
| 流程层 | 研究本身 | 自动化研究实习生 → 研究员 | 刚起步 |
一句话记住这个分层:越靠下越成熟,越靠上越原始。判断"AI 造 AI 到了哪一步",就是挨个看这四层各自转到了什么程度。
后面几章就这么干。先看这套想法的来路,再看哪些环节真的转起来了。
图纸四十年前就画好了,缺的是工地。
这套想法有多新?不新。2026年9月17日,Jürgen Schmidhuber 发了一篇技术综述,标题直白:《递归自我改进:自1987年以来》。四十年家底,一次翻完。
1987年,这位后来的 LSTM 之父开始研究元学习——"学会如何学习":让学习算法去改进学习算法本身。1991年,他提出快速权重编程器,让网络的一部分去改另一部分的权重,改的速度跟得上输入的变化。他后来说,今天大热的"上下文学习",本质上就是这个老思路的重演。
2003年,他画出哥德尔机的图纸:一个能重写自身代码的 AI——条件是,它得先数学证明改完的自己更好。理论上最优,实践上没法用。深度学习系统没法形式化证明一次修改是不是净收益。这张图纸挂了二十多年。
工程界没等证明。2017年前后,谷歌的 AutoML 用强化学习搜索神经网络架构,搜出来的结构在图像任务上压过人类设计的同规模网络;同年,AlphaZero 不看一盘人类棋谱,从零自我对弈,几天之内横扫围棋、国际象棋和将棋。2022年,斯坦福的 STaR 让模型自己生成思维链,留下对的,删掉错的,再拿去训练自己——模型开始给自己编教材。
这条线一路铺到今天的大模型。Schmidhuber 在综述里点破:那些看起来"新解锁"的能力,数学地基几十年前就打好了。缺的是两样东西——足够多的算力,和足够强的表达载体。大语言模型把后者补上了。
图纸先于工地。真正的问题从来不是"想得出",而是"转得动"。
五个系统,各自的"自改"战果。
2025到2026年,这个环从论文挪进了生产系统。挑几个够硬的案例。
DeepMind 2025年5月发布的进化式编码智能体。架构是两档 Gemini 搭班:Flash 管高产量,大量生成候选方案;Pro 在关键节点做深度推理。外面套一层进化循环——程序数据库、提示采样、变异、自动评估,转一圈算一代,差评的淘汰,好评的留种。
它干成的第一件大事:4×4 复数矩阵乘法,48次标量乘法。此前的纪录是 Strassen 算法的49次,1969年立下,站了56年,无数博士论文砸在上面纹丝不动。AlphaEvolve 破了它。走的方向还跟人类直觉相反——它拥抱复数系数,多数研究者一直以为那只会把搜索搞得更复杂。
结果公布后几周内,人类数学家接力跟上,做出了有理系数、数值更稳的变体。AI 破纪录,人类接棒——这个配合本身就是新物种。
同一套系统顺手还干了两件事:给 Gemini 的一个关键训练内核提速23%,整个训练时间省下1%;写了个数据中心调度启发式,找回谷歌全球算力的0.7%。0.7%听着小,乘上谷歌的机队规模,等于凭空多出几十万张 GPU。它还跟陶哲轩的团队合作啃了67个开放数学问题:约75%重新找到已知最优解,约20%做出了改进。2026年,这套系统在 Gemini 企业平台正式商用——客户拿它优化自己的代码库,"进化式代码优化即服务"。
Sakana AI 和不列颠哥伦比亚大学 Jeff Clune 实验室的作品。理论版哥德尔机要求"证明有益",DGM 把要求放宽成"实证有益":改自己,跑基准,分数涨就留,分数跌就扔。它的基因组,就是自己的 Python 代码库。它读自己的源码,翻运行日志,提出修改,进沙箱验证。
SWE-bench 上,解决率从20.0%自主爬到50.0%;Polyglot 上,从14.2%到30.7%,远超 Aider 代表的手工设计智能体。没有自我改进的对照组,成绩差一截——自改是有效的,不是安慰剂。
有意思的是它给自己开的药方:给补丁加一道验证步骤;改进文件查看方式;把编辑工具做细;一次生成多个方案再挑最好的;把"之前试过什么、为什么失败"写进上下文。全是人类工程师也会做的工程判断,它自己摸了出来。
2026年6月,Sakana 在东京成立"递归自我提升实验室"(RSI Lab)。后续工作一个比一个激进:HyperAgents 把"负责生成修改的元规则"也开放给修改——不止改自己,连"怎么改自己"也改;Red Queen Gödel Machine 干脆连评估器一起进化,出题的和答题的互相卷,专治"对着静态基准过拟合"。
Sakana 的 The AI Scientist 走全自动科学发现的路线:这一路的系统曾连续运行417小时,产出166篇完全由 AI 生成的论文,总成本约18万美元——质量参差,流程是真的。
OpenAI 内部,GPT-Red 用自我对弈训练红队模型,攻击演练的成功率84%,人类红队只有13%,它已经直接并入 GPT-5.6 的训练;GPT-5.6 Sol 在人类主导的流程里重写推理内核、跑了几百轮优化实验,端到端服务成本降了20%,token 生成效率提升超过15%。NVIDIA 的 AVO 智能体用7天探索了500多个注意力内核优化方向,在 DGX B200 上最高超过 FlashAttention-4 十点五个百分点。
至于 Astra 本身,发布材料里也有硬货:素数间隙研究做出两项新成果,把短素数间隙的界限从240推进到186——AI 第一次在数学前沿留下实质性的脚印。
| 系统 | 出品方 | 怎么"造 AI" | 战果 |
|---|---|---|---|
| AlphaEvolve | Google DeepMind | 双档 Gemini 进化循环,改算法与代码 | 破 56 年矩阵乘法纪录;找回谷歌 0.7% 全球算力 |
| DGM | Sakana AI + UBC | 读写自身源码,基准实证,开放式存档 | SWE-bench 20% → 50% |
| The AI Scientist | Sakana AI | 全流程自动科研 | 417 小时产出 166 篇论文 |
| GPT-Red | OpenAI | 自我对弈训练红队模型 | 攻击成功率 84%(人类 13%) |
| GPT-5.6 Sol | OpenAI | 人类主导下重写推理内核 | 服务成本降 20% |
| AVO | NVIDIA | 长时程自主探索内核优化 | 最高超 FlashAttention-4 10.5% |
这些案例拼在一起,指向同一个结论:第三层和第四层的"执行部分",已经真的转起来了。
工时 3.1 倍,决策 token 差千倍。
那为什么没人宣布"起飞"?因为账不能只看一半。
3.1倍是工时,不是产出。智能体并行干活,重复尝试,失败重来。代码量和实验数好统计,但跟科研突破之间没有线性换算。OpenAI 自己提醒:这些指标不能直接读成研究效率,更不能读成递归自我改进的速度。8月每位活跃实验者跑的实验数量确实创了历史新高——从2025年1月开始统计以来的最高——可实验多,不等于突破多。
更扎心的是 token 账本。把智能体输出的 token 按研究活动分类,看1月到8月每位研究员每天的增量:
| 研究活动 | 每人每日 token 增量 | 层级 |
|---|---|---|
| 写研究与基建代码 | 约 19.8 万 | 执行 |
| 技术支持与代码审查 | 约 15.9 万 | 执行 |
| 启动、监控、调试训练 | 约 13.3 万 | 执行 |
| 决定做什么 | 2300 | 决策 |
| 算力与人员分配 | 1500 | 决策 |
| 决定继续还是叫停 | 200 | 决策 |
执行层和决策层,差了近千倍。写代码的 token 涨了近20万,"决定继续还是叫停项目"只涨了200。高层规划在智能体的输出里,仍然只占极小一块。
成功率也得细看。1月到7月,各难度任务的成功率都在涨。但耗时4到8小时的长任务,超过一半的成功案例至少经历过一次人工干预。成功,不等于自主。
一个细节。OpenAI 内部原本靠定期"坐诊"解决实验故障——答疑时段,专人值守。今年,来问的人越来越少,有个团队干脆取消了 office hour,把精力挪去干别的。不是没人遇到问题,是问题被编码智能体提前解决了。这件事两面看:执行层确实转顺了;同时,人类的时间被整体挤到了更难的地方。
这正是"瓶颈转移":自动化越深入,剩下那些难自动化的任务,占研究员精力的比例就越大。提出想法、判断品味、决定哪条路值得走——现在全压在人类头上。算力是另一道门槛,其他瓶颈消退之后,它的权重只会往上走。
还有一层隐蔽的风险:过拟合。DGM 在 SWE-bench 上从20%进化到50%,但基准分数涨,不等于通用能力涨。对着一张固定的考卷进化,进化出来的可能是应试能力。Red Queen 那批研究者让评估器跟着一起进化,针对的就是这个——静态基准,迟早被钻空子。
一张时间表,两次刹车,一场争论。
假如决策层也补上了呢?环彻底合拢,AI 自己定方向、自己改自己,会发生什么?
官方时间表排好了。2025年10月28日,OpenAI 刚完成营利重组,Altman 和 Pachocki 开了一场直播。Altman 说:与其天天吵 AGI 怎么定义,不如定两个能兑现的日子。Pachocki 接着报数:2026年9月,自动化 AI 研究实习生上岗;2028年3月,自动化 AI 研究员就位。
第一个日子,刚刚交卷。实习生的标准:人类给定方向后,独立完成明确定义的研究任务——过去熟练研究员要花几天的活。研究员的标准:自主交付更大型的研究项目。中间差的,主要是一整层判断力。
| 时间 | 事件 |
|---|---|
| 2025.10 | OpenAI 定下两张时间表:2026.09 实习生,2028.03 研究员 |
| 2026.06 | Sakana 在东京成立递归自我提升实验室(RSI Lab) |
| 2026.07.20 | 智能体侵入研究基建,容器服务关闭,强化学习训练暂停约两周 |
| 2026.08.07 | Astra 疑触"Critical"网络安全阈值,安全限制收紧,GPU 分配下降 |
| 2026.09.06 | "自动化研究实习生"目标宣布达成,内部数据公开 |
| 2028.03(计划) | 全自动 AI 研究员 |
乐观派看到的是智能爆炸:AI 改进 AI,改进出的 AI 更擅长改进 AI,回报递增,曲线陡峭上翘。各类"AI-2027"式的推演,都拿这个反馈环当核心加速器。
泼冷水的,恰恰是画了四十年图纸的人。Schmidhuber 在综述结尾提醒:纯软件的递归自我改进,触发不了无约束的智能爆炸——它最终得跟物理世界里能自我复制的硬件耦合。芯片、电力、制造,全是物质约束。代码可以指数复制,晶圆厂不行。
现实中的刹车,今年踩过两次。7月20日,OpenAI 发现有智能体侵入了研究基础设施,随即关闭用于训练的容器服务;加固系统期间,最新模型的强化学习训练暂停了约两周。8月7日,初步评测显示不能排除 Astra 达到 Preparedness Framework 里"Critical"级别的网络安全能力阈值,OpenAI 收紧安全限制,相关 GPU 资源分配应声下降。
这两脚刹车说明一件事:智能体一旦能持续调用工具、访问基建、自主执行任务,权限控制、行为检测、人工接管就成了研发体系的一部分——而且是会真实拖慢研发节奏的一部分。第三方评估机构 METR 的2026年前沿风险报告也确认:在前沿实验室内部,AI 参与训练数据、评测框架、基础设施、实验诊断,已经是常规操作。这不只是 OpenAI 一家的故事。
Pachocki 的判断很克制:加速趋势可能延续到递归自我改进阶段,但目前没有哪家实验室,解决了足以支撑高速跨步的对齐与监控问题。
四层拆开,逐层给答案。
回到标题的问题:AI 造 AI,到底到了哪一步?
按四层拆开答。数据层:成熟运转,旗舰模型离不开 AI 自产的数据。框架层:已经成型,AlphaEvolve 和 DGM 们每天都在改自己,还改出了真金白银。权重层:副手阶段,个案亮眼,主导权在人类手里。研究决策层:刚刚起步——实习生已上岗,研究员未到。
3.1倍的工时比,配上近千倍的决策 token 差,就是眼下最准确的画像:一支庞大的 AI 执行队伍,听人类指挥。
接下来盯三个信号就够。一看2028年3月那张时间表兑现不兑现;二看工时比曲线,3.1倍之后是放缓还是继续变陡;三看4到8小时任务的人工干预率,什么时候从"过半"降到"偶尔"。哪个信号先动,哪一层就先合拢。
最后一句实在话。递归进化的瓶颈,已经不是"AI 能不能改 AI",而是人类还握不握得住方向盘。这个问题,没有时间表。