当 AI 构建自身——Anthropic 谈递归自我改进
本文是对原文的编译转述,保留全部核心论点与数据,结构略有调整。原文更长,含图表与员工引语,推荐阅读。
核心论点
AI 发展史上,每个开发环节都由人类驱动。但 Anthropic 正把越来越多的 AI 开发工作委托给 AI 系统本身,这正在加速研发。这一趋势推到极致——给足算力——就指向一个能完全自主设计并开发自己后继者的 AI 系统,即「递归自我改进」(recursive self-improvement)。
目前尚未实现,也并非必然发生。但它到来的速度,可能快于大多数机构的准备程度。
一个标志性数据:如今 Anthropic 工程师平均每季度交付的代码量,是 2021-2025 年间的 8 倍。
五个阶段
| 时期 | 形态 |
|---|---|
| 2021–2023 | 构建第一代 Claude:人类在笔记本上手写所有代码和文档 |
| 2023–2025 | 聊天机器人:生成代码片段,人工复制粘贴进编辑器 |
| 2025–2026 | 编码 Agent:自主编写、编辑代码,有时是整个文件 |
| 现在 | 自主 Agent:自己运行代码,并把数小时的工作委派给其他 Agent |
| 20XX? | 闭环:Agent 有能力自己构建和训练模型,未来的 Claude 由 Claude 持续改进 |
来自外部世界的证据
- AI 能可靠独立完成的任务时长约每 4 个月翻倍(此前趋势是 7 个月)。2024 年 3 月,Opus 3 能完成人类约 4 分钟的软件任务;一年后 Sonnet 3.7 达到约 1.5 小时;再一年后 Opus 4.6 达到 12 小时。趋势若延续,今年将触及「人类需数天」的任务,2027 年可达「数周」级
- SWE-bench(给模型真实开源代码库 + 真实 bug 报告,要求修复并通过项目自己的测试):两年内从个位数得分到饱和
- CORE-Bench(给模型已发表论文的代码和数据,要求复现结果——做原创研究的前提):15 个月内从约 20% 成功率到饱和
- METR 发现 Claude Mythos Preview 能连续工作「至少 16 小时」,已达其现有任务集的测量上限
公开基准说明了能力,但说明不了 AI 对 AI 开发本身的加速作用。这需要来自 AI 公司内部的直接证据。
来自 Anthropic 内部的证据
构建前沿模型有两类工作:工程(写代码、搭基础设施、盯训练)和研究(决定跑什么实验、解读结果、判断下一步试什么)。
两边的图景一致:工程上,Claude 已能接手「目标明确但方法未定」的问题——人类给目标,不再需要给方法;研究上,Claude 执行明确定义的实验已能匹敌或超越熟练人类。但在自主选择目标的判断力上仍有较大差距——这正是当前 AI 与「能自主设计后继者的系统」之间的鸿沟。
代码:从个位数到 80%+
- 截至 2026 年 5 月,Anthropic 合并入生产代码库的代码中超过 80% 由 Claude 编写(Claude Code 于 2025 年 2 月发布研究预览之前,这个数字是个位数)
- 单个工程师每天合并的代码行数,在 Anthropic 头四年(2021-2024)保持平稳,2025 年 Claude 开始自己运行代码后开始爬升,2026 年模型能在更长时间跨度自主工作后再次变陡。2026 年 Q2 达到 2024 年的 8 倍
- 作者自己加了限定:代码行数衡量数量而非质量,8 倍几乎肯定高估了真实生产力增益。但它确实表明加速存在——Anthropic 不按代码行数考核,人们写得多只是因为在用 AI 写
- 2026 年 3 月对 130 名研究人员的调查:中位数估计,用 Mythos Preview 后的产出约为完全不用 AI 时的 4 倍(作者认为真实值略低,但方向可信)
- AI 还在做「原本根本不会发生」的工作:2026 年 4 月,Claude 提交了 800 多个修复,把某类 API 错误降低了 1000 倍。监督它的工程师估计,人类做完这件事需要四年
「我大概一年前开始全力 Claude 化。这是段疯狂的旅程——到现在我已经约 5 个月没亲手写过任何代码了。」——Anthropic 员工
质量:从逊于人类到即将反超
「好代码」有两层含义:能跑,且别的工程师能看懂、能在其上继续构建。
- 第一层证据明确:员工纠正、改方向、中途接管 Claude 的频率已持续下降一年——包括在最复杂、最开放的任务上。最开放式任务的会话成功率在 2026 年 5 月达到 76%,6 个月内上升 50 个百分点。例子:一次例行升级开始让数万个训练任务崩溃,工程师只给了 Claude 一点文字描述和集群权限,Claude 逐一排查运行环境,定位到一个触发崩溃的冷门调试 flag,稳定复现并确认修复——两小时干完了通常需要两三天的活
- 第二层差距仍在但收窄很快:内部多数人认为 Claude 写的代码 2025 年底还逊于人类,现在大致持平,预计一年内会严格更好
- 代码审查方式也变了:所有变更合并前先过自动化 Claude 审查。回溯分析显示,它本可在上线前抓住 claude.ai 历史事故背后约 1/3 的 bug——而写那些代码的工程师是世界上最擅长构建这些系统的人
研究:执行已超人,判断在追赶
- 固定目标的实验优化:每次发版都做同一个测试——给 Claude 一段训练小模型的代码,让它在保持正确性检查通过的前提下尽量提速。2025 年 5 月 Opus 4 平均约 3x;2026 年 4 月 Mythos Preview 约 52x。校准参照:熟练人类研究员需要 4-8 小时才能做到 4x。在这个环节,Claude 一年内从「很有帮助」变成「超人」
- 自主提出实验:2026 年 4 月,Anthropic 发布了首个 Claude 端到端跑开放研究课题的演示。课题是 AI 安全的开放问题(弱模型能否可靠监督强模型),Agent 们自己提假设、做测试、与并行 Agent 共享发现并迭代。两名人类研究员一周恢复了约 23% 的性能差距;Agent 用 800 累计小时、约 1.8 万美元算力恢复了 97%。(注意限定:结果未能干净迁移到生产规模模型,选题和评分标准仍由人类制定——但边界之内,每个实验都是 Agent 自己设计的)
- 研究判断力:从真实 Claude Code 会话中选出 129 个「人类研究员走了弯路」的节点,只给模型看走偏之前的内容,问它下一步怎么走,再由能看到全程结局的另一个 Claude 评判谁的选择更好。2025 年 11 月的 Opus 4.5 在 51% 的情况下胜过人类选择;2026 年 4 月的 Mythos Preview 升至 64%。研究的日常本质上就是一连串这样的「下一步」决策
「现在的格局大致是:人类出想法,模型能以快一个数量级的速度去实现、测试和评估它们。」——Anthropic 员工
人类的角色在收窄
人机代码质量达到平价后,人类将停止写代码、只做审查——但若审查速度跟不上生成速度,人类审查会成为 AI 开发的瓶颈。同样,当 Claude 能跑实验后,问题变成「哪些实验值得跑」。简言之:「做」(写代码、跑实验、出结果)的人类时间成本已趋近于零,即使算力成本仍在。
目前人类的比较优势是研究品味与判断:选哪些问题、信哪些结果、何时止损。
文中也收录了更私人的声音:
「工作(和生活)曾经运行在人与人之间小恩小惠的礼物经济上。『能帮我把这个脚本跑起来吗?』每一次都产生一点亏欠、一点相互的在意。Claude 更快、零亏欠——但每一次也都是一次失去的人类协作邀约。」
「一切顺利的日子里,我忍不住想:我做的什么都不重要了,一切都自动化了,比我更好更快。但也有一切都崩了我又看不懂为什么的日子——那时我意识到,我已经不知道自己最近都在干什么了。」
如果我们错了呢?
自然的反驳是:留在人类手里的「选题判断」才是最重要的,没有它 Claude 只是能干的助手,不是能独立驱动 AI 进步的系统。
作者的回应:AI 很少靠「灵光一现」推进。Transformer、MoE 这类范式突破多年才出现一次;其间大部分进展是增量循环——放大规模、看哪里坏了、修、再试。这恰恰是 Claude 现在擅长的工作流。爱迪生说天才是 1% 灵感加 99% 汗水,而汗水正在被自动化。
即便 Claude 永远学不会研究品味,保守解读也意味着复合加速:人类把时间花在占比个位数的方向把控上,每个人撬动的工作量远超从前。激进解读则是:「研究品味」可能只是又一个 AI 暂时不会、之后会学会的能力——解释笑话为什么好笑、心智理论、语言谜题,都走过同样的轨迹。
三种可能的未来
一、趋势停滞,但现有能力广泛扩散。 指数曲线可能其实是 S 曲线;瓶颈也可能在供应链——芯片产能、电网、互连带宽——而非智能本身。但即便能力冻结在今天,世界也会巨变:Project Glasswing 头几周内,Mythos Preview 就在全球最关键的系统中发现了一万多个高危/严重漏洞——多到网络防御的瓶颈已从「找漏洞」变成「修补速度」。作者认为这是三者中最不可能的情景——所有能测量的能力曲线至今没有弯——但它留给政府和社会的适应时间最多。
二、AI 实验室持续获得复合效率增益。 开发大幅自动化,人类仍设方向、judge 结果。100 人公司能做一万乃至十万人组织的工作;这会革新知识工作和政府服务,也可能被用于恶——全民监控、对每个个体定制的操纵性影响行动。作者认为目前的证据指向这个情景。 但阿姆达尔定律(Amdahl’s law)会起作用:加速一部分往往只是把瓶颈转移到别处——Anthropic 已经遇到人工代码审查成为新瓶颈,以及「想法、工具、原型多到远超有能力跟进的程度」。组织发现并修复自身瓶颈的速度,可能成为最重要的组织能力。
三、AI 实现完全递归自我改进,开始构建自己的后继者。 进展速度完全由算力供给(或算法效率发现的速度)决定,人类大幅转向监督、验证一个不断扩张的「虚拟实验室」。对齐问题如何解决最不确定:模型可能足够对齐、自己找到我们尚未触及的新解法,甚至足够智慧在不行时主动停下;也可能让今天罕见的失对齐在自我迭代中复合放大——更频繁、更难懂,直到失控。但阿姆达尔定律同样适用于世界本身:再多的智能也无法提前知道一款药几十年后的效果,不能比宪法规定更早举行选举,也不能在一个周末把陌生人变成老友。对大多数人而言,这个未来的体感节奏仍由瓶颈决定——即使上游实验室以算力的速度狂奔。
该做什么?
- 若能有效放慢这项技术以争取时间,那很可能是好事;但若放慢只是让最不谨慎的参与者追上来,反而让所有人更不安全。没有全球协调机制,公司和政府将不得不在竞争与地缘政治压力下做艰难的安全决策
- Anthropic 认为,世界应该拥有可验证地放慢或暂停前沿 AI 开发的选项。Anthropic Institute 将与多方协作研究并推动构建这类机制——让前沿开发者能验证其他人真的停了,且没人借协调暂停之名偷跑。如果这种机制存在、且其他接近前沿的开发者也以可验证的方式放慢,Anthropic 预计自己也会放慢或暂停
- 难点:训练比导弹发射井更容易隐藏,输入是通用算力,悄悄违约的激励巨大——谁在别人暂停时继续,谁就可能继承领先。可信的暂停还必须明确触发条件、解除条件、由谁裁决。核军控验证体系(如《中导条约》)花了几十年建立基础设施和信任,「我们没有那么久」
- 单边暂停可以立即做到,但作用有限:它只会换掉领跑者,无法创造目前缺失的集体审议过程
- 未来几个月,Anthropic 将组织政策制定者、研究者、公民社会和其他 AI 公司的对话并公开成果。「共同探究这些问题的窗口就是现在,AI 公司之外的人应当参与这场审议。」
译后记:这篇文章最值得注意的不是那些惊人的数字,而是论证结构——它把「递归自我改进」从科幻概念拆成了一条可测量的渐近线:执行(已超人)→ 方法(已交付)→ 判断(51% → 64%)→ 选题(仍是人类)。每一级都有内部数据支撑,而最后一级的归属,决定了我们在三种未来中的哪一种。