当 AI 构建自身——Anthropic 谈递归自我改进

本文是对原文的编译转述,保留全部核心论点与数据,结构略有调整。原文更长,含图表与员工引语,推荐阅读。

核心论点

AI 发展史上,每个开发环节都由人类驱动。但 Anthropic 正把越来越多的 AI 开发工作委托给 AI 系统本身,这正在加速研发。这一趋势推到极致——给足算力——就指向一个能完全自主设计并开发自己后继者的 AI 系统,即「递归自我改进」(recursive self-improvement)。

目前尚未实现,也并非必然发生。但它到来的速度,可能快于大多数机构的准备程度。

一个标志性数据:如今 Anthropic 工程师平均每季度交付的代码量,是 2021-2025 年间的 8 倍

五个阶段

时期形态
2021–2023构建第一代 Claude:人类在笔记本上手写所有代码和文档
2023–2025聊天机器人:生成代码片段,人工复制粘贴进编辑器
2025–2026编码 Agent:自主编写、编辑代码,有时是整个文件
现在自主 Agent:自己运行代码,并把数小时的工作委派给其他 Agent
20XX?闭环:Agent 有能力自己构建和训练模型,未来的 Claude 由 Claude 持续改进

来自外部世界的证据

公开基准说明了能力,但说明不了 AI 对 AI 开发本身的加速作用。这需要来自 AI 公司内部的直接证据。

来自 Anthropic 内部的证据

构建前沿模型有两类工作:工程(写代码、搭基础设施、盯训练)和研究(决定跑什么实验、解读结果、判断下一步试什么)。

两边的图景一致:工程上,Claude 已能接手「目标明确但方法未定」的问题——人类给目标,不再需要给方法;研究上,Claude 执行明确定义的实验已能匹敌或超越熟练人类。但在自主选择目标的判断力上仍有较大差距——这正是当前 AI 与「能自主设计后继者的系统」之间的鸿沟。

代码:从个位数到 80%+

「我大概一年前开始全力 Claude 化。这是段疯狂的旅程——到现在我已经约 5 个月没亲手写过任何代码了。」——Anthropic 员工

质量:从逊于人类到即将反超

「好代码」有两层含义:能跑,且别的工程师能看懂、能在其上继续构建。

研究:执行已超人,判断在追赶

「现在的格局大致是:人类出想法,模型能以快一个数量级的速度去实现、测试和评估它们。」——Anthropic 员工

人类的角色在收窄

人机代码质量达到平价后,人类将停止写代码、只做审查——但若审查速度跟不上生成速度,人类审查会成为 AI 开发的瓶颈。同样,当 Claude 能跑实验后,问题变成「哪些实验值得跑」。简言之:「做」(写代码、跑实验、出结果)的人类时间成本已趋近于零,即使算力成本仍在。

目前人类的比较优势是研究品味与判断:选哪些问题、信哪些结果、何时止损。

文中也收录了更私人的声音:

「工作(和生活)曾经运行在人与人之间小恩小惠的礼物经济上。『能帮我把这个脚本跑起来吗?』每一次都产生一点亏欠、一点相互的在意。Claude 更快、零亏欠——但每一次也都是一次失去的人类协作邀约。」

「一切顺利的日子里,我忍不住想:我做的什么都不重要了,一切都自动化了,比我更好更快。但也有一切都崩了我又看不懂为什么的日子——那时我意识到,我已经不知道自己最近都在干什么了。」

如果我们错了呢?

自然的反驳是:留在人类手里的「选题判断」才是最重要的,没有它 Claude 只是能干的助手,不是能独立驱动 AI 进步的系统。

作者的回应:AI 很少靠「灵光一现」推进。Transformer、MoE 这类范式突破多年才出现一次;其间大部分进展是增量循环——放大规模、看哪里坏了、修、再试。这恰恰是 Claude 现在擅长的工作流。爱迪生说天才是 1% 灵感加 99% 汗水,而汗水正在被自动化。

即便 Claude 永远学不会研究品味,保守解读也意味着复合加速:人类把时间花在占比个位数的方向把控上,每个人撬动的工作量远超从前。激进解读则是:「研究品味」可能只是又一个 AI 暂时不会、之后会学会的能力——解释笑话为什么好笑、心智理论、语言谜题,都走过同样的轨迹。

三种可能的未来

一、趋势停滞,但现有能力广泛扩散。 指数曲线可能其实是 S 曲线;瓶颈也可能在供应链——芯片产能、电网、互连带宽——而非智能本身。但即便能力冻结在今天,世界也会巨变:Project Glasswing 头几周内,Mythos Preview 就在全球最关键的系统中发现了一万多个高危/严重漏洞——多到网络防御的瓶颈已从「找漏洞」变成「修补速度」。作者认为这是三者中最不可能的情景——所有能测量的能力曲线至今没有弯——但它留给政府和社会的适应时间最多。

二、AI 实验室持续获得复合效率增益。 开发大幅自动化,人类仍设方向、judge 结果。100 人公司能做一万乃至十万人组织的工作;这会革新知识工作和政府服务,也可能被用于恶——全民监控、对每个个体定制的操纵性影响行动。作者认为目前的证据指向这个情景。 但阿姆达尔定律(Amdahl’s law)会起作用:加速一部分往往只是把瓶颈转移到别处——Anthropic 已经遇到人工代码审查成为新瓶颈,以及「想法、工具、原型多到远超有能力跟进的程度」。组织发现并修复自身瓶颈的速度,可能成为最重要的组织能力。

三、AI 实现完全递归自我改进,开始构建自己的后继者。 进展速度完全由算力供给(或算法效率发现的速度)决定,人类大幅转向监督、验证一个不断扩张的「虚拟实验室」。对齐问题如何解决最不确定:模型可能足够对齐、自己找到我们尚未触及的新解法,甚至足够智慧在不行时主动停下;也可能让今天罕见的失对齐在自我迭代中复合放大——更频繁、更难懂,直到失控。但阿姆达尔定律同样适用于世界本身:再多的智能也无法提前知道一款药几十年后的效果,不能比宪法规定更早举行选举,也不能在一个周末把陌生人变成老友。对大多数人而言,这个未来的体感节奏仍由瓶颈决定——即使上游实验室以算力的速度狂奔。

该做什么?


译后记:这篇文章最值得注意的不是那些惊人的数字,而是论证结构——它把「递归自我改进」从科幻概念拆成了一条可测量的渐近线:执行(已超人)→ 方法(已交付)→ 判断(51% → 64%)→ 选题(仍是人类)。每一级都有内部数据支撑,而最后一级的归属,决定了我们在三种未来中的哪一种。

本译文采用 CC BY-NC-SA 4.0 协议发布,仅供学习交流。

原作品版权归 Marina Favaro & Jack Clark(The Anthropic Institute)所有,原文请见 这里