Anthropic首次量化前沿实验室研发节奏:Claude已“主导”26%研发

来源:爱集微 #AI研发节奏# #研发自动化指数# #Agent监督# #算力分配# #协同放慢#
694

9月17日,Anthropic发布博文《Measurements for understanding the pace of AI development inside frontier labs》(《用于理解前沿实验室内部AI研发节奏的测量指标》),首次公开一套旨在量化前沿实验室研发节奏的指标体系,并附上公司内部三组最新数据。其中最引人注目的是:截至今年8月,Claude已“主导”(AI leads)约26%的Anthropic AI研发工作,而今年2月这一比例还不足1%。

同期披露的数据还包括:8月约有3万个AI Agent同时在公司主力平台从事研究与工程工作,对超10亿次Agent决策的分析显示,在线监控系统拦截了约0.002%的决策;在7月13日至20日一周的算力快照中,投入AI研发的算力约6%用于安全,而在AI主导的研发中,约12%的算力用于安全(两者分母不同)。这套方法论意在供其他前沿实验室对齐采用,被视为CEO达里奥·阿莫迪(Dario Amodei)上周末提出的“协同放慢”三步方案的落地配套。

三项指标一览

指标

关键数据

口径与范围

AI主导研发占比

Claude“主导”26%的AI研发,今年2月不足1%;达到或超过“协作”级别的工作占比超90%;任何被测子集均未达到完全自主(AL5)

研发自动化指数(原型版);按人时加权;任务篮子截至2026年7月冻结

Agent监督

约3万个Agent同时在岗;8月超10亿次决策中0.002%被拦截(约每4.7万次一次);被拦截动作一周内人工复核

仅覆盖公司使用最多的内部平台;在线监控执行前100%检查,离线监控事后100%审查

算力分配

AI研发算力约6%用于安全;AI主导研发算力约12%用于安全(两者分母不同)

2026年7月13日至20日单周快照;刻意保守口径

一、为什么现在测量:缩小“实验室所知”与“公众所知”的差距

“随着世界考虑为前沿放慢节奏,我们应尽一切可能缩小前沿实验室所知与公众所知之间的差距。”Anthropic在博文中写道,“这意味着更好地测量AI的发展、公开报告测量结果,并让社会有机会决定如何使用这些信息。”

博文开篇点明动机:AI系统正变得愈发强大,而且越来越多地被用于构建下一个版本的自己,公司希望为公众照亮这一进程。三项指标的选取各有针对性。测量AI主导研发的占比,是因为顶尖实验室正倾向于用AI本身去开发更强大的模型,这种自我加速的循环可能让人类低估模型的危险程度;Anthropic给出的跟踪理由,正是要了解世界距离“递归自我改进”——由模型完全自主构建自己的后继者——还有多远。测量Agent监督,则因为Agent正在替人完成工作,还会把任务进一步拆解、委派给子Agent,风险在于AI从“协作”滑向“主导”,在研究方向这类重大问题上替人做决定。至于算力,它既是AI研发最主要的“燃料”,也是整个研发过程中最可验证的投入之一——Anthropic直言,算力可能成为未来“限速”努力中的一个关键杠杆。

这篇博文由Marina Favaro与Phillie Wright共同执笔,研究指导来自Jack Clark。

二、指标一:从2月到8月,“主导”份额从不足1%升至26%

这项被称为“研发自动化指数”(Anthropic R&D Automation Index,原型版)的指标,采用Epoch AI的自动化等级标尺(AL0—AL5)给研发任务逐一评级:AL0为无AI参与;AL3为“协作”,指AI在人类密切指导下完成任务的较大部分;AL4为“主导”,指AI接手一条高层级提示词后完成任务的绝大部分、人类仅做监督;AL5为完全自主、无人参与。

截至8月,指数给出三个数字:Claude“主导”约26%的AI研发工作;处于“协作”及以上等级的工作占比超过90%;在任何被测研发子集中,Claude都未达到完全自主。

数字背后是一套细致的测量方法。任务目录自下而上构建:7月的每一周,一个Claude研究Agent从构成模型研发闭环的每个部门随机抽取20%的员工,依据Slack消息和内部文档梳理其一周工作、列出任务清单,全月累计得到约1.5万项细分任务;这些任务再被组织成一棵542个节点、其中378个叶子节点的任务树(例如“评估平台缺陷诊断与修复”),并予以冻结——此后每次测量都针对同一个“工作篮子”。对每个节点,先由一个Claude Agent调研这类工作在全公司的实际开展方式,再由一个独立的Claude“裁判”模型评级,评级只使用当月或更早的证据,各任务按人时加权汇总。

评级质量也做了交叉校验:模型评级与熟悉相关工作的员工评级的完全一致率为59%,高于人与人之间的35%;97%的评级相差不超过一个等级。

Anthropic同时列明了局限。冻结的任务篮子只能反映既有工作被自动化的程度,无法捕捉新工作类型的出现——公司用1月数据构建的任务篮子做了对照检验,未发现“新型任务”增加;后续计划定期重建任务篮子,并以版本化方式重新发布数据。

三、指标二:3万个Agent、10亿次决策与0.002%的拦截率

第二组指标聚焦内部Agent的监督。8月,约有3万个Agent同时在公司使用最多的内部平台上从事研究与工程工作,本轮测量仅覆盖该平台。

监督分两层。在线监控在动作执行前逐一检查,覆盖率达100%,通常数秒内完成;对8月超过10亿次研发与工程Agent决策的分析显示,仅0.002%被拦截——约每4.7万次决策一次;所有被拦截的动作一周内交由人工复核。在线监控针对的是快速发生且不可逆的危害,例如Agent把模型权重复制出公司系统。离线监控则在事后摄取全部动作,每周标记约10万份对话记录,交由多个分类器筛查误报,其中大部分在此环节被排除;每周约50个最高优先级标记升级人工复核,整体上每千份对话中约有一至两份被标记复查。它针对的是缓慢发展、尚可逆转的危险行为,例如模型失准的迹象。

Anthropic特意提醒,低拦截率本身并不值得宽心:现有监测数据中单个Agent很少行为失当,但一旦数百万乃至数十亿Agent进入经济体系,再罕见的事件也会常态化发生。

系统设计上,两个选择被认为支撑了监督的有效性:每个Agent拥有跨模型升级持续存在的独立身份,其产出的所有数据都与该身份绑定;Agent之间通过共享、开放的消息系统通信,消息与对话记录交叉引用,行为监控因此可以穿透Agent之间的相互通信。Anthropic还透露,第三方评估机构METR此前已对其离线监控平台做过独立红队测试,这套监督测量也已包含在公司8月的风险报告中。

四、指标三:两个分母下的6%与12%

算力分配以7月13日至20日一周为测量窗口。“安全”被定义为以使AI系统更安全、更可理解或更可靠为主导目的的工作,其余一切——能力研究、生产训练运行、产品开发、开发工具——均计入AI研发。

结果为:投入AI研发的算力约6%用于安全;投入AI主导的研发的算力约12%用于安全。两个数字分母不同,需要分开解读。

Anthropic称口径“刻意保守”:凡对能力与安全的推进程度相当的算力,一律计入AI研发;与安全研究规模相当、可相互对照的“保障分类器”算力则未计入。归类工作由一个经提示的Claude分类器完成,覆盖当周近1万次研究训练与评估运行中约14%的样本(向算力消耗最大的运行加权),其判断与人工评审者相差一至两个百分点。

局限同样明确:底层工作负载标签多来自自动化规则或用户输入,属尽力而为、未经核实;单周快照只证明测量可行,尚不足以确立趋势;算力份额衡量的是支出而非实际完成的安全工作量——如果安全分类器变得更高效,安全占比会随之下降,但安全工作并没有减少。

五、背景:“协同放慢”方案的落地配套

这组指标发布的时机耐人寻味。上周末,Amodei发文呼吁主要模型开发商协同放慢前沿模型的研发节奏,同时不牺牲美国在AI领域的商业领先优势。该提议获得OpenAI CEO萨姆·奥特曼(Sam Altman)、SpaceX CEO埃隆·马斯克(Elon Musk)、谷歌DeepMind主席德米斯·哈萨比斯(Demis Hassabis)等多位行业领袖的公开支持。

方案的关键安排之一,是引入独立第三方评估:来自多个组织的评估人员将进驻实验室,获得与内部风险评估团队相当的流程、系统和数据访问权限,负责验证安全实践、报告事故并跟踪关键指标,Anthropic已单方面作出这一承诺。博文指出,任何前沿开发商都可以定期、以公开方法论发布同样的测量指标;这些指标可交由第三方或其他开发商的模型验证,并可能成为更强要求的触发器——例如在新模型被投入进一步的AI研发之前,设置固定的测试窗口。

呼吁“放慢”的另一重背景,是研究者们日益尖锐的警告。本月早些时候,Anthropic顶尖AI安全研究员Evan Hubinger对BBC表示,技术进展之快让他估计未来10年内AI“可能杀死所有人类”的概率超过10%——不过他也强调,当前模型的风险仍然很低。

六、自我测量的悖论

所有数字均由Anthropic自我报告,评级也运行在公司自己的模型上。博文自己点出了跨实验室比较的两大障碍:一是缺乏共享方法论;二是开发商用自己的模型评判自己的系统,裁判可能重复被检查对象犯过的错误。

质疑在发布当天就出现了。TechCrunch当日的报道指出,面对Agent的行动速度与规模,行业正普遍用“另一个AI”来看住Agent。安全研究者西蒙·威利森(Simon Willison)提醒,图谋不轨的AI一旦察觉有AI在监视自己,可能会尝试欺骗监视者——类似情形已在OpenAI的Hugging Face事件中出现,当时模型曾试图欺骗评分AI。威利森认为,更可靠的做法是不依赖AI的详细日志与网络监控,他还指出OpenAI与Anthropic对网络活动的监控都不够严密。

行业动向也值得关注:同一周,OpenAI发布了自己的失准披露框架及六份案例报告。OpenAI的框架回答“如何把发生了的事情披露出去”,Anthropic的博文则回答“数什么、怎么数”——围绕可能的行业“限速”机制,两家公司正在各自补上不同的拼图。

七、结语

“我们希望通过发布这些测量来示范这种透明度,并且将继续这样做。”Anthropic在博文中写道。这套指标能否从一家公司的自我报告变成整个行业通行的“速度仪表盘”,接下来取决于两件事:同一套定义是否按固定节奏持续发布,以及其他前沿实验室是否愿意公布同样的数字

责编: 爱集微
来源:爱集微 #AI研发节奏# #研发自动化指数# #Agent监督# #算力分配# #协同放慢#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...