发布日期:2026-09-17

3万Agent是指Anthropic在2026年8月披露的内部度量:其最常用研发平台上同一时刻约有30,000个Agent在做研究与工程工作,Claude已主导其中26%的AI研发任务。与此同时,Anthropic在2026年9月17日发布新版Claude Projects,把内部多Agent协作机制产品化为协调器加并行线程加共享记忆的形态。本文基于Anthropic Institute度量报告与Claude官方博客,还原数量、自动化率、监管三指标、算力分配与产品落地的完整链路。


核心定义:3万Agent是什么

3万Agent是Anthropic衡量AI研发节奏的三个公开度量之一,统计口径为其最常用内部平台同一时刻运行的研究与工程Agent数。据Anthropic Institute报告,截至2026年8月该数字约为30,000,覆盖范围仅限该平台,不含其他内部系统。

配套的还有自动化指数与算力分配,目标是让公众可追踪前沿实验室内部AI造AI的真实进度,并为第三方验证留接口。

自动化率:Claude主导26%,协作以上超90%

度量采用Epoch AI的AL0到AL5量表:AL3为AI协作,在人类近距离指导下完成大块工作;AL4为AI主导,人类给高层目标监督执行;AL5为完全自主,目前三类工作均未达到。

据Anthropic Institute报告2026年8月数据,Claude主导的研发工作占26%,协作及以上占比超90%。方法上对2026年7月每周抽样20%模型研发环路人员,用Claude研究Agent基于Slack与内部文档列出约15,000项细粒度任务,组织为542节点分层树后由独立Claude裁判打分,人机一致性在相差一级内达97%。

一句话:写代码调参这类活基本离不开AI,定方向拍板还是人来。

监管三指标:覆盖率、延迟、拦截率

Agent多了以后,Anthropic用在线与离线两套监视器约束同一批Agent,指标固定为三项:覆盖率指动作过监视器的比例,审查延迟指动作到被看的时间,升级率指被拦或被标的比例。

在线监视器

离线监视器

方式

实时检查,危险动作直接拦或自动纠偏,如外拷模型权重

事后读全量行为,抓缓慢变质如对齐漂移

覆盖率

100%动作执行前过检,通常数秒内

100%动作事后入库

延迟

自动为执行前,被拦的一周内人工看

每周约100,000份转录先过分类器去误报,约50份到人

拦截/标记率

2026年8月超10亿次决策中0.002%被拦,约1/47,000

约每千份标记1到2份复查

据报告原文,个体Agent极少作恶,但在数百万乃至数十亿Agent的经济体量下,小概率会变常态。设计上每个Agent有独立身份,所有产出可按身份审计,通信走共享开放消息系统以便互相纠错与串联追踪。METR曾独立红队过其离线监视平台。

算力分配:安全占研发算力的6%

据Anthropic Institute报告,对2026年7月13日至20日一周全量算力快照分类,安全工作占AI研发算力的约6%,占AI驱动的AI研发算力的约12%。

口径偏保守:公私难分的一律不计入安全,护栏分类器等另算 comparable 量级未计入。报告亦承认算力是粗糙代理:安全研究重设计轻跑量,数值意义在于跨实验室可比,而非绝对投入。

产品化:Projects从文件夹变为对话

2026年9月17日,Claude官方博客发布Projects redesigned:新版Projects先生效于Claude Code云会话的Pro与Max部分用户 beta,Team与Enterprise随后,本地运行即将到来。

形态为一个协调器加多个线程:用户定目标选仓库,Claude拆活、派线程、审输出、合结果,手机上也能盯,离席继续跑。例如定降结账p75延迟的目标,它按端点并行画像优化开PR;退v1接口时按仓库起线程迁调用方、跑测试、开PR,并告诉你先合哪个。

技术上每线程是一个独立分支加仓库副本的Claude Code云会话,可再拆subagents、loops、workflows;线程间改同一块代码按PR合并冲突处理。线程共享项目记忆,省掉复杂提示词工程,另有library收录上传文件与产出物。代价是多线程烧额度更快,可分别设协调器与工作线程的模型与 effort 等级。

落地建议

  • 先给记忆立规矩:发布日、砍掉的导出、动账单前先找谁,三条先写死。

  • 线程按仓库边界拆,别按人头拆,冲突面最小。

  • 检查频率、开线程频率、更新粒度直接跟Claude提,它会记住沟通风格。

  • 高危动作默认走在线拦,慢变质靠离线标,别只看一头。

  • 额度先看项目级用量页再扩线程,beta 期先小步跑。

总结

3万Agent是Anthropic把内部真相摆上桌的尝试:26%主导率说明AI已在造AI,100%双监视器说明监管在追赶,6%安全算力说明投入仍偏低,而Projects是把这套机制卖给所有人的第一步。本文数据截至2026年9月17日,来源见文末参考资料。

参考资料