京ICP備2022018928號-30 投訴舉報:315 541 185@qq.com
當地時間9月17日,Anthropic發文,首次以量化方式公開內部AI研發自動化進度。
文章披露,截至今年8月,Claude已主導公司內部26%的AI研發工作,而今年2月這一比例尚不足1%。公司內部Agent平臺任意時刻約有3萬個AI Agent運行,8月產生超10億次決策。這組數據被視為遞歸自我改進(RSI)從概念走向工程現實的關鍵信號。
(資料圖片)
Anthropic采用獨立AI研究機構Epoch AI提出的六級自動化框架,將AI參與工作劃分為AL0至AL5。AL0為完全無AI參與,AL3為AI協作,AL4為AI主導,AL5為完全自主。
截至8月,26%的AI研發工作達到AL4:人類只需給出高層目標,Claude即可完成端到端大部分工作,人類負責監督、檢查和最終決策。另有超過90%的研發工作至少達到AL3。
Anthropic舉了一個具體場景案例:夜間數據管道故障后,工程師只需把報告交給Claude并說“把它修好”,Claude便可自主查看日志、定位原因、編寫修復代碼、測試、處理新問題,最后重跑管道、對比結果并撰寫說明。但Anthropic明確強調,目前沒有任何被測量的AI研發工作達到AL5完全自主水平。
規模數據更為實際。截至8月,Anthropic內部從事研究和工程工作的約3萬個Agent,擁有獨立于底層模型升級的獨立身份標識,通過共享消息系統互相委派任務、交叉糾錯。
安全監控方面,所有Agent動作執行前均經在線監控檢查,8月超10億次決策中約0.002%被阻止;離線監控每周標記約10萬條對話記錄,經分類器過濾誤報和初步審查后,最高優先級的約50條升級至人工審查。
算力分配上,7月樣本周內約6%的AI研發算力投入安全研究;若僅統計AI驅動的研發,該比例升至約12%。
Anthropic也承認,AI協作與AI主導的邊界存在主觀性,跨實驗室比較需要統一方法和第三方驗證。
RSI是近期人工智能領域的熱門概念。昨日智譜創始人唐杰披露,GLM-5.3-Flash兩周內完成國產加速器全量部署,大部分工作由GLM-5.3驅動的Infra Agent完成。他判斷,雖然目前距離完全RSI尚遠,但“模型優化系統、系統服務模型”的循環已經開始運轉。
此外,OpenAI于9月初宣布達成自動化AI研究實習生里程碑,目標2028年3月前實現自動化AI研究員。但最薄弱環節仍是“決定做什么”,任務超過4小時即需人類頻繁介入。
Google DeepMind的進化式編碼智能體AlphaEvolve則從算法進化切入,其提出的電路方案已被集成進下一代TPU,Google前任首席科學家杰夫·迪恩(Jeff Dean)評價這是“TPU大腦幫助設計下一代TPU身體的最新案例”。
RSI熱度提升背后,是明確的行業趨勢。模型研發模式伴隨AI技術的提升,正在從人類主導、AI輔助,轉向AI參與自身迭代、人類監督的方向。谷歌DeepMind首席戰略官賈吉特·塞洪(Jasjeet Sekhon)此前表示,RSI正成為AI資本開支的核心投資邏輯,雖然當前的AI收入還不足以支撐正在投入的資本開支,但不下注RSI并不明智。
此次Anthropic的披露同樣劃出了清晰的邊界:沒有任何被測量的工作達到AL5,安全監控仍處于早期,跨實驗室比較尚無統一方法。RSI的最小閉環雖然已經出現,但“決定做什么”仍依賴人類,長期判斷與真實系統調試能力仍是短板。
Anthropic此次將這些數字透明化,一方面意在讓社會在人類尚握主導權的窗口期,參與決定AI自我迭代的節奏與方向;另一方面,這也為行業樹立了一個可參照的披露基準,給到其他競品廠商同樣的數據透明化壓力。
當Anthropic率先將研發自動化比例、Agent規模、算力投入占比與安全監控覆蓋率擺上臺面,透明度本身便構成一種無聲的競爭壓力,不跟進便可能被視為有意遮掩。這種“披露競賽”一旦形成,行業透明化的節奏將被實質性加快,公眾與監管機構也將獲得更多衡量AI發展速度的標尺。