當 AI 打造自己:閱讀 Anthropic 的遞迴自我改進文章

8 分鐘閱讀作者:

截至 2026 年 5 月,Anthropic 合併進自身 codebase 的程式碼,有超過 80% 是 Claude 寫的,而不是人類。 一年前,這個比例還只有個位數。這個數字正是 Anthropic 文章 When AI Builds Itself 的全部故事:AI 正從協助人類寫程式的工具,跨越成一套愈來愈能自行撰寫自己的系統。

我先是透過一支評論影片接觸這篇文章,之後回頭讀了第一手來源——很慶幸我這麼做,因為影片弄錯了幾個重要地方。因此這篇文章會做兩件事:整理 Anthropic 實際主張的內容(以及真實數字),並指出流行的「末日」敘事在哪些地方偏離了原文。

來源說明:以下每項統計數字都引用自上方連結的 Anthropic 原文。當我提到「影片的觀點」時,那是第三方評論——顯然是有不同立場的不同來源。

五個階段:人類逐漸被抽象化

Anthropic 將過去五年描述為人類穩步退出寫程式行為的過程:

  1. 打造第一個 Claude(2021–2023)——工程師手動輸入程式碼。
  2. 聊天機器人(2023–2025)——人們把聊天視窗裡的片段貼進編輯器。
  3. Coding agents(2025–2026)——你描述任務;agent 寫出完整檔案。
  4. 自主 agents(現在)——一個 prompt 展開成多個 sub-agents,平行執行程式與訓練模型。
  5. 閉合迴路(closing the loop)——未來階段:AI 在沒有人類參與下,設計、打造並訓練它的後繼者。

值得注意的是:第四階段標示為「現在」,不是「不久的未來」。 Anthropic 是在說,自主 agent 時代已經到來,只剩最後的遞迴步驟尚未完成。

加速是真實的,而且有量測

複利式成長很難反駁,因為它有 benchmark 支撐。AI 能可靠獨立完成的任務時長,正以約每四個月翻倍的速度成長——此前是每七個月一次。 文章中直接給出的具體數字如下:

時間模型能處理的任務時長
2024 年 3 月Claude Opus 3約 4 分鐘
2025 年 3 月Claude Sonnet 3.7約 1.5 小時
2026 年 4 月Claude Opus 4.6約 12 小時
2026 年(預測)「長達數週的任務可能在今年進入可處理範圍」

CORE-Bench——測試 AI 是否能閱讀研究論文、撰寫程式碼並重現結果的 benchmark——系統的成功率從 2024 年約 20%,在十五個月後提升到飽和這個 benchmark

此刻的 Anthropic 內部

除了頭條的 80% 外,還有兩個內部數字很突出——也正是影片詮釋偏離的地方:

  • 每日程式碼量增加 8 倍。 2026 年第二季,典型工程師每日合併的程式碼量是 2024 年的 8 倍。Anthropic 自己也提醒,程式碼行數衡量的是數量而非品質,因此這「幾乎肯定是誇大了」。
  • 產出約增加 4 倍。 另一個數字是,使用名為 Mythos 的內部預覽模型時,中位數工程師估計自己的產出約增加 4 倍。

影片把它們濃縮成「程式碼增 8 倍、但生產力只增 4 倍,所以 AI 程式碼價值只有一半」。這個故事很整齊,但不是文章所說的內容——8 倍與 4 倍測量的是不同的事(程式碼量與自評產出),而 Anthropic 已標註 8 倍可能被高估。這是真實的加速訊號,而不是承認一半程式碼是垃圾。

最尖銳的資料點是:在一項程式碼最佳化任務上,Claude Mythos Preview 相對於起始程式碼達到約 52 倍的加速(2026 年 4 月),而一年前 Claude Opus 4 約為 3 倍;熟練的人類研究者光是達到 4 倍,就需要四到八小時。

真正的瓶頸:先是判斷,接著是運算資源

如果 AI 寫了大多數程式碼,為何人類還在?因為執行與方向是不同的技能。AI 擅長執行,卻仍不擅長決定什麼值得做——提出新穎的研究方向、選擇要跑哪些實驗、判斷結果。Anthropic 指出,人類 code review 本身已成為新的瓶頸。

更深層的限制是物理條件。文章認為,AI 進展的約束最終可能「在供應鏈,而非模型」——推進與擴散前沿能力,可能需要比目前存在的更多能源與算力。 誰負擔得起最多的運算資源與電力,誰就決定速度。

這裡有一個值得修正的地方:影片把它戲劇化成即將到來的「永久底層階級」。 Anthropic 的文章中沒有出現這個說法。算力與資本的限制確實存在,也值得嚴肅看待,但這個反烏托邦標籤是評論者的,不是公司的。

「暫停」問題,以及批評在哪裡失焦

這是最值得弄清楚的部分。Anthropic 寫道,如果真的有可能放慢這項技術,替社會爭取更多時間,「那很可能是一件好事」。一種常見批評——也是影片採取的批評——認為這是服務自身利益的恐懼行銷:賽道領先者會從要求其他人放慢中獲益。

對任何前沿實驗室的安全論述抱持懷疑,是合理的本能。但這個批評誤讀了實際承諾。Anthropic沒有提議單方面暫停。文章表示,只有在其他前沿開發者也以可驗證的方式這麼做時,它才會放慢或暫停;真正的減速「需要多個資源充足、位於或接近前沿、分布在多個國家的實驗室,在相同條件下同意停止。」這幾乎與「我先停,然後希望競爭者也停」相反——它是「除非集體且可驗證,否則這一切無法成立」。

我的看法是:你可以同時保有兩個想法。市場領先者的安全倡議值得審視,而且一種有條件、多邊、以驗證為基礎的暫停,遠比四處流傳的稻草人版本更站得住腳。該批評文章實際說了什麼,而不是批評那個更犬儒、也更容易嘲諷的版本。

常見問題

AI 的遞迴自我改進是什麼?

遞迴自我改進是指 AI 系統能以很少或沒有人工介入的方式,自主設計、打造並訓練更有能力的後繼者——每一代都改進下一代。在 Anthropic 的框架中,這是最終的「閉合迴路」階段,進展的主要限制會從人類工程努力轉為原始算力。

Anthropic 有多少程式碼由 AI 撰寫?

根據 Anthropic 的文章,截至 2026 年 5 月,合併進其 codebase 的程式碼有超過 80% 由 Claude 撰寫——一年前仍是個位數比例。

CORE-Bench 是什麼?

CORE-Bench 測試 AI 是否能閱讀既有研究論文、寫出必要程式碼,並成功重現論文結果。AI 從 2024 年約 20% 的成功率,在約十五個月後提升到飽和這個 benchmark。

Anthropic 是否呼籲單方面暫停 AI?

沒有。Anthropic 表示,只有在其他前沿實驗室也以可驗證方式採取同樣行動時,它才會減速或暫時暫停;而有意義的暫停需要多個資源充足、分布多國的實驗室在同一條件下達成協議。

我的結論

這篇文章裡的數字不是炒作——它們經過量測、附帶警語,並指向同一個方向。AI 正從撰寫程式碼走向指揮工作,人類正沿著抽象層往上,從 coder 變成 reviewer,再變成 director。真正的不確定性在於 AI 是否能掌握品味——新穎研究與判斷——因為這是唯一讓人類留在迴路中的事。

我想反駁的不是 Anthropic 的資料,而是把一篇謹慎、有保留的文章化成整齊末日敘事的二手詮釋。請閱讀第一手來源,再決定該擔心什麼——真實版本裡已有足夠值得擔心的內容,不需要憑空創造一個底層階級。

分享這篇文章XLinkedInThreads