執行變便宜了——真正的工作是 Evals

8 分鐘閱讀作者:

Claude 現在是我的指揮中心。Gmail、Slack、研究、Jira 開票——全部收攏到一個地方,而不是五個分頁加上在它們之間切換的成本。速度提升是真的,但老實說,那是這場改變裡最不有趣的部分。

我一直繞回同一個問題:如果我過去擅長的是執行,而執行現在幾乎免費了,那我的工作到底是什麼?

這篇文章就是我把這件事攤開來想。有些部分我很確定,有些部分我覺得自己大概是錯的——那些地方我都標出來了。

TL;DR

  • 把一整個工作日接進同一個助理,並不是讓我「變快」而已——它改變了工作的形狀。瓶頸換了位置。
  • 當 AI 吸走執行,人的工作就往上移一層:從做那件事,變成決定什麼值得做,以及判斷它成不成
  • 所以真正的技能是 evals。執行 → 檢視 → 學習 → 執行。這其實就是精實創業(Lean Startup),只是時鐘拉快了很多倍。
  • 關於「什麼還會留給人類」,我有四個候選答案——學習速度、情緒、自我認識、平行代理——但我真正信得過的只有一個半。

如果不小心,我會把這段講得太滿

我的直覺是,某些任務上的產出提升大概在一百倍到一千倍之間。我想誠實說明:這是感覺,不是量測。我沒有真的儀表化自己的工作日,任何丟出這種數字的人(包括我)都該被懷疑一下。

方向性的主張我願意辯護:提升最誇張的那些任務,正是過去需要我人工把脈絡搬過五個工具的任務。讀完那串討論、找到文件、摘要它、寫成票、通知相關的人。每一步都不難,難的是把它們縫在一起——那才是全部的成本。現在那個成本趨近於零,而趨近於零的成本不會讓你快 20%,它會直接刪掉一整類工作。

工作往上移一層

講具體的版本。我不會再親手刻一個網站了,也不會親手刻一個 Facebook clone。我會直接請它做,然後我會拿到一個能跑的東西。

也就是說,「我做不做得出來?」已經不再是一個有趣的問題。真正有趣的問題——那個一直都是真正困難的問題,只是過去被幾個月的實作藏起來了——是:

這東西憑什麼會贏?面對一個已經站穩的競爭對手、在一個比以前跑得更快的市場、而我手上還沒有通路?

程式碼變便宜,並不會讓這個問題也變便宜。甚至更難,因為所有人的開發成本跟我在同一時間一起降了。護城河從來就不是「會蓋」。

所以稀缺的技能從執行能力,換成了策略、判斷力與品味。這部分我覺得幾乎是明擺著的真的,同時也是最讓人不安的部分——因為那正好是沒人知道該怎麼有意識訓練的能力。

新的瓶頸是 evals

如果執行交給 AI,我的工作就是評估。這真的有用嗎?這真的好嗎?它為什麼失敗?我該改什麼?

這樣講出來,它是一個循環:執行 → 檢視 → 學習 → 執行。

而且是的——我想到一半才發現,我重新發明了 build–measure–learn。這就是精實創業。框架沒有變,變的是執行那一步的時鐘速度,於是量測學習成了全部的瓶頸。當一次開發要一個季度,草率的評估還撐得住——你有一個季度可以察覺。當一次開發只要一個下午,糟糕的判斷複利得比好的執行能救回來的速度更快。

實務上的結論:我該把練功的時間花在讓評估變強,而不是讓被評估的那件事變強。寫得出好的評分標準。在看到產出之前就知道「好」長什麼樣子。能說出它為什麼失敗,而不只是說它失敗了。

我認為不會被自動化的東西(以及我站不穩的地方)

這是我最沒把握的一段,所以我會先把論點講完,再自己攻擊它。

1. 在全新領域裡的學習速度。 我的主張是:面對完全陌生的領域,人類的泛化速度目前仍然比系統快。我的證據很薄,我自己也知道:我有在做機器人的朋友認為,這個領域距離成熟比外界喊的還遠得多——那是一個真實的訊號,說明智慧身體上有能力、能適應地學習並不是同一件事。

但注意這個結論其實很窄。「具身 AI 比大家想的更難」是我相信的主張;「人類的學習速度普遍勝過 AI」是大得多的主張,而那個機器人的例子撐不到那裡。我一直讓一個證據承擔它撐不起的重量。

還有一個我沒解決的張力。我認為 AI 累積的知識會遠遠超過任何一個人;我也認為人類學東西比較快。兩者可以同時成立——一個是存量,一個是速率——但我得決定這個區分到底是不是我的重點,因為照現在的講法,它讀起來像自相矛盾。

2. 情緒作為驅動力。 憤怒、好勝心、看著別人把你在乎的事做爛時那種特定的火——這些會生出動力。AI 沒有。

這是全文最弱的論點,我還是留著,因為我覺得裡面有什麼我還沒找到。「憤怒推著我們前進」是真的,但不能因此推論憤怒會產出比一個評估良好的流程更好的策略判斷。動力和判斷是兩個不同的變數,而我一直悄悄把它們當成同一個。

3. 知道自己為什麼存在。 這一點我會跟「有目標」明確切開。很多系統都有目標。我會稱為頂尖的那些人,身上有別的東西——他們對「我為什麼在這裡」有真正的答案,而且是被那個答案推著走,不是被別人設定的激勵推著走。我不知道怎麼檢驗這個主張,這對它想成為一個論點來說是個問題。它是一個信念。

4. 平行代理。 一個人同時指揮多個 AI 流程,在結構上跟任何單一個體做的事不一樣。不是更聰明,是位在更上層。這一點我願意辯護,不過我懷疑它目前的形式是暫時的:這是一種組織設計上的優勢,而組織設計上的優勢會被產品化。

老實給自己的清單打分:(4) 我守得住;(1) 對一半,而且被我過度論證了;(2) 和 (3) 是穿上論點外衣的信念。我寧願把這個評分寫出來,也不想假裝四個都成立。

那個不太舒服的實務版本

這一切底下還有一個沒那麼哲學的東西。

如果執行很便宜,你就必須具體且迅速地證明自己的價值。我心裡的數字是 30 到 60 天——在這個窗口內,你應該能坐下來,跟對方說明他們為什麼在付你錢。不是描述你的職責,而是拿出你做的那個判斷,以及它產生了什麼。

因為如果執行是便宜的那一半,而你又展示不出判斷或成果,那就沒有立足點了。這不是威脅,這只是那句話的意思。

我想這其實就是全部;上面關於機器人與意識的段落,一部分是真心的信念,一部分是我在替「人類為什麼還重要」建立論述——而那是我需要相信的東西,才知道自己的練功時間該投在哪裡。我覺得把這個動機講出來,比假裝我是中立地走到這個結論好。


如果你真的找到過讓評估變強的方法——評分標準、檢視習慣,任何讓你的判斷變得更銳利而不只是更快的東西——我很想聽。那是我現在最想練起來的能力,而我還沒有方法。

分享這篇文章XLinkedInThreads