Karpathy 說「畫鵜鶘」不夠了 — LLM 評測從玩具任務走向自主任務

一句話總結: 你判斷 AI 強不強的方式,可能還停留在「叫它畫圖、寫詩、算數學」。Andrej Karpathy 說這已經不夠了 — 真正的測試是給 AI 一個長達 10 分鐘以上的自主任務,看它能不能自己完成。

一個白色的機器人正在筆記型電腦前工作,背景是藍色的科技介面,顯示著AI系統流程、數據圖表和一個「10分鐘連續運作」的計時器。此圖詳細闡述了Karpathy提出的AI評測新標準,即從簡單任務轉向需要10分鐘以上持續運作的自主任務來評估AI的能力。
Karpathy 提出 AI 評測新標準,強調大型語言模型 (LLM) 的評估不應停留在簡單的「畫圖、寫詩、算數學」等玩具任務,而應轉變為需要 10 分鐘以上連續運作的自主任務,以全面測試 AI 的決策、錯誤修正、記憶和自我規劃等綜合能力,這標誌著 AI 能力評測的重大質變。

你還在用什麼標準判斷 AI 強不強?

先問你一個問題:

你上次跟朋友討論「哪個 AI 比較強」的時候,是怎麼比的?

  • 「GPT 畫圖很強」
  • 「Claude 寫文章比較自然」
  • 「Gemini 算數學比較準」

如果你用這三個標準,你用的還是 2023 年的評測方式

不是說這些標準錯 — 而是 AI 已經進化到一個階段,這些測試再也測不出它的真實能力了。


Karpathy 的「鵜鶘測試」是什麼?為什麼他覺得不夠了?

Andrej Karpathy — OpenAI 共同創辦人、特斯拉前 AI 總監,2026 年 8 月初在 X 上丟了一句話,直接炸上 Hacker News:

「We’re starting to leave the territory where you’d test an LLM by e.g. ‘create an svg of pelican on a bicycle’.」

(我們開始離開「叫 AI 畫一隻騎腳踏車的鵜鶘」這種測試時代了。)

「畫一隻騎腳踏車的鵜鶘」是過去兩年 AI 社群最流行的評測梗 — 因為它同時考驗理解力、執行力、創意,而且容易判斷好壞。

Karpathy 的意思是:這種測試已經沒有鑑別度了。

現在的 AI 連這種任務都能輕鬆完成 — 就好像用「會算 99 乘法表」來測試一個大學教授,測不出任何東西。


從「畫隻鵜鶘」到「10 分鐘自主任務」:評測標準怎麼變的?

Karpathy 一直在推廣一個更嚴格的評測標準 — 他自己稱之為「10 分鐘規則」:

一個合格的 agent 任務,至少要讓 AI 連續運作 10 分鐘:
使用者輸入 → 程式呼叫 LLM → LLM 回應餵回系統 → 系統結果再餵回 LLM → 循環

為什麼是 10 分鐘?

因為短任務(畫圖、寫詩、單題數學)只需要 AI 的單次推理能力。但長任務需要的是:

能力短任務(畫圖/寫詩/問答)長任務(10 分鐘自主 agent)
單次推理✅ 測得到✅ 測得到
拆解任務能力❌ 測不到✅ 測得到
錯誤修正❌ 測不到✅ 測得到
記憶與上下文管理❌ 測不到✅ 測得到
長時間穩定性❌ 測不到✅ 測得到
工具使用❌ 測不到✅ 測得到

這就是質變:AI 從「回答問題的機器」變成「自主行動的 agent」。


魔戒測試:給 AI $10 和 100 萬 token,它會做什麼?

Karpathy 不只說,他真的做了實驗。

他丟給 Claude Opus 5 一個任務:

給你《魔戒》第一段 + 1M token 預算(約 $10 成本),你想做什麼就做什麼。

不是「請你總結這篇文章」,也不是「請你翻譯」— 而是完全開放:「你想做什麼就做什麼」。

這個實驗的意義在於:測驗 AI 的自主性(agency) — 當沒有明確指令時,AI 會不會自己規劃任務、拆解步驟、執行並迭代?

這跟我們熟悉的「下指令 → 拿結果」完全不同。這是在測試 AI 會不會自己「想要」做事情。


這個改變對你代表什麼?(實用收尾)

你可能覺得這是學術圈的事,跟你無關。其實關係很大:

1. 別再被「AI 評測分數」騙了

廠商公布的 benchmark 分數(比如某某測試 98 分)大部分還是短任務。真正能反映 AI 實力的,是它能不能完成你的長任務。

2. 你的工作方式該升級了

如果你還在用 AI「問一句答一句」,你用的是 AI 的 10% 能力。真正該做的是:

  • 把整個流程丟給 AI(「從這份資料寫出文章 → 排版 → 配圖 → 發布」)
  • 讓 AI 自己拆解步驟,不要你一步步指揮

3. 用「10 分鐘規則」判斷你的 AI 工具

下次要判斷一個 AI 工具好不好用,別再問「它畫圖強不強」,改問:

  • 它能連續工作 10 分鐘以上不崩潰嗎?
  • 它能自己拆解任務嗎?
  • 出錯的時候它會自己修正嗎?
  • 它記得前面做過什麼嗎?

你自己怎麼測一個 AI 工具好不好用?

給你一套可執行的測試流程(我自己就在用):

測試 1:長任務測試
  給它一個需要 5+ 步驟的任務(例如「幫我規劃一篇部落格文:
  選題 → 大綱 → 內文 → 配圖建議 → SEO 設定」),
  看它能不能自己走完,還是每步都要你指揮。

測試 2:錯誤修正測試
  故意給它錯誤的資訊,看它會不會發現並修正。
  不會質疑你的 AI = 只會討好你的 AI。

測試 3:記憶測試
  在任務中段問它「我們剛剛做了什麼?」
  答不出來 = 上下文管理差,長任務會壞掉。

測試 4:自主性測試
  給它「你想做什麼就做什麼」的開放任務,
  看它會不會自己規劃。只會反問你「你想做什麼」= 還不夠。

這四招測完,你對手上工具的判斷會比任何 benchmark 都準。

1
長任務測試
給它 5+ 步驟任務,看能不能自己走完,還是每步都要你指揮
「幫我規劃一篇部落格:選題→大綱→內文→配圖→SEO」
2
錯誤修正測試
故意給錯誤資訊,看它會不會發現並修正
不會質疑你的 AI = 只會討好你的 AI
3
記憶測試
任務中段問它「我們剛剛做了什麼?」
答不出來 = 上下文管理差,長任務會壞掉
4
自主性測試
開放任務,看它會不會自己規劃
只會反問你「你想做什麼」= 還不夠

延伸閱讀


常見問題 FAQ

Karpathy 的「鵜鶘測試」是什麼?

Karpathy 用「畫一隻騎腳踏車的鵜鶘」來比喻過去流行的 LLM 評測方式 — 單次、創意、容易判斷的短任務。2026 年 8 月他表示這種測試已失去鑑別度,因為現在的 AI 都能輕鬆完成。

什麼是「10 分鐘規則」?

Karpathy 提出的 agent 評測標準:一個合格的 AI agent 任務至少要讓 AI 連續運作 10 分鐘以上(輸入 → 呼叫 LLM → 餵回系統 → 循環),才能測出拆解、修正、記憶等長任務能力。

短任務測試和長任務測試差在哪?

短任務只測單次推理(畫圖、寫詩、問答);長任務測的是自主能力 — 拆解任務、錯誤修正、上下文管理、工具使用、長時間穩定性。後者才是 AI agent 時代的真正能力指標。

一般使用者怎麼判斷 AI 強不強?

別再看 benchmark 分數。用四個自測:長任務測試(5+ 步驟任務)、錯誤修正測試(故意給錯資訊)、記憶測試(問它還記得什麼)、自主性測試(開放任務看它會不會自己規劃)。

為什麼評測標準改變很重要?

評測標準的改變代表 AI 能力質變 — 從「回答問題的機器」變成「自主行動的 agent」。對一般使用者來說,這代表工作方式該升級:從「問一句答一句」變成「把整個流程丟給 AI」。