Karpathy 說「畫鵜鶘」不夠了 — LLM 評測從玩具任務走向自主任務
一句話總結: 你判斷 AI 強不強的方式,可能還停留在「叫它畫圖、寫詩、算數學」。Andrej Karpathy 說這已經不夠了 — 真正的測試是給 AI 一個長達 10 分鐘以上的自主任務,看它能不能自己完成。

你還在用什麼標準判斷 AI 強不強?
先問你一個問題:
你上次跟朋友討論「哪個 AI 比較強」的時候,是怎麼比的?
- 「GPT 畫圖很強」
- 「Claude 寫文章比較自然」
- 「Gemini 算數學比較準」
如果你用這三個標準,你用的還是 2023 年的評測方式。
不是說這些標準錯 — 而是 AI 已經進化到一個階段,這些測試再也測不出它的真實能力了。
Karpathy 的「鵜鶘測試」是什麼?為什麼他覺得不夠了?
Andrej Karpathy — OpenAI 共同創辦人、特斯拉前 AI 總監,2026 年 8 月初在 X 上丟了一句話,直接炸上 Hacker News:
「We’re starting to leave the territory where you’d test an LLM by e.g. ‘create an svg of pelican on a bicycle’.」
(我們開始離開「叫 AI 畫一隻騎腳踏車的鵜鶘」這種測試時代了。)
「畫一隻騎腳踏車的鵜鶘」是過去兩年 AI 社群最流行的評測梗 — 因為它同時考驗理解力、執行力、創意,而且容易判斷好壞。
Karpathy 的意思是:這種測試已經沒有鑑別度了。
現在的 AI 連這種任務都能輕鬆完成 — 就好像用「會算 99 乘法表」來測試一個大學教授,測不出任何東西。
從「畫隻鵜鶘」到「10 分鐘自主任務」:評測標準怎麼變的?
Karpathy 一直在推廣一個更嚴格的評測標準 — 他自己稱之為「10 分鐘規則」:
一個合格的 agent 任務,至少要讓 AI 連續運作 10 分鐘:
使用者輸入 → 程式呼叫 LLM → LLM 回應餵回系統 → 系統結果再餵回 LLM → 循環
為什麼是 10 分鐘?
因為短任務(畫圖、寫詩、單題數學)只需要 AI 的單次推理能力。但長任務需要的是:
這就是質變:AI 從「回答問題的機器」變成「自主行動的 agent」。
魔戒測試:給 AI $10 和 100 萬 token,它會做什麼?
Karpathy 不只說,他真的做了實驗。
他丟給 Claude Opus 5 一個任務:
給你《魔戒》第一段 + 1M token 預算(約 $10 成本),你想做什麼就做什麼。
不是「請你總結這篇文章」,也不是「請你翻譯」— 而是完全開放:「你想做什麼就做什麼」。
這個實驗的意義在於:測驗 AI 的自主性(agency) — 當沒有明確指令時,AI 會不會自己規劃任務、拆解步驟、執行並迭代?
這跟我們熟悉的「下指令 → 拿結果」完全不同。這是在測試 AI 會不會自己「想要」做事情。
這個改變對你代表什麼?(實用收尾)
你可能覺得這是學術圈的事,跟你無關。其實關係很大:
1. 別再被「AI 評測分數」騙了
廠商公布的 benchmark 分數(比如某某測試 98 分)大部分還是短任務。真正能反映 AI 實力的,是它能不能完成你的長任務。
2. 你的工作方式該升級了
如果你還在用 AI「問一句答一句」,你用的是 AI 的 10% 能力。真正該做的是:
- 把整個流程丟給 AI(「從這份資料寫出文章 → 排版 → 配圖 → 發布」)
- 讓 AI 自己拆解步驟,不要你一步步指揮
3. 用「10 分鐘規則」判斷你的 AI 工具
下次要判斷一個 AI 工具好不好用,別再問「它畫圖強不強」,改問:
- 它能連續工作 10 分鐘以上不崩潰嗎?
- 它能自己拆解任務嗎?
- 出錯的時候它會自己修正嗎?
- 它記得前面做過什麼嗎?
你自己怎麼測一個 AI 工具好不好用?
給你一套可執行的測試流程(我自己就在用):
測試 1:長任務測試
給它一個需要 5+ 步驟的任務(例如「幫我規劃一篇部落格文:
選題 → 大綱 → 內文 → 配圖建議 → SEO 設定」),
看它能不能自己走完,還是每步都要你指揮。
測試 2:錯誤修正測試
故意給它錯誤的資訊,看它會不會發現並修正。
不會質疑你的 AI = 只會討好你的 AI。
測試 3:記憶測試
在任務中段問它「我們剛剛做了什麼?」
答不出來 = 上下文管理差,長任務會壞掉。
測試 4:自主性測試
給它「你想做什麼就做什麼」的開放任務,
看它會不會自己規劃。只會反問你「你想做什麼」= 還不夠。
這四招測完,你對手上工具的判斷會比任何 benchmark 都準。
延伸閱讀
- AI 工具分工實戰手冊:Perplexity+Claude+NotebookLM 一條龍工作流
- GPT-5.6 Sol/Terra/Luna 完整解讀:三版本差在哪?你該用哪個
- 你的 API Key 被拿去賺錢了嗎?LLM Token 轉售黑市完整解析
常見問題 FAQ
Karpathy 的「鵜鶘測試」是什麼?
什麼是「10 分鐘規則」?
短任務測試和長任務測試差在哪?
一般使用者怎麼判斷 AI 強不強?
為什麼評測標準改變很重要?
5 個省錢策略,從月費 NT$2,200 → NT$660 👇
🔒 填寫即訂閱雙週報,可隨時退訂。下載連結將寄到你的信箱。