1. 一句話總結

AI agent 終究會比人類更會使用工具,人類要做好「甲方」的角色,而好的甲方需要學會「驗收」跟「招標」。

2. 重點筆記

AI agent 跟 ChatGPT 的差別

他先定義了這場的核心詞彙:ChatGPT 是你跟它說話、它就回話;AI agent 則是你跟它說話、它會去做某件事。要做到「做某件事」需要兩個要素:一是模型要夠聰明(他認為要到推理系列模型,像 ChatGPT 的 o1、o3 出現,才真正稱得上夠聰明),二是模型要會使用工具。他也提醒,雖然大家都說今年是 AI agent 元年,但現階段能用的 AI agent 其實還只會用少數幾種工具,其中最普及的是搜尋,也就是各家廠商陸續推出的深度研究(deep research)功能。

視覺推理示範:一張街景照片猜出正確地點

他現場示範 ChatGPT o3 的視覺推理能力:任意在地圖上拉出一張街景照片丟給模型,只問「這張照片在哪裡」。模型從畫面裡的線索——電線桿標示是台灣電力公司、植栽是觀賞用棕櫚、地形是新北宜蘭一帶才有的丘陵——推論出地點在烏來、坪林與石碇交界,答案完全正確。他特別展示模型的推理過程:模型會自己判斷畫面裡可能有文字,主動放大、轉成黑白以便辨識模糊的號碼。他強調這跟傳統事先定義好步驟的 workflow 不同,模型是自主決定要不要動用某個工具,而不是照著寫死的流程走。他也提到開場那個猜照片拍攝年代的小遊戲:自己把五張照片全部丟給 ChatGPT o3,得分落在所有玩家的前百分之二,遠高於他自己現場玩的分數。

驗收:AI agent 做得好不好,怎麼知道

他用一個消費分帳的例子帶出「驗收」的重要性:把一張記錄消費品項的截圖丟給 AI,請它轉成表格。第一次測試成功,他就以為這件事很簡單,後來才發現這個辨識任務的成功率其實只有大約五成。由此他歸納出三個問題:需要驗收幾次、能不能自動化測試、自己到底有沒有能力驗收。

他用貝氏定律說明「驗收幾次才夠」:如果一件事連續成功三次,第四次成功的機率大約是八成;連續成功十次,下一次成功機率大約九成;如果想要達到百分之九十九以上的信心,前面需要連續成功大約一百次。他的結論是,人類自己頂多驗收個三次就會不耐煩,很難真的驗證到那個量級。

他提出的解法是讓 AI 自己出題、自己解題、再由另一個 AI 檢查,形成一個閉環:先把少量樣本資料交給 AI,請它依樣仿造出更多筆測試資料,同時保留每一筆的正確答案;讓待測的 AI agent 去處理這些新造出來的截圖;最後再用一個 AI 去比對辨識結果跟正確答案是否吻合,藉此大量、自動地估計整體的準確率。

第三個他提到「有時候根本沒有標準答案」的情境,來自一次深度研究的實測:他請 AI 研究去日本該買哪些藥妝,得到一份列出高評價、高 CP 值、高銷量品項的清單。他自己一開始給這份答案打了很高的分數,但真正提出這個需求、對這個領域很熟的重度使用者,只給了六十分,理由包括:要買的東西應該偏貴而不是划算(因為出國就是要買國內買不到的);應該參考更新、更專業的資訊來源(他提到一本叫「LDK」的日本雜誌以毒舌著稱,會搶先報導品質好的產品),而不是單純看網路聲量最高的品項;用日文搜尋會比用中文搜尋更接近日本在地資訊;範圍也定得太大,藥妝這個題目其實應該先縮小到口紅這種更具體的品項。

招標:怎麼把任務發包給 AI agent

他把「怎麼下指令給 AI agent」整理成四個重點:

  • 重度使用者的超能力:如果你對某個領域夠熟,你看資料的角度會跟一般人、甚至跟 AI 都不一樣,這種觀點會被 AI agent 放大;同樣重要的是知道對的關鍵字(例如前面提到的「LDK」)、知道該用哪種語言搜尋、知道該把範圍縮多小。他也示範一個語言選擇的小技巧:搜尋東京拉麵時,如果用中文搜尋,結果多半是台灣部落客寫的內容;但如果指定「用日文搜尋、以中文呈現結果」,資料來源就會換成日本在地人的推薦。
  • 人機協作的現實與想像:他提醒,對人類來說很簡單的判斷(例如一眼看穿一張表格)對 AI 可能很難,反過來也一樣;理解這種落差,才能有順暢的人機協作。他舉了兩個「想像」的實例:一篇新聞稿裡把品牌名跟他自己的名字都寫錯了三個地方,他把整篇文章丟進深度研究,就能根據上下文校對出正確寫法;另一個是他寫遊記寫到一半,把記不清楚的細節留成括號加問號(例如某年是不是反聖嬰年、某地某週下了多少雪),事後把整篇文章連同問號丟給深度研究去查證補齊。
  • 把話說清楚:他建議善用三個技巧——先請 ChatGPT 幫忙把自己的指令重寫得更清楚;下指令時要求 AI 開始工作前先反問問題,釐清模糊地帶(他舉例,如果只說「幫我搜尋便宜的味噌」,AI 應該先反問「便宜」指的是總價最低還是平均單價最低);也可以先跟 AI 討論一輪需求,再請它根據討論內容重寫最終的指令。
  • 甲方的策略:包括同時把同一個任務發包給多個 AI agent、各做兩次再挑最好的答案(因為現在跑一次的成本已經很低);如果一件事情的良率始終偏低,乾脆不要讓 AI agent 做(他提到這個觀點來自開發者年會 Andrew〔吳剛志〕的分享);以及他自己歸納的「只等待、不教育」——如果 AI 現在做不好一件事,與其花大把時間去教會它,不如先擱著、等模型更新反而更有效率。他把這個講法類比為近年網路流傳的「成年人的世界,只篩選、不教育」這類說法,改寫成「AI 的世界,只等待、不教育」。

3. 關鍵數據與案例

項目內容
深度研究(deep research)供應商他點名的包括 Google、Grok、ChatGPT(o3 與另一套 deep research 模式)、Perplexity,以及當時預告即將推出的 Claude 與 Felo Search
貝氏定律信心對照連續成功三次,下次成功機率約八成;連續成功十次,約九成;連續成功一百次,約九成九(講者引用計算,未附完整公式來源)
OCR 轉表格任務準確率講者自述實測成功率約五成,屬講者自述,無外部來源佐證
猜照片年代小遊戲講者將五張照片交給 ChatGPT o3 作答,得分為所有玩家前百分之二(講者自述,無外部來源佐證)

4. 金句

  • 「AI agent 終究會比人類會用工具,人類要做好甲方,好的甲方需要驗收跟招標。」
  • 「你今天可以立刻用的 AI agent,還沒有那麼多,它就只會用幾個工具而已。」
  • 「AI 的世界,只等待,不教育。」

5. 提到的工具與名詞

ChatGPT o1、o3、ChatGPT deep research、Google 深度研究、Grok、Perplexity、Felo Search、貝氏定律、LDK(日本毒舌評比雜誌)、AmazingTalker、艾立運能(皆為新聞稿校對案例中的品牌/人名)。

6. 延伸觀察

這場最值得記下來的是「甲方」這個比喻,把一個抽象的 AI 能力問題,直接轉譯成大家都懂的商業關係:驗收難是因為信心需要大量重複驗證才能建立,招標難是因為你得先懂這個領域才知道怎麼開規格。這跟 Wisely Chen 前一場示範的「刻意留錯給 AI agent 看它會不會自己修正」其實是同一套邏輯的兩面——一個在講怎麼考核 AI,一個在講怎麼給 AI 犯錯的空間。查證後可以確認他那句結論確實被媒體引用,而且標題幾乎就是逐字照抄他的原話,算是這幾場裡少數「當場金句,事後真的變成新聞標題」的例子。

7. 資料來源

項目來源
「人類是甲方要會招標跟驗收」為公開報導引用之講者原話【生成式AI年會】策展人李慕約:人類是甲方要會「招標」跟「驗收」,商益
李慕約背景介紹(AI 教學社群、企業顧問經歷)【Generative AI 年會爐邊談】李慕約:全民 AI 時代已經來臨!,INSIDE
李慕約有限公司登記與業務資訊李慕約有限公司官網
年會官方公告文由李慕約本人以策展人身分撰寫2025 Generative AI 年會官方公告,慕約
「成年人的世界,只篩選、不教育」為近年網路流傳說法,並曾出版為書籍博客來《成年人的世界 只篩選 不教育 只選擇 不改變》
「昨天 Andrew 的演講」對應開發者年會吳剛志場次(英文名 Andrew Wu)議程總覽.md
講者職稱、講題逐字、上台順序議程總覽.md