1. 同一個案子,兩天兩種講法

這次最有意思的巧合,是 91APP 派了三位講者橫跨兩天,其中兩位講的其實是同一個專案:把商品上架時要填的規格欄位交給 AI 自動填。

李昆謀在年會用產品長的視角講這件事,落點在「人腦、規則引擎、AI 代理三方怎麼分工」;吳剛志在開發者年會用首席架構師的視角講同一件事,落點在「怎麼帶團隊跑幾十輪改善循環把數字拉上來」。

兩邊給的基準數字不一樣:

階段李昆謀的說法吳剛志的說法
第一版正確率 45%、覆蓋率 98%正確率 52.3%、覆蓋率 87%
加規則後正確率 90%、覆蓋率 50%正確率 90% 以上、覆蓋率 50%
分工比例規則引擎 40、AI 代理 50、人工 10AI 與人各半

兩份簡報的呈現方式不太一樣:李昆謀那組全部是五的倍數、畫在一張總量一百的長條圖裡;吳剛志那組帶到小數點,看起來像評估程式跑出來的原始值。一種可能是同一批資料的兩種呈現層級,年會主場對非技術聽眾取整數說故事,開發者場對工程聽眾給精確值(本表推測,無外部來源)。 但這只是推測,不能當結論。

兩人的最終狀態是一致的,起點數字不一致。可能是取樣批次不同,也可能是兩人講的是不同輪次的評估。公開資料無法判斷哪一組才是那個專案的官方數字,所以兩組並列,不做裁決。真正該記住的是兩邊都同意的那條原則:覆蓋率可以犧牲,正確率不能。寧可讓 AI 少答一半,也不要讓它每題都答但只對七成。

2. 企業導入卡在哪裡

四家企業案例(玉山銀行、91APP、簡訊設計、薩泰爾娛樂)加上物流業與印刷業的案例,講的困難點高度重疊,而且幾乎沒有一個是技術問題。

第一次導入失敗是常態。林鉦育直接把玉山銀行第一次導入 AI 編碼工具的失敗攤開來講,結論是「工具買了但沒有改變」才是常態,關鍵變因是量測機制與流程改造。黃仕鎮同樣先講難看的起手式:行內對話平台上線初期,開放對象裡只有 17.8% 的人用過,每天實際使用的只有 2.1%,用過的人裡有 58.8% 沒有再回來。

主管不動,底下就不會動。林鉦育把這件事講得最白,張志祺則從另一頭進來:他發現真正卡住的是心理門檻不是技術門檻,所以團隊乾脆放下技術,改從體驗設計切入,把 AI 藏進大家原本就在用的介面裡(Slack 的表情符號、Google 試算表的擴充功能),讓人不需要「決定要開始用 AI」。

沒有現成系統就自己長一套語言。鄭晴元面對的是一間四十人的娛樂公司,市面上根本沒有針對這個產業的管理系統。他的做法是先盤點「人跟機器」「機器跟機器」之間的資訊節點,再用領域驅動設計與 Mermaid 流程圖把口述經驗變成可以持續討論、也可以交給 AI 讀的結構。

法遵不是藉口,是設計條件。玉山銀行兩場都反覆回到同一句話:客戶資料不能外流,所以每一個特定用途的應用都選擇自建,不用現成的整合型服務。這跟新創圈「能用 SaaS 就不要重造輪子」的預設完全相反。

3. 正確率與覆蓋率

如果要選一組這屆最重要的名詞,就是這兩個。它們在三場裡各自被獨立提出來:

  • 吳剛志把它定義成可操作的指標:覆蓋率是 AI 有回答的比例,正確率是有回答之中答對的比例。
  • 李昆謀把它變成組織分工的依據:AI 只做它有把握的部分,剩下的還給規則引擎跟人。
  • 林彥廷則從研究端談同一件事的另一面:你怎麼設計評測標準,決定了所有人往哪座山爬。

三個人站在完全不同的位置,講的是同一個問題:在一個天生不確定的系統上,你要怎麼定義「夠好」。吳剛志的補充最實際——內部自己用的提示詞跑一百次可以逐筆檢查,產品化之後跑一百萬次不可能逐筆檢查,這個量級差異本身就決定了你必須先有評估機制。

4. 代理人被拿來做什麼

講代理人的場次不少,但真正拿出實際用途的,幾乎都是很不性感的雜事。

講者代理人實際在做什麼
Wisely Chen每天定期下載檔案、合併、做合理性分析,取代人工對帳。開發一到兩小時,對帳頻率從一天一次變成每小時一次
保哥從一張表單接進工作項目系統,自動開分支、寫程式、開 PR,人類只做需求釐清與最後審查
Vivi Chen內部發文、廣告素材檢核、問卷處理,每件從半小時以上壓到一分鐘
Peggy Lo查帳、填表、行政客服,拆成三十多個小幫手
李慕約深度研究、把截圖轉成表格(他自述成功率只有五成,所以特別強調要學會驗收)

李慕約那句「AI agent 終究會比人類會用工具,人類要做好甲方,好的甲方需要驗收跟招標」,其實正好可以當這一整組案例的總結。保哥的做法就是很典型的「招標」:表單刻意標高每次執行的成本,逼提需求的人把需求寫清楚。

5. MCP 在這一年的位置

張文鈿那場是這兩天技術密度最高的一場,也是唯一一場把一個規格從頭到尾講完的。他很誠實地指出當時遠端部署與身分驗證這兩塊都還很不成熟,甚至細到某個除錯工具的哪一版有 bug、要降版才能跑。

有趣的是這個題目在兩天裡的擴散速度:保哥在下半場一開口就說「自從看到 ihower 講 MCP 我就把題目改了」;黃仕鎮在隔天的企業案例裡,把 MCP 列進玉山銀行下一步的代理整合規劃。一個五月才剛在社群裡熱起來的協定,同一場活動裡就同時出現了規格講解、工程實作與銀行的中期規劃。

6. 不寫程式的人怎麼開始

年會刻意排了一整個系列給非工程師,三位講者的路徑幾乎一樣:先做出一個能動的小東西,再滾雪球。

  • Vivi Chen 從兩小時做出一支 LINE 問答機器人開始,一年後能生出有儀表板的專案管理系統。
  • Peggy Lo 用女兒起床前的清晨時間,半年間大約每一到兩週生一個小幫手。她的觀察最尖銳:AI coding 對組織裡雜務最多的底層工作者反而是翻身工具,因為主管沒有應用場景,所以學不會。
  • 海馬則是把六個月的學習曲線壓成一個月,只用四個免費版模型。

三個人都提到同一件事:卡住他們的從來不是「不會寫程式」,是不知道怎麼問、不知道怎麼判斷 AI 給的東西對不對。Peggy Lo 說她現在九成時間花在討論與寫文件,只有一成在除錯,剛好跟一開始相反。

7. AI 影像的一體兩面

年會刻意把 AI 影像放在最後三場,而且順序本身就是一個安排:先講怎麼騙人,再講怎麼創作。

李怡志的講題是「如何生成有效的圖騙」,整場其實在教你辨識。他的核心論點是:圖做得像不像根本不是重點,重點是它有沒有踩中你的立場、情緒、知識落差,以及你對轉發者的信任。

陳志信Davis Chang接著談創作。陳志信主張真正決定影片好不好看的是產圖之前的構圖設計,不是模型;Davis 則認為生成式 AI 改變的不是畫面品質,而是「誰能開始創作」——製作團隊從上百人壓縮到幾個人,接下來稀缺的是美感判斷力而不是工具操作能力。

同一天、同一個廳,一邊示範怎麼讓假圖更有效,一邊示範怎麼讓創作門檻更低,用的是同一批模型。這個對照本身就是這屆最強的一個安排。

8. 觀點交鋒

這幾組立場是真的互相衝突,此處不寫成共識。

模型該收斂還是該蒸餾。紀懷新整場的主軸是 convergence:把原本各自為政的功能全部收進同一個大模型,連機器人控制都強調是 one model 而不是多個模型。吳柏翰整場的主軸則相反:把巨型通用模型的知識蒸餾進企業負擔得起的小模型,讓它可以地端跑。兩人講的都是產業現實,只是一個站在超大規模平台方,一個站在企業客戶方。

等模型變強,還是現在就用工程手段補。李慕約的第三個策略直接叫「躺平」——如果一件事現在做起來有點勉強,與其花力氣教模型,不如再等一季。吳剛志跟李昆謀的做法完全相反:用規則引擎、結構化輸出、幾十輪改善循環,硬把正確率從五成推到九成。兩邊都對,差別在你有沒有一個現在就得上線的產品。

AI 導入該由上而下還是由下而上。林鉦育與張志祺都認為關鍵在主管與組織設計;Peggy Lo 的觀察正好倒過來,她認為最有動機也最學得會的是底層。

評測要不要看公開排行榜。林彥廷花了不少篇幅講公開評測的失真,包括模型會為了迎合使用者而犧牲正確性;吳剛志則乾脆放棄公開指標,自己定義正確率與覆蓋率。前者是研究者的問題意識,後者是產品端的解法。

要不要學技術。Davis Chang 收尾說得很直接:就算用 AI 寫出來的東西有錯,你還是得找工程師,因為只有他有經驗告訴你東西的好壞,所以不要停止學習。這跟同一天前面幾場「不會寫程式也沒關係」的樂觀語氣是有張力的。

9. 量化成效總表

把兩天出現過的成效數字集中在這裡。多數是講者自述,有外部佐證的另外標明。

講者指標數字佐證狀態
林鉦育重複程式碼密度下降超過 50%講者自述,無外部來源佐證
林鉦育技術債估計工時下降超過 40%講者自述,無外部來源佐證
林鉦育開發生產力明顯改善的比例95%講者自述,無外部來源佐證
黃仕鎮平台上線初期使用過的人數比例17.8%講者自述,無外部來源佐證
黃仕鎮改版後月使用人數成長200%講者自述,無外部來源佐證
黃仕鎮改版後實際使用量成長六倍講者自述,無外部來源佐證
黃仕鎮固定格式辨識率99.9% 以上講者自述,無外部來源佐證
陳俊毅端到端交付效率提升至少 30%講者自述,無外部來源佐證
陳俊毅系統異常數量與去年同期持平講者自述,無外部來源佐證
吳剛志正確率52.3% 提升到 90% 以上講者自述,無外部來源佐證
吳剛志工程師跑分驗證時間四小時壓到十分鐘講者自述,無外部來源佐證
李昆謀人工填寫欄位耗時約五個工作天講者自述換算,無外部來源佐證
保哥完全正確可直接合併的 PR 比例超過五成講者自述,無外部來源佐證
保哥單一工單執行成本約 1.26 美元講者自述,無外部來源佐證
吳柏翰蒸餾後的模型在三項測驗的成長172%、22%、654%講者自述,無外部來源佐證
張志祺初剪時間一個半小時壓到約十五分鐘講者自述,無外部來源佐證
Wisely Chen對帳頻率一天一次提升到每小時一次講者自述,無外部來源佐證
Vivi Chen例行作業耗時半小時以上壓到一分鐘講者自述,無外部來源佐證
劉詩雁客訴回覆確認時間兩到三週縮短到即時查詢講者自述,無外部來源佐證
劉詩雁導入工作量中資料整備的占比約 95%講者自述,無外部來源佐證
海馬做出一個完整網站的時間六個月壓到一個月講者自述,無外部來源佐證
紀懷新經手的優化專案數與年營收貢獻超過一千個專案、每年約一百億美元與公開簡歷相符
陳志信一則貼文平均能留住的注意力1.7 秒講者引用,出處未說明

這張表最誠實的地方是最右邊那一欄:幾乎全部都是講者自述。企業案例的成效數字本來就很難有外部稽核,這不是這些講者的問題,但看的時候要知道自己在看什麼。

10. 主要資料來源

項目來源
24 場講題與講者的官方寫法議程總覽
每一場的完整內容與各自的資料來源表開發者年會 與年會各場筆記
名詞解釋與官方文件連結名詞對照表
講者背景與媒體報導參考資料與佐證
講者專訪INSIDE 2025 Generative AI 年會專題