1. 這兩天剛好卡在一個很密集的時間點

年會前後那幾天,模型端接連有動作:保哥上台前一晚 Anthropic 發布了 Claude Opus 4 與 Claude Sonnet 4(官方公告,發布日期是 2025 年 5 月 22 日,正好是開發者年會前一天);紀懷新展示的新版通用助理原型是三天前才發表的;Davis Chang提到 Google 剛發布的影片生成模型 Veo 3(Google 官方公告)。策展人在開場也順口提了當時剛出的幾件事。

這種密集度本身就是趨勢的一部分。策展人在開場說,每次要辦年會之前都有一堆新東西冒出來,講者很辛苦。實際情況是:有講者因為前一天聽到別人的內容,當場把自己的題目改掉。

2. 從「會回答」變成「會動手」

如果去年的關鍵詞是對話,今年就是代理人。差別策展人講得最白:以前你講,它回你一段文字;現在你講,它會採取行動。

值得注意的是實際被拿去做的事情有多平凡。物流業拿它每天下載檔案、合併、對帳;軟體公司拿它從一張需求表單直接開分支寫程式;NGO 工作者拿它查帳填表。沒有人在講「它會取代誰」,大家在講「它幫我省掉哪一段」。

同時被反覆提到的是驗收。李慕約那句「人類要做好甲方,好的甲方需要驗收跟招標」,跟保哥在需求表單上刻意標高執行成本、逼使用者把需求寫清楚,其實是同一件事的兩種說法。代理人愈能動手,人類的工作就愈往前挪到定義問題與驗收成果那一端。

3. 協定層在這一年開始成形

去年這個位置還是各家自己接自己的工具,今年出現了共通層。張文鈿整場在講 MCP:工具端寫一次伺服器,所有支援的客戶端都能用。

從這場可以看到協定成熟度的真實狀態:規格本身可用,但遠端部署與身分驗證在當時都還在補,連官方除錯工具都有版本相依的 bug。這是很典型的「協定剛贏得共識、實作還在追」的階段。

擴散速度也很說明問題。同一場活動裡,MCP 同時出現在規格講解(張文鈿)、工程實作(保哥把它接進自家編碼代理人)、以及銀行的中期規劃(黃仕鎮把 MCP 列進玉山銀行下一步的代理整合)。張文鈿也提到 Google 的 A2A,代理人之間怎麼互通是下一層還沒定案的問題。

4. 模型同時往兩個相反方向走

這是兩天裡最清楚的一組張力。

一邊是收斂。紀懷新整場的主軸是 convergence:翻譯、摘要、問答這些原本各自獨立的功能全部收進同一個模型,連機器手臂的控制他都強調是 one model 而不是拆成好幾個。

另一邊是蒸餾。吳柏翰整場在講怎麼把巨型模型的專業知識濃縮進企業負擔得起的小模型,再用推論階段的技巧把品質拉回來。他的客戶要的是能在自己機房裡跑的東西。

這兩條線不衝突,因為它們服務的是不同的人:平台方要一個什麼都會的模型,企業客戶要一個資料不出門的模型。今年的分水嶺是後者變得真的可行了,而驅動力是法遵與機密,不是成本。玉山銀行兩場都反覆講同一句話:客戶資料不能外流,所以只能自建。

5. 評估變成新的瓶頸

模型能力上升之後,「怎麼知道它夠好」變成比「怎麼讓它更強」更難的問題。這件事在兩天裡被三個完全不同位置的人各自提出來。

林彥廷從研究端談:評測標準決定了整個領域往哪座山爬,而現行的公開評測正在快速失效——他兩年前為繁體中文模型設計的一整套考試題目,現在幾乎被各家模型解光了。他也點出模型會為了迎合使用者而犧牲正確性這個結構性問題。

吳剛志從產品端談:公開指標不夠用,就自己定義正確率與覆蓋率,然後帶著團隊跑幾十輪。他那句對照很有力——自己內部用的提示詞跑一百次可以逐筆檢查,產品化之後跑一百萬次不可能逐筆檢查。

李昆謀從組織端談:把評估結果直接變成分工比例,AI 只做它有把握的,其他還給規則引擎跟人。

三個人得到的結論一致:寧可覆蓋率低,也不要正確率低。這大概是這屆最實用的一句話。

6. 影像生成跨過了「能不能用」的門檻

今年講 AI 影像的三場,沒有一場在示範模型有多強,全部在講模型以外的事。

陳志信主張決定影片好不好看的是產圖之前的構圖設計,他的方法論刻意做成不綁任何一款軟體。Davis Chang 認為真正被改變的是「誰能開始創作」,製作團隊從上百人壓縮到幾個人之後,稀缺的變成美感判斷力。

反過來,李怡志整場在講同一批技術的另一面。他的論點很反直覺:假圖騙不騙得到你,跟它做得像不像關係不大,跟它有沒有踩中你的立場、情緒、知識落差與社交信任關係比較大。技術門檻降低之後,識讀的重點也跟著從「看圖找破綻」移到「檢查自己為什麼想相信」。

7. 進場的人變了

這屆最明顯的結構變化不在技術,在講者名單。年會刻意排了一整個系列給非工程師:廣告業務、NGO 工作者、國小學童。策展人受訪時也提到講者性別比例從男性主導變成男女各半(INSIDE 專訪)。

Peggy Lo 的觀察是這一整個系列裡最有重量的一句:AI 寫程式這件事對組織裡雜務最多的底層工作者反而是翻身工具,因為主管沒有應用場景,所以學不會。這跟同一批講者裡「主管不支持就推不動」的說法放在一起看,會得到一個不太舒服但可能正確的推論——最需要 AI 的人跟最有權力決定要不要導入 AI 的人,不是同一群人

8. 台灣被放在哪個位置

紀懷新給的建議很具體:多步驟推理、實體世界的工具使用、自我改進、多模態推理、個人化,這幾個方向不需要堆很多晶片就能做,而且台灣在軟硬體結合上有基礎。他也直接說台灣從一九九〇年代起把資源壓在晶片上,反而錯過了軟體那一波。

從兩天的企業案例來看,台灣目前的實際位置比較像是「應用場域很紮實、模型層很淺」:銀行、零售、物流、印刷、娛樂都拿得出可量化的導入案例,但除了少數幾個團隊在做繁體中文模型與企業蒸餾,模型層的自主性仍然薄。

9. 還沒解決的

  • 代理人之間怎麼互通。MCP 解決了模型接工具,代理人接代理人還沒有共識。
  • 遠端部署與身分驗證。這是張文鈿在台上直接點名的坑。
  • 評估的成本。高品質評測資料的標註費用高到會影響研究方向。
  • 成效數字很難查證。這兩天所有企業案例的量化成果幾乎都是講者自述,沒有外部稽核,這在主題式重點整理的總表裡看得最清楚。
  • 識讀跟不上生成。生成端一年進步一大步,一般人判斷真假的方法幾乎沒有進步。

10. 主要資料來源

項目來源
Claude Opus 4 與 Sonnet 4 發布時間Anthropic 官方公告
Google 影片生成模型 Veo 3Google 官方公告
MCP 規格與現況Model Context Protocol 官方文件
代理人互通協定 A2AA2A Protocol
策展人對這一屆的規劃與講者結構INSIDE:李慕約談全民 AI 時代
活動後的產業觀察INSIDE:2025 生成式 AI 年會反思
各場次的原始內容與各自的資料來源議程總覽