1. 一句話總結
Google過去十年把recommender system(推薦系統)與search(搜尋)兩大功能,從各自為政的規則系統收斂進一個生成式AI模型,如今這股「收斂」的力道正延伸到機器人身上,而台灣在軟硬體結合與個人化研究上還有機會插旗。
2. 重點筆記
他的職稱:三種中文說法並存
主持人在台上介紹他是「Google DeepMind的副總裁」。經查,中文媒體對他職稱的翻譯並不一致:LinkedIn上的英文原職稱是VP of Research(研究副總裁),INSIDE的專訪把這個職稱譯為「傑出科學家」,另一篇中文媒體摘要則譯成「首席科學家」。三種說法都指向同一個職位,只是中譯用詞不同,本篇以LinkedIn上的英文原職稱VP of Research為準,因為那是他本人公開資料上的第一手說法,不經過媒體轉譯(見第七節連結)。
為什麼要從歷史講起
他開場就講明白動機:要預測未來,得先知道過去發生了什麼、現在正在發生什麼。他認為台灣從一九九〇年代起把資源壓在晶片上,反而錯過了軟體這一波,而軟體其實比硬體更容易入門——他自己八歲就開始寫程式,二十五歲拿到明尼蘇達大學電腦博士(這兩個年齡的說法是主持人在開場介紹時講的,其學經歷的查證結果見第七節)。
他拿Google自己當例子:作為一間以軟體為主體的公司,最重要的兩塊業務是recommender system(也就是各種feed)跟search,這兩個functionality(功能)撐起了整個產業裡大約五千億美元(500 billion US dollar)的規模(這個數字是他自己講的,查無外部佐證,標記為講者自述)。他在Google裡面經手超過一千個優化類的project,每年多幫公司賺進約一百億美元營收——這組數字和他公開簡歷上「>1000 product landings、annual revenue 約 10.4 billion since 2013」的說法幾乎對得上,看起來不是隨口一講(見第七節連結)。
2015年是轉捩點
他把2015年當成生成式AI真正的起點,理由是那一年幾件事同時發生:
- 影像辨識的錯誤率從26%降到3%,比人類判斷的錯誤率5%還低(人類辨識錯誤率5%上下是ImageNet長期引用的比較基準,經查外部資料,時間點與方向大致吻合,但26%這個起點數字未能查得對應的外部出處,見第七節)。
- 語音辨識從「吵雜酒吧裡幾乎打不出一封email」進步到可以用嘴巴直接下指令、寫短訊。
- 機器翻譯從需要龐大對照表的statistical(統計式)方法,換成seq2seq learning(序列到序列學習),同一年還做到把圖片丟進模型、直接生成敘述文字。
他特別提醒:如果2015年就知道這些事情正在發生,「這個各位的股票投資喔,應該會有很大的變化對不對」——現場問誰在2015年買了Nvidia,沒人敢舉手。
他認為生成式AI(generative AI)之所以叫「生成」,是因為背後是一個token接一個token做預測,這個「一個接一個生成」的本質早在2015年seq2seq時期就已經成形,只是當時沒有人拿「生成式AI」這個詞來稱呼它。他自己是2021、2022年回台灣時,都還沒聽到有人在講生成式AI,一路要到2023年才變成報章雜誌的常用詞。
從divide and conquer到convergence
他說自己這十年在Google做研究最重要的心得,是整個典範從「divide and conquer」(分而治之,把不同功能拆成不同系統)轉向「convergence」——把翻譯、摘要(summarization)、問答(question and answer)這些原本各自獨立的功能,全部收斂進同一個模型裡處理。他舉了一個兩年前就做到的例子:對一段程式碼下指令「找出depth first search的bug、修好它,並把註解改成韓文」,結果同事確認韓文註解不只正確、還相當精準——這在當時就已經是一個模型同時處理程式理解、除錯、跨語言生成三件事的證明。
他把這條技術脈絡串成一條時間線:2015年seq2seq learning、之後的Transformer論文(他形容「大家都知道的transformer的paper」)、2020年他開始參與的LaMDA、接著是Bard、最後是Gemini。他特別提到這條路上有兩篇他掛名作者、他認為真正想做這行的人都該讀的論文:一篇是chain of thought(思維鏈),另一篇是他稱為「現在我們叫做post training的fine tuning」的論文(他沒有講出確切篇名,未能查得是哪一篇,標記待查證,見第七節)。
System 1與System 2,撐起五千億美元
他借用心理學「快思慢想」的架構解釋Google兩大主力業務:recommender system做的是System 1式的fast thinking(快速直覺判斷,例如滑TikTok、YouTube幾秒鐘就決定要不要看);search與coding這類需要深度推理的任務則對應System 2的long thinking(深度思考)。他認為這正好解釋了為什麼前面提到的五千億美元產業會集中在這兩個系統上——因為它們剛好對應人類處理資訊的兩種習慣,而在五千億美元的基數上做0.1%到1%的優化,價值就非常可觀。他也順勢自嘲:自己在YouTube推薦系統上花了超過十年(over a decade),現場問誰在用YouTube幾乎全場舉手,他說「你每天晚上睡不著覺來那邊看,都是我的錯」。
Project Astra:從手機助理到修腳踏車
他放了一段Project Astra的展示片段,片中的助理可以:指出喇叭裡發出高頻聲音的部件叫tweeter、即興創作以C開頭的頭韻句(creative alliteration)、解讀一段程式碼是AES-CBC加解密函式、辨認出畫面中是倫敦King's Cross一帶(因為靠近車站與交通樞紐)、記得眼鏡放在書桌上一顆紅蘋果旁邊、建議在伺服器與資料庫之間加cache來加速、把某個畫面聯想到薛丁格的貓。他說這是他的團隊做的,片子本身是一年前拍的,他當時想拿出實機給大家看,卻忘記帶在包包裡——他形容那支原型機「大概只有50多公克」。
三天前才剛發表的新版Astra,展示了完全不同層次的任務鏈:接到「幫我修腳踏車」的指令後,助理主動上網找到Huffy登山車的使用手冊、捲到煞車段落、在YouTube上找到對應維修影片、翻查與腳踏車行的往來email找出需要的六分之三吋(three eighths inch)六角螺帽尺寸、致電附近腳踏車行詢問庫存、被使用者岔題問「要不要吃午餐」後還能接回原本正在講解的手冊第24頁煞車片段落、最後還能依使用者需求推薦幾款可以掛在腳踏車上的狗籃款式。他半開玩笑地說,這支手機他不敢弄丟,因為「我回母公司的時候我就不用回家了」。
機器人:多模態能力的下一站
他認為multi-modality(多模態)能力接下來最重要的應用場域是機器人。他提到台灣在機器人手臂的硬體發明上有基礎,軟硬體結合是台灣的一個好機會,但過去卡在三個一直很難跨過的瓶頸:
- Generality(泛化性):以前機器人手臂只要背景、前景、物件換了,視覺辨識就得重新訓練;現在用Gemini的多模態能力,不需要重新訓練就能適應新場景,就像自駕車要應付千變萬化的路況一樣。他放了一段示範:機器手臂被要求「把筆放到其他鉛筆旁邊」和「撿起籃球並灌籃」,後者他特別強調系統完全沒看過basketball(籃球)這個概念,是zero-shot(零樣本)就做到的能力。
- Interactivity(互動性):示範片段裡使用者不斷改變指令——先說把香蕉放進透明容器、再說把葡萄放進透明容器、又臨時改口說要放進粉紅色容器、最後要求擦掉白板——這一連串修改也是zero-shot完成,他形容「如果是真人的話老早就講髒話了」,用來對比AI不會累、不會嫌煩的特性。
- Dexterity(靈巧度):他認為這是最有趣的瓶頸,牽涉到繫鞋帶、撿雞蛋、把軟硬材質黏在一起這類需要精細力道控制的動作。示範片段中機器手能摺紙且不摺壞、用工具夾起豆子且不夾破、把物件放進特定的收納盒、甚至排列字母磚拼出「ace」這個字(要求是「拼出撲克牌裡會出現的東西」)。他特別點出其中一段「拉鍊拉頭需要先分開才能扣上」的小關卡,是機器人自己figure it out(想通)、而在場觀眾多半沒想通的地方。他強調這整套手部動作是「one model,not separate models」(單一模型控制,而非拆成多個獨立模型)。
給台灣的研究機會
他收尾時列出幾個他認為接下來還有很多研究空間、且不需要堆很多晶片(chips)就能做的方向:multi-step reasoning(多步驟推理)、實體與數位工具的tool use(工具使用,他強調「數位的tool use大家已經在做,但physical的tool use往前走也很有契機」)、self-improvement(自我改進,教一次以後持續學會)、multi-modality reasoning IO(多模態的推理輸入輸出),以及personalization/customization(個人化、客製化)。他認為這幾個方向在台灣都有很多機會。
3. 關鍵數據與案例
- 經手超過1,000個優化類project,每年為Google增加約100億美元(10 billion US dollar)營收——與他公開簡歷上「annual revenue ~$10.4B since 2013、>1000 product landings」的說法相符(見第七節)。
- Recommender system加search兩大功能撐起約五千億美元(500 billion US dollar)產業規模(講者自述,無外部來源佐證)。
- 2015年影像辨識錯誤率從26%降到3%,低於人類5%的錯誤率(方向與時間點與外部資料吻合,26%起點數字待查證,見第七節)。
- Chain of thought(思維鏈)論文他掛名共同作者(經查,見第七節)。
- LaMDA他從2020年開始參與,後續演進為Bard、再到Gemini(經查LaMDA論文年份,見第七節)。
- Project Astra原型機重量約50多公克,一年前已拍攝展示片段;三天前發表的新版能在手機上跑,完成查手冊、找影片、查email、打電話等多步驟任務鏈(經查Project Astra官方介紹,見第七節)。
- 機器人三大瓶頸:generality、interactivity、dexterity,是他歸納出的架構(經查Google DeepMind的Gemini Robotics三大能力說法,與他描述的三個瓶頸幾乎對應,見第七節)。
4. 金句
- 「你要為什麼要知道現在在發生什麼事情,你才能夠predict what's gonna happen in the future。」
- 「我們現在講的是convergence,把所有的function、所有的model,全部converge到一個model裡面去。」
- 「但是比我更有名的同班同學,也是同一年出去念書的,是林志玲,林志玲是我同學。」
- 「這是完全one model,not separate models,它就能夠控制手的那個整個dexterity。」
- 「台灣發明很多機器人手臂,現在……一共有三個瓶頸事實上是一直很難過去的。」
5. 提到的工具與名詞
- Gemini:Google目前的多模態生成式AI模型系列,也是這場講題裡「Gemini Era」指涉的核心產品。
- Bard:Gemini前身的對話機器人產品名稱。
- LaMDA(Language Model for Dialogue Applications):Google在2020年代初期開發的對話語言模型,後續技術路線演進為Bard、Gemini。
- seq2seq learning(sequence-to-sequence learning,序列到序列學習):把一個序列直接映射到另一個序列的類神經網路架構,是機器翻譯從統計對照表法轉向的關鍵技術。
- Transformer:2017年提出的類神經網路架構,是當代大型語言模型的技術基礎。
- Chain of thought(CoT,思維鏈):透過讓模型輸出中間推理步驟來提升解題能力的提示技巧。
- post-training/fine-tuning(後訓練/微調):模型完成預訓練後再進行調校的階段。
- System 1/System 2:心理學裡快思考(直覺、快速)與慢思考(深度、費力)的雙系統理論,他借用來解釋recommender system與search/coding這兩類任務的差異。
- Project Astra:Google DeepMind研發中的通用AI助理研究原型。
- Gemini Robotics:Google DeepMind把Gemini多模態能力延伸到機器人控制的模型。
- generality/interactivity/dexterity(泛化性/互動性/靈巧度):他歸納機器人研究要跨越的三個關鍵能力。
- zero-shot(零樣本):模型未經過針對性訓練就能完成任務的能力。
- ImageNet:大型影像辨識基準資料集,他用來說明2015年深度學習超越人類判斷力的例子。
6. 延伸觀察
整場最鮮明的方法論,是他把「歷史感」當成工具在用——不是懷舊,而是拿過去發生的事情去校準對未來的判斷,這點比任何一個demo都更有啟發性。他講「2015年就已經發生」這件事時特別用力,其實是在提醒現場的開發者:現在看起來理所當然的能力,往往三五年前就有跡可循,關鍵是有沒有在正確的時間點注意到。
機器人那段的三個瓶頸(generality、interactivity、dexterity)是整場最有架構感的部分,把原本很模糊的「機器人還做不到什麼」講成三個可以逐一檢驗的維度,也難怪他會特別跟台灣的軟硬體背景做連結——如果這三個瓶頸真的逐步被打開,台灣在機構、感測器這端的硬體基礎,確實有機會跟軟體端的模型能力對接起來。
7. 資料來源
| 項目 | 來源 |
|---|---|
| 紀懷新現職VP of Research, Google DeepMind | |
| 學經歷:明尼蘇達大學三個學位(BA 1994、MA 1996、PhD 1999),6.5年內取得 | edchi.net Resume |
| 中文職稱譯法不一致(研究副總裁/傑出科學家/首席科學家) | INSIDE 專訪 |
| 公開簡歷「>1000 product landings、annual revenue ~$10.4B since 2013」 | LinkedIn、Google Research 個人頁 |
| COMPUTEX 2025演講題目「Google Gemini時代:將人工智慧帶向通用助理與真實世界」與時段 | COMPUTEX Keynote & Forum 官方頁面 |
| Chain of thought論文共同作者 | arXiv 2201.11903 |
| LaMDA論文(2022) | arXiv 2201.08239 |
| 2015年ImageNet錯誤率超越人類判斷(人類基準約5%) | aiimpacts.org |
| Project Astra為通用AI助理研究原型 | Google DeepMind 官方頁面 |
| Gemini Robotics三大能力:generality、interactivity、dexterity | Google DeepMind 官方部落格 |