1. 一句話總結
吳柏翰用「中央廚房蒸便當」的比喻,說明APMIC怎麼透過知識蒸餾把巨型通用模型的專業知識濃縮進企業負擔得起的小模型,再用測試時擴充的技巧讓小模型的推理品質逼近大模型。
2. 重點筆記
開場:地端模型已經到了該導入的時間點
他一開場就先定調:地端模型現在很適合企業導入,開源模型的性能與推理能力已經大幅成長,推論硬體選擇變多、成本也逐漸可負擔。但他馬上補了一句很務實的提醒——地端絕對不要想著用一個很大的模型做各種不同的事,而是要用最小的成本,在有限的模型下做有限的事,才能讓最多人用得到。
一個開車比喻:RAG是副駕駛指路,微調是自己學會開
這是他解釋RAG(他一路都念作rig)與微調(fine-tune)差別最直白的比喻。RAG就像旁邊有個副駕駛不斷跟你說「靠左一點、靠右一點、快撞到了」,你每次都要靠別人講才會動方向盤;微調則是你自己把路線整個學進腦袋裡,不需要旁邊有人講,反應速度最快。他延伸舉例:如果要做一個法律AI小助理,通用做法是把法律條文和公司文件都丟進RAG,每次都要現查、現想、現回;微調則是把法規和公司知識直接訓練進模型腦袋裡,之後只要處理新收到的文件即可,速度差一截。
為什麼要蒸餾:把2TB壓成6GB
他把企業知識比喻成一個資料庫等級的搜尋任務,過去要查到動輒TB等級的資料集,現在透過微調把它壓縮成只剩6GB,而且從「搜尋」變成「對話」。這是他認為知識蒸餾對企業最有感的價值:把海量知識壓縮進一個可以直接對話、可以持續學習進化的小模型。
「S1」名字的由來:兩個月前李飛飛的論文
這是整場最有意思的細節。他提到APMIC的微調蒸餾方案叫「S1」,來源是不久前李飛飛團隊發表的一篇論文。查證後,這篇論文是《s1: Simple test-time scaling》,2025年1月31日首次公開,作者包含李飛飛(Fei-Fei Li)在內共十人(含Niklas Muennighoff、Percy Liang等史丹佛團隊成員)。論文的核心方法有兩個:一是用僅一千筆精心篩選的高品質推理範例(論文稱為s1K資料集)就能訓練出具備競賽數學推理能力的模型;二是「budget forcing」技巧,透過強制截斷或用「Wait」延長模型的思考過程,讓模型在測試當下重新檢視、修正推理錯誤,藉此用更多測試時運算量換取更好的答案品質。這個「先用少量高品質資料,靠測試時的思考時間換效果」的精神,正好對應到APMIC自家S1系列裡「最小量級只要一千筆標註資料」的設計。
S1系列:從Lite到Ultra,四種量級對應四種企業需求
依照投影片列出的產品全貌,S1系列依資料量與預算分成四級:
| 項目 | S1 Lite | S1 Mini | S1 Pro | S1 Ultra |
|---|---|---|---|---|
| 資料需求 | 1,000筆高品質標註資料 | 1萬到15萬筆標註資料 | 10億字以上未標註語料+1萬到15萬筆標註資料 | 9.8兆字語料 |
| 模型大小 | 3B/24B/70B | 3B/24B/70B | 同左(可升至109B) | 自訂建模 |
| 訓練時間 | 約30天 | 約30天 | 約60天 | 約90天 |
| 部署硬體(H100等級) | 3台 | 4台 | 50台 | 120台 |
| 適合對象 | 快速啟動、已有小量標註資料 | 同左,成本低、訓練快 | 有大量原始文件、想強化自動化 | 擁有海量資料與長期AI策略的企業 |
他當場問現場有沒有人公司資料量超過100億token,幾乎沒人舉手——用這個現場調查說明大多數企業其實只需要從S1 Lite或S1 Mini起步,不用一開始就想著做Ultra等級的自建大模型。
開源三件事:資料集、模型、評測工具
他現場公布了三項開源成果:
- 繁體中文推理資料集:
tw-math-reasoning-2k、tw-reasoning-instruct-50k、tw-function-call-reasoning-10k,格式包含中文的input、output與thinking過程,給想自己做fine-tune的人參考。 - **評測工具(他口頭稱Auto Eval,查證INSIDE的專題報導後確認正式產品名為Twinkle Eval)**:他提到過去繁體中文的評測工具普遍存在推理時間太長、答案格式抓取不穩定(模型習慣把答案放進
\boxed{})、評測細節(如溫度、逾時設定)不透明、選項沒有隨機化導致模型直接背答案等問題,他們把這些痛點整理後重新設計了一套更快、支援並行評測的工具。 - 3B推理模型(結合MCP):他稱這是全球第一個蒸餾出來、結合MCP(Model Context Protocol)的3B推理模型,開放下載次數已超過1,000次,用25台NVIDIA H100訓練而成。
蒸餾成效數字:3B模型微調前後的分數對比
投影片列出的具體評測數字(皆為講者提供,未見獨立第三方覆核,標記講者自述):
- TMMLU+:從15.49%提升到42.18%,成長172%。
- 台灣法律測驗:從25.68%提升到31.26%,成長22%。
- MMLU:從6.90%提升到52.07%,成長654%(他口頭說「提升六倍」)。
- BFCL(Berkeley Function Calling Leaderboard,用來評估模型呼叫函式/工具能力的評測榜單,經查確認為加州大學柏克萊分校Gorilla團隊維護的公開評測):他們的3B開源模型在其中一項函式呼叫子題拿到91分,優於Llama-3.2-3B-Instruct的84分與GPT-4o-mini的87分,也高於Llama-3.1-8B-Instruct的57分。
一個關鍵提醒:先決定題目,再收資料
他特別強調現在做語言模型的順序整個反過來了——不是從頭堆資料,而是先決定清楚要解決的題目,再回頭決定資料要怎麼收集;如果題目定義不清楚就亂做微調,「你只會收到一堆帳單,可是沒有結果」。
前一天在NVIDIA GTC台北場講過類似內容
他一開場就問現場有沒有人前一天去了NVIDIA GTC台北場,坦言內容會有部分重疊。查證後,NVIDIA GTC Taipei 2025於2025年5月21日至22日舉行(科技新報、零壹科技公告),正好是這場開發者年會(5月23日)的前一到兩天,時間點吻合。
3. 關鍵數據與案例
S1系列硬體與資料需求對照:見上方表格。
BFCL函式呼叫評測(講者自述):
| 模型 | 分數 |
|---|---|
| Llama-3.2-3B-Instruct | 84 |
| Llama-3.1-8B-Instruct | 57 |
| GPT-4o-mini | 87 |
| ACE-1-3B(APMIC開源版) | 91 |
知識蒸餾成效(講者自述):TMMLU+、台灣法律、MMLU三項測驗分別成長172%、22%、654%,詳見上方章節。
公司規模(講者自述,部分為補查):APMIC成立於2017年,至本場約有八年歷史;補查相關報導後可知,NVIDIA執行長黃仁勳在2024年與2025年的台灣演講中共點名APMIC六次,APMIC甚至出現在2025年黃仁勳台北演講背版上——這一點正好對照隔天林鉦育講的玉山銀行「終於掛上背板」故事,同一週的年會裡,「站上NVIDIA的背板」意外成了金融科技圈的共同話題。補查另一篇INSIDE Side Chat專訪(2025年7月刊出)補上了更完整的脈絡:APMIC於2023年加入NVIDIA的Inception新創生態圈計畫,之後連續兩年登上黃仁勳COMPUTEX主題演講的合作夥伴牆,與六度點名的說法互相印證。
4. 金句
- 「地端絕對不要想的是一個很大的模型做各種不同的東西。」
- 「你只會收到一堆帳單,可是沒有結果。」
- 「現在做語言模型基本上要從最後面開始做,先決定好你的題目,再來決定你資料要怎麼收集。」
- 「把你的母規全部都先學到腦袋裡,它直接rig你同事的新文件就好。」
- 「我們可以把我們想像成是一個中央廚房,專門在蒸不同的便當給我們的客戶。」
5. 提到的工具與名詞
- 知識蒸餾(Knowledge Distillation):將大型模型的知識轉移到小型模型的技術,經典文獻為Hinton等人2015年發表的《Distilling the Knowledge in a Neural Network》。
- 測試時擴充(Test-time Scaling):透過增加推理階段的運算量來提升模型表現的技巧,本場對應的關鍵論文是《s1: Simple test-time scaling》。
- NVIDIA NeMo:APMIC微調蒸餾方案所基於的NVIDIA框架。
- CPT(Continual Pre-training,持續預訓練)/CoT(Chain of Thought,思維鏈):投影片中蒸餾流程的兩個訓練階段。
- MCP(Model Context Protocol):APMIC的3B模型結合的協定,用來讓模型呼叫外部工具或函式。
- BFCL(Berkeley Function Calling Leaderboard):評估LLM呼叫函式能力的公開評測榜單。
6. 延伸觀察
這場最值得記下來的不是那些漂亮的分數,而是「S1」這個命名背後的邏輯——一間台灣公司在論文發表後不到三個月,就把論文核心精神(少量高品質資料+測試時運算)直接轉譯成分級的企業產品線,而且分級的資料量門檻幾乎是論文設定的直接映射。這說明知識蒸餾和測試時擴充已經不只是學術概念,而是可以快速商品化、分級銷售的能力。對照隔壁林鉦育那場講金融業導入AI要先想清楚場景,這場其實是在講另一端的問題:如果企業已經想清楚場景、但不確定該做RAG還是微調,這場的判斷框架(能不能忍受每次都要查、有沒有足夠的標註資料)給了一個很實際的決策起點。
7. 資料來源
| 項目 | 來源 |
|---|---|
| APMIC正式登記中文全名、成立日期、負責人 | 台灣公司網twincn.com |
| 吳柏翰職稱、Google Developer Expert身份 | Sessionize講者頁、國立陽明交通大學智慧科學暨綠能學院演講公告、TechNice專家頁 |
| 本場內容交叉驗證(RAG比喻、S1分級方案、評測工具正式名稱Twinkle Eval) | INSIDE專題報導 |
| APMIC加入NVIDIA Inception時間、連續兩年登上合作夥伴牆 | INSIDE Side Chat專訪 |
| 知識蒸餾經典論文 | Distilling the Knowledge in a Neural Network |
| 測試時擴充論文、李飛飛掛名確認 | s1: Simple test-time scaling |
| NVIDIA GTC Taipei 2025日期 | 科技新報、零壹科技公告 |
| BFCL評測榜單說明 | Berkeley Function Calling Leaderboard |
| 黃仁勳提及APMIC次數、公司近況 | Yahoo奇摩股市報導 |
| S1系列產品規格、評測分數 | 講者投影片(dev-2. 吳柏翰 語言模型如何學習) |