1. 一句話總結

要讓 AI 穩定生出一張你要的廣告素材,光靠人下 prompt 很難命中,他的解法是先讓多模態模型自己「看圖說話」、把好圖片翻譯成 AI 懂的細節語言,再用 RAG 把這些「好 prompt 的結構」查出來套用,讓不同影像模型都能穩定產出風格一致的結果。

2. 重點筆記

講者背景與公司,經查對照

主持人介紹他是 cacaFly(聖洋科技) 的技術副總,也是 Cloud AI 事業負責人,過去兩年分別以銷售與 AI 能力拿下 Google Cloud Partner All Stars 大獎。經查這家公司——台灣的數位媒體代理商,主要做社群、創意企劃、媒體整合、數據分析與趨勢預測,2009 年成立。他自己上台也直接說「cacaFly 本身是廣告產業」,跟公司網站上的定位一致。他的英文名字是 CH Wu,cacaFly 官方部落格 上的正式職稱是「cacaFly 聖洋科技雲端智能中心副總經理」,同一篇文章裡也把這個職位英譯成「VP of Technology」——這跟主持人現場說的「技術副總」其實對得起來,只是一個是中文全銜、一個是英文職稱的直翻,兩種說法都留下來對照。Google Cloud Partner All Stars 得獎這件事,未能查得 cacaFly 官方或 Google Cloud 官方的公開得獎資訊或年份,列為待查證。

廣告素材生成,關卡比想像中多

他說要產出一張像樣的廣告素材,用現在的 AI 技術其實不容易,因為有好幾關要過。第一關就是 prompt:他們找了文獻,發現多媒體生成要拿到正確結果,下 prompt 的次數大概是純文字大型語言模型的 3 倍(他引用文獻得出的估計,未能查得對應的原始論文,列為講者自述)。如果是非專家,可能要下到 15 到 30 次才會放棄——因為不具備「跟設計師溝通的語言」,不知道怎麼讓 AI 聽懂指令;就算是產業裡的專家,大概也要 5 到 10 次(同樣為講者自述,無外部來源佐證)。

現場互動:同一張圖,各自的 prompt 天差地遠

他讓全場看一張圖,給 3 秒鐘想像「如果要生出一模一樣的圖,你會怎麼下 prompt」,再把同事們實際下的 prompt 彙整出來——黑色捲髮年輕女生、淺米色靴子、坐在森林裡的木頭上。這段描述聽起來已經很具體了,但丟進不同的影像模型,出來的結果卻是完全不同的風景;就算把同一個 prompt 丟進同一個模型跑兩三次,每次結果也不一樣。

問題出在哪:人會腦補,AI 不會

他的分析是:要描述好一張圖片需要非常多細節,但人跟人溝通通常只會說「一個很帥的男生」「亞洲人」「幾歲到幾歲」「做什麼動作」,光影、細節、表情、場景、姿勢這些很細的東西根本講不出來——因為人跟人溝通時,這些細節會被對方自動腦補出來。AI 目前還做不到這種腦補,所以你不給它清楚的指令,它就沒有依據,這就造成人跟 AI 之間的溝通代溝。他認為解法方向是讓「人的描述」跟「AI 理解的世界」越來越接近——去猜 AI 懂什麼、不懂什麼,把這個落差填起來。

用多模態模型當翻譯機

他們的實驗做法是:既然現在的多模態模型(他提到 Google、GPT、Claude 當時都才剛發布新模型,多模態能力都加強了不少)已經有看圖的能力,那就讓 AI 自己去看一張構圖好的圖片,寫出詳細描述,再拿這份 AI 寫的描述去生成新圖片——這樣人就不用自己看著圖片絞盡腦汁描述了,等於把「畫面怎麼描述」這個問題,降維成一個純文字結構的問題。他們拿瑪利歐在床上打電動、旁邊有碧奇公主的例子做測試:AI 的描述看起來面面俱到,但丟進不同影像模型出來的結果天差地遠——有的模型不認識瑪利歐、有的搞不清楚角色的腳該擺哪裡、有的乾脆生出兩個瑪利歐來蒙混過關;丟給某個模型甚至直接被以「違反使用政策」拒絕生成。他半自嘲地說,這證明語言模型有幻覺,影像模型顯然也有。

拿 RAG 把「好 prompt 的結構」找出來

既然「AI 看圖寫出的描述」本身也不一定能穩定產圖,他們的做法是拿這些生成的圖片,用成熟的圖片相似度比對技術跟原圖比對,像的打一個標籤、不像的打另一個標籤,藉此篩出哪些 prompt 結構真的能產出好圖。累積出這個標籤庫之後,就可以做一個很簡單的文字版 RAG(Retrieval-Augmented Generation,檢索增強生成):使用者下一個簡單的 prompt,系統去查有哪些 prompt 結構能把類似的畫面描述好,再把使用者原本想達成的目標,加上查到的參考結構重新組合、重新下 prompt,這樣就能穩定產出好圖片。他們實際把這條流程串起來測試,同一組 AI 產出的 prompt 丟到不同影像模型,出來的品質很一致,驗證了這套做法是行得通的。

實際應用:一個廣告素材產生器

他們把這條流程包成一個廣告應用:輸入產品屬性、選定人種與風格,系統就用內建的基礎 prompt 生成一張代表性影像;如果要修改,可以用多模態模型基於原本的影像再做微調——比如從卡通風格換成真人,或者換髮色、加動作。整個創作流程大致是:先產生一張草稿、拿草稿生成基礎圖片、對基礎圖片加工(例如換成真人),再基於這張圖用同樣的概念延伸出新的變化。

商用最大的痛點:人物與產品的一致性

他點出這套流程拿去商用會撞到的現實問題:每次生成的人物都不一樣,沒辦法讓同一個「人」重複出現在一系列素材裡;如果要鎖定某個特定產品,也沒辦法保證每次生成都帶出同一件商品。傳統的解法是另外訓練一個 LoRA 模型去鎖定特定風格或物品,但這需要具備訓練模型的技能、要花運算資源,而且得先有足夠的訓練資料。他提到就在演講前兩天,Google 剛發布了 Imagen 4)(正式發布日是 2025 年 5 月 20 日,Google I/O 2025),但 Imagen 4 還沒有他要講的這個功能,所以他今天講的是上一代的 Imagen 3。

Imagen 3 可以在原本的基礎模型上多加 1 到 4 張參考圖(Google 官方把這個功能叫做 subject customization),參考的對象分成人、產品、動物幾類(雖然人某種程度上也是動物,他自己也吐槽了這點)。他照著 Google 官方指引下的「多角度」參考圖 prompt,結果生出一隻讓他直呼「細思極恐」、五官很像他自己的合成獸;用 Imagen 3 的 prompt 增強功能請它自動把 prompt 補得更詳細,結果同樣可怕到讓人認不出來。但真的花時間摸索出對的 prompt 模式之後,他做到同時鎖定產品跟人臉、把兩張參考照合成出效果不錯的新照片,還能延伸出多角度、多姿勢的版本——他認為這個做法特別適合套用在虛擬人身上:以前好不容易用 AI 生出一張漂亮的虛擬人照片,卻沒辦法複製第二張,這套流程等於是讓虛擬人「真的成立」。

動態素材:Veo 2 接力上場

影片這塊的邏輯類似:他提到 Veo 3 也剛發布,但今天要講的還是 Veo 2)(2024 年 12 月發布,可生成長度上限 8 秒的影片;Veo 3 則是 2025 年 5 月才發布,差異在於多了同步音訊生成)。他們的做法是先產生一張自己喜歡的底圖,再用簡單的動作 prompt 請 Veo 生成動態影片;但動作本身很難用文字精準描述——他們不是導演,講不出專業的運鏡或走位——所以會另外參考一段動作不錯的既有影片(例如撥頭髮的動作),讓底圖加上這段參考影片,生成出對應的動態素材。他也提到這樣的動態素材已經實際用在戶外廣告看板上。

收尾:問題只剩下還沒講出來的想法

他最後把整場收在一句話:如果 prompt 可以變得更容易下,接下來能做的事情就只剩下「我們還沒講出來的想法」。

3. 關鍵數據與案例

  • 多媒體生成要花的 prompt 次數,約為純文字大型語言模型的 3 倍(講者引用文獻的說法,未能查得對應原始論文,講者自述,無外部來源佐證)。
  • 非專家下 prompt 到放棄約需 15 到 30 次;產業專家約需 5 到 10 次(講者自述,無外部來源佐證)。
  • Imagen 3 的 subject customization 最多可加 1 到 4 張參考圖,分人、產品、動物類別(Google Cloud Vertex AI 官方文件 可查證此功能存在,張數與分類為講者現場說法)。
  • Imagen 4 發布於 2025 年 5 月 20 日(Google I/O 2025),即他上台前兩天(Wikipedia Imagen 條目))。
  • Veo 2 於 2024 年 12 月發布,可生成長度上限 8 秒的影片;Veo 3 於 2025 年 5 月發布並新增同步音訊生成(Wikipedia Veo 條目))。
  • cacaFly(聖洋科技)過去兩年分別以銷售與 AI 能力獲得 Google Cloud Partner All Stars 獎項(講者背景由主持人現場介紹,查無公開得獎資訊佐證,列為待查證)。

4. 金句

  • 「我決定要犧牲我自我介紹時間加工商時間,讓大家可以在時間內結束。」
  • 「AI 要的細節我都給它,我去猜 AI 懂什麼、AI 不懂什麼,讓我的 problem 跟它越來越近。」
  • 「我根本不知道什麼圖片產得出來。」
  • 「照這張下 prompt,一樣會下不好。」
  • 「大家細思極恐,那個臉好像跟我有點像啊,我越看越不舒服。」
  • 「如果 prompt 可以變得更容易,其實剩下的就只是我們還沒講出來的想法。」

5. 提到的工具與名詞

  • **RAG(Retrieval-Augmented Generation,檢索增強生成)**:先檢索相關資料再交給生成模型參考的架構,他把「好 prompt 結構」當成被檢索的知識庫,套用在圖片生成的 prompt 上。
  • **Imagen 3)**:Google 的文字生圖模型,他這場示範的 subject customization(參考圖)功能所屬版本。
  • **Imagen 4)**:Google 於 2025 年 5 月 20 日發布的新一代文字生圖模型,他上台時還沒有參考圖功能。
  • subject customization(主體客製化/參考圖功能)Google Vertex AI 官方文件 對這個「上傳參考圖鎖定人物/產品」功能的正式稱呼。
  • **Veo 2)**:Google DeepMind 的文字/圖片轉影片模型,2024 年 12 月發布,可生成最長 8 秒的影片。
  • **Veo 3)**:Veo 的下一代版本,2025 年 5 月發布,新增同步音訊生成能力。
  • **LoRA(Low-Rank Adaptation)**:一種低成本微調模型的技術,他提到傳統要鎖定特定風格或物品的一致性,得另外訓練 LoRA 模型。
  • 吉卜力風格轉換:他提到這是多模態模型很明顯的一個應用示範(社群當時流行的圖片風格轉換玩法),但這場的重點不在這裡。

6. 延伸觀察

這場最漂亮的一步,是把「人跟 AI 之間的溝通代溝」重新定義成一個可以用工程方法解決的問題:先用多模態模型的「看圖描述」能力把畫面翻譯成 AI 懂的細節語言,再用圖片相似度比對把「有效的 prompt 結構」篩出來,最後套上一層很陽春的文字 RAG,把整件事從「靠感覺亂試」變成「查表加拼裝」。這跟前面幾場講程式碼生成的邏輯其實相通——都是先想辦法把「AI 不懂什麼」找出來,再用系統化的方式把落差墊平,而不是指望使用者自己變成 prompt 工程專家。他吐槽官方參考圖指引「照著下一樣會下不好」也很誠實,一般人看 demo 很容易誤以為照著官方教學做就會順利,實際上這中間還是有大量自己摸索出來的眉角。

7. 資料來源

項目來源
cacaFly 正式公司全名為聖洋科技,2009 年成立,數位媒體代理商cacaFly 官方網站
吳振和(CH Wu)職稱為 cacaFly 聖洋科技雲端智能中心副總經理(英譯 VP of Technology,與現場「技術副總」說法相符)cacaFly 官方部落格
cacaFly 官方另有一篇談廣告圖像/短影片生成流程中導入 RAG 與多模態技術的文章,內容與本場高度相關cacaFly 官方部落格:2025 生成式 AI 年會
Google Cloud Partner All Stars 得獎資訊查無公開資料,待查證
Imagen 3/Imagen 4 發布時間Wikipedia:Imagen (text-to-image model))
Imagen subject customization(參考圖)功能Google Cloud Vertex AI 官方文件
Veo 2/Veo 3 發布時間與功能差異Wikipedia:Veo (text-to-video model))
RAG(Retrieval-Augmented Generation)原始定義Lewis et al., 2020, arXiv:2005.11401
LoRA(Low-Rank Adaptation)原始定義Hu et al., 2021, arXiv:2106.09685