1. 一句話總結

生成式AI真正改變的不是畫面好不好看,而是誰能開始創作:當製作團隊從上百人壓縮到幾個人、當技術民主化讓沒有資源與人脈的人也能把劇本做出來,接下來真正稀缺的是美感判斷力,而不是操作工具的能力。

2. 重點筆記

Ø Studio與一個把作曲家「復活」的計畫

他自我介紹是Ø Studio的共同創辦人,疫情期間開始從傳統影像製作轉向投入生成式AI創作。他分享的其中一個計畫,是與鋼琴家Ayşedeniz Gökçin合作:讓AI根據作曲家的風格生成新的樂譜,再由這位鋼琴家親自演奏,同時用AI生成視覺讓已故作曲家以虛擬人物的樣貌重新登台演出(他在台上提到的是莫札特;經查公開資料,這位鋼琴家較廣為人知的AI音樂計畫對象是蕭邦,查無他與莫札特這個特定計畫的獨立報導,這段僅以他本人在台上的說法呈現,標記為講者自述,見第七節)。這個作品後續登上了甘迺迪表演藝術中心、TED AI San Francisco、以及NASA的休士頓太空中心。

第一個故事:被否決的劇本,兩週內用AI做出來

他分享了一部他在疫情期間就想拍、卻被製片與團隊直接判定「根本不可能做出來」的作品。後來他改用生成式AI技術,把劇本與風格調整成動畫質感,為了參加一個Runway舉辦的比賽,在很短的時間內就把整支片子做出來。他形容這個經驗讓他第一次真正意識到,生成式AI帶來的不只是效率提升,而是「技術的民主化」:過去要說服投資方、製片廠、發行平台層層把關才能開拍的門檻,現在一個人就能跨過去。

團隊怎麼變小、角色怎麼變模糊

他拿傳統影視製作流程(從發展、前期製作、拍攝到後期製作)跟生成式AI流程對照:傳統流程裡「拍攝」這個階段需要大量分工的專業人員到場配合,光是主要工作人員就可能從十幾人一路擴編到上百人;生成式AI流程裡,「拍攝」這個階段幾乎整個被「產圖」取代,只要幾個人坐在電腦前就能完成,團隊規模因此可能壓縮到三到十五人。他歸納出三個趨勢:團隊會變得小而精、職位界線會模糊混合(一個人可能同時身兼美術與AI工具操作,或是導演、攝影師又同時會剪接)、團隊組成會依專案彈性配置。

三種用途分級:前期預覽、正式院線、社群短影音

他把生成式AI在影視產業的應用分成三個等級:前期視覺預覽(Previsualization)——快速產生動態分鏡與Lookbook,方便導演跟團隊或客戶溝通;正式院線/高品質劇集(Production Level)——目前AI比較像輔助角色,用在特效素材、場景延伸,核心表演仍然依賴真人演員,品質要求也最高;社群媒體短影音(Social Media)——AI已經可以做到快速生成、大量產出、風格轉換與自動剪輯配樂,效率很高,但他也直接引用前一位講者Sunny的說法,坦言這類內容很多時候就是網路上大量重複、沒有靈魂、純粹為了流量曝光的產物。

他也展示了幾個具體案例:用生成工具把一張手繪草圖分鏡跟參考圖合成出帶有一致角色與鏡頭的完整分鏡、把拍好的實物影片跟另一個物件合成進同一支影片、以及多張參考圖合成同一支影片裡的一致角色與服裝。

好萊塢的現狀:一半擁抱、一半抵觸

他分享了在洛杉磯當地觀察到的產業氛圍:亞洲對使用生成式AI工具相對開放,日本產業內部則有一部分抵觸;洛杉磯因為好萊塢工會文化根深蒂固,反應是一半一半——一部分人擔心自己的工作被取代而抵觸,另一部分人則像他自己一樣,直接把過去做不出來的劇本拿出來動手做。他也觀察到疫情之後整個產業的製作成本被持續刪減,資金更多流向串流平台與社群媒體,年輕世代也更習慣看短影音、直播而不是進電影院;即使外部在抵觸,大型製作公司內部其實也早就在開發自己的AI工具。他認為大型製作最終會走向「混合式(Hybrid)」路線,因為即使特效可以用AI輔助,真人演員的細節表演(他舉了演員站在那邊光靠一個眼神就有戲的例子)目前還無法被機器取代。

他也提到一則新聞:以《黑天鵝》聞名的導演,已經宣布要跟Google合作製作AI影片(經查,這裡對應到的應是Google DeepMind與Darren Aronofsky創辦的Primordial Soup工作室之間的合作案,見第七節),顯示好萊塢的一部分導演已經正式往這個方向邁進。

工具更新的速度:一個月抵一年

他提醒現場,視覺生成模型幾乎每兩週就會推出新功能,每天花個三十分鐘去看社群動態、追蹤工具更新,變成他維持專業的日常習慣。他用「保持一個平常心,順著這個流去走」形容自己面對工具快速迭代的心態,而不是死守著某一個特定工具或技巧。

第二個故事:跟五歲小孩學說故事

他分享了另一段經歷:朋友五歲的女兒可以拿著兩個玩偶,一下說他們是夫妻、一下說他們吵架,故事情節不斷變化卻毫無窒礙,讓他驚覺自己好久沒有這種創造力。他因此讓這位小朋友當「導演」,指揮他自己演一段情境(他躺在地上假裝病人),再把這段即興演出寫成提詞、上傳影片,實際做出一段生成內容。他也示範了把家裡隨手可得的道具(一盞燈想像成駭客任務裡的機器)透過生成工具轉譯成完全不同風格的畫面,藉此說明「不需要昂貴的設備,光靠想像力就可以開始玩」。

角色一致性沒有那麼容易

他也很坦白地指出,工具官方宣傳的「角色一致性」功能,實際操作起來需要大量試錯,很像抽扭蛋,不會一次就成功。他示範用自己的照片與另一張參考圖,透過Midjourney的Omni Reference功能,嘗試把自己的臉套進不同的風格(例如水彩與快打旋風、鐵拳混合的風格),也提到現在市面上有像Openart、Freepik、Krea這類一站式平台,可以在同一個地方切換使用不同的視覺模型(例如Kling 2.0)。

結論:擁抱不可控,美感判斷力才是門票

他最後留給大家一個問題:當所有人都能生成出吉卜力風格的圖片時,創作真正的價值是什麼?他認為答案會落在「美感教育」——懂得怎麼把一個風格拆解成筆觸、光線這些細節的人,接下來會很吃香,而這正是有文科背景、有創作經驗的人擅長的事。他也提醒不要害怕犯錯,因為生成式AI工具本來就不完全可控,與其追求完美,不如把這個不可控當成驚喜去擁抱。最後他強調:就算vibe coding出來的東西有錯誤,還是要去找工程師,因為工程師才是有經驗、可以告訴你東西好壞的人,所以不要停止學習。

3. 關鍵數據與案例

  • 傳統影視製作團隊規模可能從十幾人擴編到上百人,生成式AI流程下團隊可能壓縮到三到十五人(講者自述的產業觀察)。
  • Google於2025年5月發布Veo 3,並與《黑天鵝》導演Darren Aronofsky創辦的AI影片工作室展開合作(查證後見第七節)。
  • 他分享的AI影片工具功能比較涵蓋Luma Dream Machine、Runway、Sora、Pika Labs、Google Veo 2、Kling、Minimax Hailuo、Vidu、Wan 2.1、Hunyuan Video、Veo3,逐一比較文字轉影片、圖片轉影片、首尾幀控制、多參考圖、運鏡控制與動態筆刷等功能支援程度(此表整理自他當場展示的比較資料)。

4. 金句

  • 「就算vibe coding出來有錯誤,還是要找工程師,因為他才是有這個經驗,可以告訴你東西好壞的人,所以不要去停止學習。」
  • 「想像力是你的超能力。」
  • 「人間一月,GenAI一年,保持靈活,持續學習。」
  • 「當所有人都能創作,真正的價值是什麼?」

5. 提到的工具與名詞

  • Ø Studio:他共同創辦的AI創意工作室。
  • Runway(Gen-3):他多次提到用來生成影片、進行風格轉換與角色合成的工具,2024年推出的Gen-3 Alpha主打文字轉影片、圖片轉影片與動態筆刷等功能。
  • ComfyUI:他提到的進階節點式AI工作流工具,可以客製化特效並清楚追蹤每個生成步驟。
  • Pika Labs:他提到可以把物件合成進既有影片、或用多張參考圖合成同一支影片的工具。
  • Midjourney Omni Reference:Midjourney用來維持角色一致性的參考圖功能。
  • Kling:他提到的另一款視覺生成模型,可在一站式平台上選用。
  • Openart/Freepik/Krea:他提到的一站式AI視覺生成平台。
  • Google Veo 2/Veo 3:Google的影片生成模型,Veo 3於2025年5月發布,新增同步生成對白與音效的能力。

6. 延伸觀察

這場跟前面李怡志那場(見〈如何生成有效的圖騙〉)像是同一天的一體兩面:李怡志講的是生成式圖像怎麼被拿來騙人,Davis Chang講的是同一套技術怎麼讓原本沒有資源、沒有人脈的人開始說自己的故事。兩場合在一起看,其實指向同一個結論——工具本身沒有立場,真正決定它是騙術還是創作民主化的,是使用者的判斷力與意圖。他最後那句「就算vibe coding出錯還是要找工程師」,某種程度上也呼應了李怡志的收尾:技術門檻降低之後,人真正需要練的,是分辨好壞、真假的判斷力,而不是操作工具的手速。

7. 資料來源

項目來源
Davis Chang為Ø Studio聯合創辦人暨創意總監INSIDE 2025年會專訪
鋼琴家Ayşedeniz Gökçin的AI音樂計畫曾在TED AI San Francisco 2024、甘迺迪表演藝術中心等場館展出Wikipedia:Ayşedeniz GökçinStanford IT Community活動頁
Google DeepMind與《黑天鵝》導演Darren Aronofsky創辦的Primordial Soup工作室合作,使用Veo等生成式AI模型製作短片Google官方部落格Hollywood Reporter報導
Google於2025年5月發布Veo 3,具備同步生成對白、音效與環境音的能力Wikipedia:Veo (text-to-video model))
Runway Gen-3 Alpha官方功能介紹Runway官方研究頁
Midjourney Omni Reference(--ow參數)功能說明官方文件內容經搜尋摘要確認,未能開啟單一權威頁面逐字核對,標記為待查證
講者職稱、講題逐字、上台順序議程總覽.md