AI 生圖與影片
我只給了小說原文:AI 生出一部 16 集短劇的第一次嘗試
我做的事情只有一件:把《水滸傳》林沖篇的原文貼給 AI。角色是誰、長什麼樣子、鏡頭怎麼切、每一句台詞怎麼配音、16 集怎麼剪——一句分鏡腳本我都沒寫過。這篇記錄第一次真的跑完全程之後,我看片時發現的問題,以及後來怎麼揪出根因的過程。
輸入只有一份 txt,輸出是 16 集
流程長這樣:小說原文 → AI 拆角色(畫出每個人的設定圖)→ AI 寫短劇大綱 → AI 寫劇本 → AI 分鏡(每一鏡的鏡頭語言、對白、時間點)→ AI 生成每一鏡的關鍵幀圖片 → AI(MiniMax H3)把關鍵幀變成會動、會對嘴說話、帶環境音的短片 → 串接成 16 集。
我輸入的只有小說原文這一份文字檔。中間所有創作決策——這個角色該長什麼樣子、這一幕該用什麼運鏡、這句台詞該用什麼語氣——都是 AI 自己決定的。這是第一次把這整條鏈路跑完,我想記錄下真實的結果,包括不完美的地方。
看片時發現的問題,比想像中更具體
實際看完 16 集,最先跳出來的是一個很戲劇性的畫面:某一集開頭,公堂上的官員看起來像穿越到民國時代的西式法庭,還打了領帶。這不是我猜的,是把成片一幀一幀抽出來比對才確認的——因為對照組(AI 生成的關鍵幀圖片本身)完全是對的,宋代官服、烏紗帽、朱漆公案,一個西式元素都沒有。
問題出在更下游一層:負責把靜態關鍵幀變成動態影片的模型,看到提示詞裡「court clerk」「case ledger」這類英文詞彙時,會自己聯想到它訓練資料裡更常見的「西式/近代法庭劇」畫面,蓋過了關鍵幀裡明明畫對的服裝。換句話說,圖是對的,影片生成那一步自己加戲加錯了。
換 seed 沒用,才確定不是運氣問題
修完這個之後,又發現另一個角色在某幾個鏡頭裡,服裝跟長相會前後不一致——同一個人,前一秒粉色便服,下一秒變成黑色盔甲武將。第一直覺是「換個隨機種子重抽應該就會抽到對的」,畢竟這是很多人處理 AI 生成不穩定性的常見做法。
實際測了三個完全不同的隨機種子,結果三張全部是同一種盔甲武將的畫面,連構圖細節都高度相似。這證明了問題不是運氣,是提示詞裡「憤怒」「眼神銳利」這類情緒詞彙,疊加古裝的語境,讓模型系統性地聯想到「女將軍」的畫面——不管換幾次種子都一樣。
找到真正的根因之後,解法反而簡單:在提示詞裡明講「便服、不是盔甲、這是茶館場景不是戰場」,同一個種子重跑一次,服裝就完全修復,速度也沒有變慢。這次的心得是:先確認問題是隨機的還是系統性的,再決定要不要多抽幾張碰運氣——如果是系統性偏誤,抽再多次都不會抽到對的,得先找到觸發偏誤的具體詞彙。
老實說:還沒完全解決
16 集裡有 4 集已經套用了目前找到的修法,其餘 12 集還是最原始的版本,可能藏著同樣的服裝/場景不一致問題。這是為什麼你在影片裡偶爾會看到同一個角色長得不太一樣——這不是我沒發現,是還在修的過程中,先把第一次真實的產出公開,讓大家看到 AI 內容生成目前實際做得到什麼程度、卡在哪裡。下一步會繼續排查其餘角色的一致性問題,修好會再更新。
字幕也是這次的一個小發現:直接用語音辨識轉錄出來的文字,會出現不少同音字錯誤(武俠用語對語音辨識模型來說是生詞,「灑家」被聽成「九家」這種)。後來改成直接從劇本原文+分鏡時間點反推字幕時間軸,字幕內容直接就是準確的,不需要校對。
完整系列
16 集全部上架在 YouTube 播放清單「AI生影片初體驗」,歡迎去看實際成果、也歡迎留言告訴我你看到哪裡「怪怪的」——這些回饋會直接變成下一輪要修的清單。
這是一人公司公開實驗的一部分。想收到後續完整 SOP 與透明月報,訂閱電子報。