AI 生圖與影片
換三次隨機種子,AI還是把她畫成女將軍:一次角色一致性debug紀錄
同一個角色,前一個鏡頭穿粉色便服,下一個鏡頭變成黑色盔甲的女將軍。我的第一直覺是「換個種子重抽應該就會抽到對的」——結果連抽三次,三張全部都是盔甲加一整排士兵。這篇記錄我怎麼找到真正的根因,以及最後怎麼解決的。
問題:同一個角色,长相服裝說變就變
做AI短劇時,每個角色都有一張官方設定圖當參考,理論上每個鏡頭都應該長得一樣。但實際跑出來的16集裡,用戶回報好幾處「這個角色怎麼突然不一樣了」——最明顯的一次,是女主角在盛怒特寫鏡頭裡,服裝從她自己的粉色漢服變成整套黑棕色札甲,肩上還有金屬盔甲片,活像穿越去打仗。
第一次嘗試:換種子重抽
AI生成不穩定,換個隨機種子重新生成是最直覺的解法。我對同一個鏡頭、同一段提示詞,換了三個完全不同的種子重跑。
結果:三張圖幾乎一模一樣——都是黑棕色盔甲、背景都是一整排持矛的士兵,連構圖細節都高度相似。
這個結果本身就是答案:如果是隨機噪聲造成的問題,換種子應該會抽出不同結果,運氣好還能抽到對的。三次結果高度一致,代表問題不是隨機的,是提示詞本身觸發了某種系統性偏誤。
找根因:是哪個詞在作怪
回頭看提示詞,這個鏡頭的文字描述是「一個沉著的女性,臉色轉為盛怒,眼神鎖定、毫不退縮」(close-up of a composed woman’s face hardening into open fury, eyes locked and unflinching)。
我的推測:「fury」(盛怒)加上「eyes locked and unflinching」(眼神鎖定不退縮)這類措辭,疊加在古裝語境下,讓模型聯想到它訓練資料裡更常見的「女將軍/女武將」畫面類型,這個聯想的力道大到直接蓋過參考圖裡明明畫得很清楚的便服。
解法:正面提示詞直接講清楚
模型在低步數(Lightning 4步、cfg=1)這套配方下,負面提示詞在數學上根本不起作用,所以不能靠「不要盔甲」這種寫法。唯一有效的手段是正面斷言:明講這個角色現在實際穿什麼、場景是什麼。
加了一句「穿著跟參考照片一樣的粉色便服,不是盔甲、不是軍裝、不是士兵或將軍,這是一個沒有軍隊的茶館場景」之後,同一個種子重新生成——服裝完全修復回粉色漢服,速度沒有變慢,背景也正確變成茶館內景,而不是先前那種村莊/軍營畫面。
一個順便被推翻的假設
同一輪還測了另一個常見做法:「同時餵兩張參考圖」(這個角色的照片+這個角色在別的姿勢下的照片,理論上兩張圖能互相加強身分辨識)。
結果一樣觸發了「無中生有的軍隊畫面」——這是我們在這條AI短劇pipeline上第四次獨立測到同樣的失敗訊號,前後測過角色+場景組合、角色+角色組合,全部指向同一個結論:這套配方只要同時餵兩張參考圖進去,就容易觸發這種系統性幻覺,不是換哪兩張圖搭配的問題。
可遷移的心得
- 先確認問題是隨機的還是系統性的,再決定要不要多抽幾張碰運氣——如果換3個種子結果都一樣,代表抽再多次都不會抽到對的,得先找到觸發偏誤的具體詞彙。
- 低cfg/Lightning這類加速配方下,負面提示詞可能完全失效——遇到「AI自己加戲」的問題,先確認你用的加速方案還吃不吃負面提示詞,不吃的話只能靠正面斷言硬講清楚。
- 雙圖同時輸入這件事本身可能就是風險源,不是圖片內容選錯,值得在設計pipeline時提前列入已知風險。
這是一人公司公開實驗的一部分。想收到後續完整 SOP 與透明月報,訂閱電子報。