自動化與 Agent
讓 AI 讀懂影片、又不燒爆 token 的完整做法
讀完你會懂為什麼不該讓 AI 逐幀看影片,以及一套省錢又保護隱私的替代做法;還會拿到一個「生成完影片怎麼自動檢查」的實作骨架。看懂約 10 分鐘,動手做約半天。
一個核心觀念
一支影片的資訊,大約九成在「語音」裡,不在「畫面」裡。
所以想讓 AI 理解一支影片,最貴又最笨的做法,就是把每一幀畫面都轉成 token 餵給模型。正確做法是:
先把語音轉成帶時間戳的文字當骨架,讓 AI 對文字推理;只有在真的需要判斷「某一格畫面對不對」時,才按需抽少數幾張截圖給它看。文字是預設,看圖是例外。
為什麼差這麼多?舉個實際比例:
- 逐幀硬吃:一支片 ≈ 30,000 幀 × 每幀 ≈ 1,500 token ≈ 4,500 萬 token(而且絕大多數是重複、無用的噪音)。
- 文字優先:帶時間戳的逐字稿 ≈ 十幾 KB 文字 + 幾張 PNG 截圖。
差好幾個數量級。token 就是錢和時間,這個選擇直接決定你的方案能不能落地。
Step 1|準備一支測試影片
先拿一支短的(1 分鐘內)來跑通流程,別一開始就上長片。
Step 2|抽出「聲音」和「少量畫面」,而不是全部畫面
用免費工具 FFmpeg 從影片裡:
- 抽出音訊(等下拿去轉文字)。
- 每隔幾秒抽一張截圖就好(不是每一幀)。
🪄 問 AI 的咒語(不會裝/不會用 FFmpeg)
「我是新手,作業系統是 (例:Windows 11 / macOS)。我想做的事:(例:用 FFmpeg 從一支 mp4 抽出音訊,再每 5 秒抽一張截圖)。請一步一步教我,指令可以直接複製,並說明每一步在做什麼。」
Step 3|把音訊轉成「帶時間戳的文字」
這一步叫「語音轉文字(transcription)」。重點是要帶時間戳(每句話對應影片第幾秒),這樣文字才能當骨架。兩條路:
- 雲端 API(最快上手,但要付費、音檔會上傳)。
- 本地跑(用你自己電腦的顯卡,免費、音檔不外傳)。有獨立顯卡的話強烈建議這條,長期免費又保護隱私。常見的本地方案關鍵字:Whisper / faster-whisper。
Step 4|讓 AI 先讀文字、需要時才看圖
把那份帶時間戳的逐字稿丟給 AI,先讓它根據文字回答(內容講了什麼、重點在第幾秒)。只有當問題牽涉到「畫面上長怎樣」時,才把 Step 2 抽的那幾張截圖給它。這就是省 token 的核心:大部分問題文字就能答,圖片只在必要時登場。
Step 5(進階)|如果你是用 AI 生成/剪輯影片:加一道「自檢閘門」
生成完不要直接當成品,先自動檢查幾個「一定要對」的點,不過就重做,最多 3 次。至少檢查這三項:
- 時長對不對:成品長度是不是跟你預期的差不多(差太多=中途斷掉或重複輸出)。
- 字幕有沒有落單字:一行字幕結尾只剩孤零零一個字,很醜,該檢查出來。
- 有沒有聲音軌:靜音成片是很常見的失敗,一定要擋。
你一定會踩的坑
- 轉文字沒帶時間戳=白做——很多轉錄工具預設只給你一整段純文字。沒有時間戳,你就沒辦法把「文字」對回「第幾秒的畫面」,整個文字骨架的價值就沒了。設定時一定要開「word-level / segment timestamps」。
- 本地轉錄「模型太小」中文會亂——本地方案有分模型大小。太小的模型(如 tiny/small)跑中文常常整句念錯、標點亂跳。中文建議至少用 medium 等級;顯存不夠再往下調。
- 自檢閘門最容易犯的錯:報太多假警告——第一版閘門對一支本來就正常的成片噴了 24 條警告,因為把「太常見、其實幾乎都對」的情況也拿去檢查。結果就是警告太多,人會直接全部無視,等於沒做。鐵律:高精度 > 高召回。寧可少報幾個、但報出來的每一個都是真問題。
- 「誤報」不一定是成品錯,可能是你的預期算錯——閘門說「影片比預期長了 0.8 秒」,一開始以為是 bug,查了才發現是生成流程刻意在結尾多留 0.8 秒收尾。判定「出錯」之前,先去看真實的設定與規格(ground truth),別急著下結論改東西。
🆘 萬用救援:卡住怎麼問 AI
「我是新手,作業系統是 。我想做的事:。請一步一步教我,指令可以直接複製,並說明每一步在做什麼。如果需要先安裝工具,也請告訴我怎麼裝、怎麼確認裝好了。」報錯時,把完整錯誤訊息原文貼上去,比自己轉述準得多。
一句話總結
處理 AI + 影音,先問一句「這一步真的需要看畫面嗎」——大多數時候,一份帶時間戳的文字就夠了,而且便宜好幾個數量級。
這是一人公司公開實驗的一部分。想收到後續完整 SOP 與透明月報,訂閱電子報。