自動化與 Agent

讓 AI 讀懂影片、又不燒爆 token 的完整做法

讀完你會懂為什麼不該讓 AI 逐幀看影片,以及一套省錢又保護隱私的替代做法;還會拿到一個「生成完影片怎麼自動檢查」的實作骨架。看懂約 10 分鐘,動手做約半天。

2026/07/09

一個核心觀念

一支影片的資訊,大約九成在「語音」裡,不在「畫面」裡。

所以想讓 AI 理解一支影片,最貴又最笨的做法,就是把每一幀畫面都轉成 token 餵給模型。正確做法是:

先把語音轉成帶時間戳的文字當骨架,讓 AI 對文字推理;只有在真的需要判斷「某一格畫面對不對」時,才按需抽少數幾張截圖給它看。文字是預設,看圖是例外。

為什麼差這麼多?舉個實際比例:

差好幾個數量級。token 就是錢和時間,這個選擇直接決定你的方案能不能落地。

Step 1|準備一支測試影片

先拿一支短的(1 分鐘內)來跑通流程,別一開始就上長片。

Step 2|抽出「聲音」和「少量畫面」,而不是全部畫面

用免費工具 FFmpeg 從影片裡:

🪄 問 AI 的咒語(不會裝/不會用 FFmpeg)

「我是新手,作業系統是 (例:Windows 11 / macOS)。我想做的事:(例:用 FFmpeg 從一支 mp4 抽出音訊,再每 5 秒抽一張截圖)。請一步一步教我,指令可以直接複製,並說明每一步在做什麼。」

Step 3|把音訊轉成「帶時間戳的文字」

這一步叫「語音轉文字(transcription)」。重點是要帶時間戳(每句話對應影片第幾秒),這樣文字才能當骨架。兩條路:

Step 4|讓 AI 先讀文字、需要時才看圖

把那份帶時間戳的逐字稿丟給 AI,先讓它根據文字回答(內容講了什麼、重點在第幾秒)。只有當問題牽涉到「畫面上長怎樣」時,才把 Step 2 抽的那幾張截圖給它。這就是省 token 的核心:大部分問題文字就能答,圖片只在必要時登場。

Step 5(進階)|如果你是用 AI 生成/剪輯影片:加一道「自檢閘門」

生成完不要直接當成品,先自動檢查幾個「一定要對」的點,不過就重做,最多 3 次。至少檢查這三項:

你一定會踩的坑

  1. 轉文字沒帶時間戳=白做——很多轉錄工具預設只給你一整段純文字。沒有時間戳,你就沒辦法把「文字」對回「第幾秒的畫面」,整個文字骨架的價值就沒了。設定時一定要開「word-level / segment timestamps」。
  2. 本地轉錄「模型太小」中文會亂——本地方案有分模型大小。太小的模型(如 tiny/small)跑中文常常整句念錯、標點亂跳。中文建議至少用 medium 等級;顯存不夠再往下調。
  3. 自檢閘門最容易犯的錯:報太多假警告——第一版閘門對一支本來就正常的成片噴了 24 條警告,因為把「太常見、其實幾乎都對」的情況也拿去檢查。結果就是警告太多,人會直接全部無視,等於沒做。鐵律:高精度 > 高召回。寧可少報幾個、但報出來的每一個都是真問題。
  4. 「誤報」不一定是成品錯,可能是你的預期算錯——閘門說「影片比預期長了 0.8 秒」,一開始以為是 bug,查了才發現是生成流程刻意在結尾多留 0.8 秒收尾。判定「出錯」之前,先去看真實的設定與規格(ground truth),別急著下結論改東西。

🆘 萬用救援:卡住怎麼問 AI

「我是新手,作業系統是 。我想做的事:。請一步一步教我,指令可以直接複製,並說明每一步在做什麼。如果需要先安裝工具,也請告訴我怎麼裝、怎麼確認裝好了。」報錯時,把完整錯誤訊息原文貼上去,比自己轉述準得多。

一句話總結

處理 AI + 影音,先問一句「這一步真的需要看畫面嗎」——大多數時候,一份帶時間戳的文字就夠了,而且便宜好幾個數量級。