Chernger, your changer.

AI 瑕疵檢測資料怎麼準備?OK/NG 樣本、標註、切分與再訓練 SOP

模型在測試集上分數很漂亮,上線第二週換了一批料,就開始過殺。

多數時候問題不在模型,在資料。這一頁把資料準備拆成一套 SOP。瑕疵怎麼分類、要收幾張、標註怎麼對齊、資料怎麼切,以及上線後什麼時候要重訓。

晟 技術審閱:晟格科技 AOI 應用工程團隊
最後實質更新:2026 年 9 月 14 日

AI 模型換批就不準?

帶著現有影像、標註規則和模型結果來。我們先看資料切分和標註一致性,再談要不要調模型。

帶資料來評估 → 先看樣本數量

先講結論:資料不對,調參數救不回來

影響 AI 模型的因素很多:資料正確性、資料量、訓練代數、訓練方法、模型架構和超參數。排在頭一位的是資料正確性。標錯的圖越多,模型越認真學錯的東西。

我們接到「模型不準」的案子,會先查三件事。標註規則有沒有寫下來?測試集跟訓練集是不是同一批料拍的?光源和治具這半年有沒有動過?這三題有一題答不出來,先別動 learning rate。

先記住這句:模型能學到的,只有影像裡真的有的訊號。光場沒把瑕疵拍出來,換什麼模型都補不回來。

開始之前,先把瑕疵分類寫成圖例

「刮傷」這兩個字,品保、產線和工程師想的長度可能差十倍。沒有圖例就開始標註,等於讓每個標註的人自己訂規格。

欄位 要寫什麼 沒寫的話會怎樣
類別名稱 刮傷、髒污、缺角、異物,一類一個名字 同一種瑕疵被標成兩個類別,模型學到互相打架
圖例 每類至少一張典型 NG、一張剛好過關的 OK 邊界靠口頭描述,換個人就標得不一樣
判定邊界 長度、面積或對比到多少算 NG 灰色地帶一半標 OK、一半標 NG
嚴重度 關鍵瑕疵或外觀瑕疵 驗收時所有類別被合在一起算分數

類別分太細,每類湊不到樣本。分太粗,模型要在一個類別裡同時學會兩種長相。實務上可以先分粗一點,等某一類樣本夠多、又確實要分開處理,再拆出來。

另外留一個「無法判定」的類別。標註的人拿不定主意時放這裡,不要硬塞進 OK 或 NG。

要收多少張:我們手上用的三組數字

「要幾張才夠」沒有單一答案,因為用途不一樣。下面三組數字來自不同階段,請對照您現在要做的是哪一件事。

用途 NG 品 OK 品 說明
初步評估:看 AI 有沒有學習效果 40 PCS 以上 — 低於這個量,很難判斷是方法不行還是樣本不夠
初步評估:NG 湊不到 10 PCS 現有的全部 200 PCS 先用 OK 品把「正常」建起來,再用少數 NG 畫界線
驗證評估 盡量涵蓋每一種瑕疵 500–1000 PCS 重點是批次和表面狀態的涵蓋,不是總張數
缺陷自動分類(每一類) 約 40 張以上 — 類別越多,總張數跟著乘上去

我們在精密微電子機台上,把模型訓練分成三級。C 級 NG 至少 20 pcs、OK 至少 100 pcs,訓練 1–3 小時。B 級 NG 200–500 pcs、OK 500–1000 pcs,約 1 天。A 級 NG 500–1000 pcs、OK 1000–2000 pcs,要 3–5 天。

這組分級是那台機台的料件條件,不能直接套到別的產品。但它說明了一件事:樣本多一個量級,訓練時間和能要求的穩定度也跟著跳一級。

NG 真的很少時:良率已經很高、NG 樣品湊不出來的案子,我們不會先把 AI 寫進規格。先試傳統演算法配合合適的光源,或評估只用正常樣本建模的異常偵測,通常比硬訓練分類模型穩。

兩個人標同一張,結果要一樣

標註不一致,是模型分數卡住不動的常見原因。同一張刮傷,A 標了、B 沒標,模型只會學到「這種東西有時候算、有時候不算」。

  1. 1 把圖例印成標註規則書

    分類表、每類圖例、判定邊界和「無法判定」的處理方式,寫成一份文件。規則書要有版本號,改一次就升一版。

  2. 2 抽一小批讓兩個人各自標

    兩人互相看不到對方結果。標完比對,把不一致的圖全部挑出來。

    不一致的比例高,代表規則書還不夠清楚。先改規則,不要急著大量標註。

  3. 3 爭議圖交給品保定案

    定案的結果補進規則書當圖例。這批爭議圖通常就是您產線上的灰色地帶,對模型的價值也特別高。

  4. 4 大量標註時定期抽查

    每隔一段時間抽一批重標,確認標註的人沒有隨時間鬆掉。

訓練、驗證、測試要照批次切,不是隨機切

同一顆料件拍了五個角度,隨機切的話,可能三張進訓練、兩張進測試。模型在測試集上認得出來,是因為它看過同一顆的兄弟,不是因為它學會了。

資料集 用途 怎麼切比較安全
訓練集 讓模型學 涵蓋多個批次、正常亮度浮動與允許的擺放變化
驗證集 調參數、選模型 跟訓練集不同顆料件,能不同批次更好
測試集 最後打分數,只用一次 整批或整段日期完全不參與訓練與調參

測試集被拿來反覆調參,它就變成了第二個驗證集。分數會越調越高,產線表現卻不會跟著變好。

切分結果要跟資料版本一起存檔。三個月後有人問「這個分數是用哪一批測的」,要答得出來。

前處理和資料增強,只模擬真的會發生的變化

不規則、低對比的瑕疵,用 OpenCV 一條一條寫規則,可能耗上很久還寫不穩。這正是 AI 派得上用場的地方。但前處理做得粗,AI 一樣救不了。

  • 先切出有效檢測區(ROI)。背景和治具不要讓模型去學
  • 大圖先切塊,切塊要有重疊,每一塊都要能對回整張圖的座標
  • 原始影像一定保留。前處理後的圖可以拿來訓練,爭議時要回得去看原圖

資料增強是用現有影像變出更多樣本。它能補的是產線上真的會發生、但樣品裡剛好沒拍到的變化。

增強方式 適合的時候 要小心的地方
旋轉、翻轉 料件在產線上本來就會轉向 有方向性的瑕疵或文字,翻過來就變成另一種東西
亮度、對比微調 光源衰減、批次色差確實存在 調幅超過產線實際範圍,模型會學到假的變化
模糊、加雜訊 送料時確實會輕微拖影 細微瑕疵可能被模糊掉,標籤卻還是 NG
裁切、平移 定位有公差 瑕疵被裁出畫面,標籤卻沒跟著改

增強後的資料只放進訓練集。驗證集和測試集要保持產線原本的樣子。

上線之後,什麼時候該重新訓練

模型交機那天的分數,只代表那天的料件、光源和治具。產線會變,資料就會漂。

出現這些狀況,先查資料再決定要不要重訓

  • 換原料、換供應商,或製程參數改過
  • 光源換新或明顯衰減。燈什麼時候該換,請用亮度掉到多少來定
  • 量產跑出評估時沒見過的瑕疵
  • 誤判或人工複判的件數,連續幾天往上爬
  • 同一批 OK 品,這週判出來的分數跟上個月不一樣

重訓不是把新圖丟進去重跑就好。新增的影像一樣要照規則書標註、照批次切分。新模型要用同一套測試集比過舊模型,確認關鍵瑕疵沒有退步,才換上線。

版本要能對回去:每一個上線的模型,都要對得到資料版本、標註規則書版本、超參數和測試結果。客訴回來時,才查得出當時是哪一版在判。

廠商說「給我們 50 張照片就能訓練」時,請先問兩題:那 50 張裡有幾類瑕疵?測試集要從哪一批來?答得出來的,才是真的想過產線。

我們做 AI 案子,會請您的品保一起簽標註規則書。這一步比較花時間,但模型判錯的時候,雙方回頭查的是同一份規則,不是各自的記憶。

把現有影像和標註規則帶來

請提供代表性的 OK/NG 影像和目前的瑕疵分類方式。也請說明訓練與測試資料怎麼切,模型現在卡在哪一類。我們會回覆問題比較可能出在成像、標註、切分還是模型,以及下一步該補哪一批資料。

由工程人員回覆 | 1–2 工作天 | 可先從不涉機密的樣品與需求摘要開始