AI 瑕疵檢測資料怎麼準備?OK/NG 樣本、標註、切分與再訓練 SOP
模型在測試集上分數很漂亮,上線第二週換了一批料,就開始過殺。
多數時候問題不在模型,在資料。這一頁把資料準備拆成一套 SOP。瑕疵怎麼分類、要收幾張、標註怎麼對齊、資料怎麼切,以及上線後什麼時候要重訓。
最後實質更新:2026 年 9 月 14 日
先講結論:資料不對,調參數救不回來
影響 AI 模型的因素很多:資料正確性、資料量、訓練代數、訓練方法、模型架構和超參數。排在頭一位的是資料正確性。標錯的圖越多,模型越認真學錯的東西。
我們接到「模型不準」的案子,會先查三件事。標註規則有沒有寫下來?測試集跟訓練集是不是同一批料拍的?光源和治具這半年有沒有動過?這三題有一題答不出來,先別動 learning rate。
開始之前,先把瑕疵分類寫成圖例
「刮傷」這兩個字,品保、產線和工程師想的長度可能差十倍。沒有圖例就開始標註,等於讓每個標註的人自己訂規格。
| 欄位 | 要寫什麼 | 沒寫的話會怎樣 |
|---|---|---|
| 類別名稱 | 刮傷、髒污、缺角、異物,一類一個名字 | 同一種瑕疵被標成兩個類別,模型學到互相打架 |
| 圖例 | 每類至少一張典型 NG、一張剛好過關的 OK | 邊界靠口頭描述,換個人就標得不一樣 |
| 判定邊界 | 長度、面積或對比到多少算 NG | 灰色地帶一半標 OK、一半標 NG |
| 嚴重度 | 關鍵瑕疵或外觀瑕疵 | 驗收時所有類別被合在一起算分數 |
類別分太細,每類湊不到樣本。分太粗,模型要在一個類別裡同時學會兩種長相。實務上可以先分粗一點,等某一類樣本夠多、又確實要分開處理,再拆出來。
另外留一個「無法判定」的類別。標註的人拿不定主意時放這裡,不要硬塞進 OK 或 NG。
要收多少張:我們手上用的三組數字
「要幾張才夠」沒有單一答案,因為用途不一樣。下面三組數字來自不同階段,請對照您現在要做的是哪一件事。
| 用途 | NG 品 | OK 品 | 說明 |
|---|---|---|---|
| 初步評估:看 AI 有沒有學習效果 | 40 PCS 以上 | — | 低於這個量,很難判斷是方法不行還是樣本不夠 |
| 初步評估:NG 湊不到 10 PCS | 現有的全部 | 200 PCS | 先用 OK 品把「正常」建起來,再用少數 NG 畫界線 |
| 驗證評估 | 盡量涵蓋每一種瑕疵 | 500–1000 PCS | 重點是批次和表面狀態的涵蓋,不是總張數 |
| 缺陷自動分類(每一類) | 約 40 張以上 | — | 類別越多,總張數跟著乘上去 |
我們在精密微電子機台上,把模型訓練分成三級。C 級 NG 至少 20 pcs、OK 至少 100 pcs,訓練 1–3 小時。B 級 NG 200–500 pcs、OK 500–1000 pcs,約 1 天。A 級 NG 500–1000 pcs、OK 1000–2000 pcs,要 3–5 天。
這組分級是那台機台的料件條件,不能直接套到別的產品。但它說明了一件事:樣本多一個量級,訓練時間和能要求的穩定度也跟著跳一級。
兩個人標同一張,結果要一樣
標註不一致,是模型分數卡住不動的常見原因。同一張刮傷,A 標了、B 沒標,模型只會學到「這種東西有時候算、有時候不算」。
- 1 把圖例印成標註規則書
分類表、每類圖例、判定邊界和「無法判定」的處理方式,寫成一份文件。規則書要有版本號,改一次就升一版。
- 2 抽一小批讓兩個人各自標
兩人互相看不到對方結果。標完比對,把不一致的圖全部挑出來。
不一致的比例高,代表規則書還不夠清楚。先改規則,不要急著大量標註。
- 3 爭議圖交給品保定案
定案的結果補進規則書當圖例。這批爭議圖通常就是您產線上的灰色地帶,對模型的價值也特別高。
- 4 大量標註時定期抽查
每隔一段時間抽一批重標,確認標註的人沒有隨時間鬆掉。
訓練、驗證、測試要照批次切,不是隨機切
同一顆料件拍了五個角度,隨機切的話,可能三張進訓練、兩張進測試。模型在測試集上認得出來,是因為它看過同一顆的兄弟,不是因為它學會了。
| 資料集 | 用途 | 怎麼切比較安全 |
|---|---|---|
| 訓練集 | 讓模型學 | 涵蓋多個批次、正常亮度浮動與允許的擺放變化 |
| 驗證集 | 調參數、選模型 | 跟訓練集不同顆料件,能不同批次更好 |
| 測試集 | 最後打分數,只用一次 | 整批或整段日期完全不參與訓練與調參 |
測試集被拿來反覆調參,它就變成了第二個驗證集。分數會越調越高,產線表現卻不會跟著變好。
切分結果要跟資料版本一起存檔。三個月後有人問「這個分數是用哪一批測的」,要答得出來。
前處理和資料增強,只模擬真的會發生的變化
不規則、低對比的瑕疵,用 OpenCV 一條一條寫規則,可能耗上很久還寫不穩。這正是 AI 派得上用場的地方。但前處理做得粗,AI 一樣救不了。
- 先切出有效檢測區(ROI)。背景和治具不要讓模型去學
- 大圖先切塊,切塊要有重疊,每一塊都要能對回整張圖的座標
- 原始影像一定保留。前處理後的圖可以拿來訓練,爭議時要回得去看原圖
資料增強是用現有影像變出更多樣本。它能補的是產線上真的會發生、但樣品裡剛好沒拍到的變化。
| 增強方式 | 適合的時候 | 要小心的地方 |
|---|---|---|
| 旋轉、翻轉 | 料件在產線上本來就會轉向 | 有方向性的瑕疵或文字,翻過來就變成另一種東西 |
| 亮度、對比微調 | 光源衰減、批次色差確實存在 | 調幅超過產線實際範圍,模型會學到假的變化 |
| 模糊、加雜訊 | 送料時確實會輕微拖影 | 細微瑕疵可能被模糊掉,標籤卻還是 NG |
| 裁切、平移 | 定位有公差 | 瑕疵被裁出畫面,標籤卻沒跟著改 |
增強後的資料只放進訓練集。驗證集和測試集要保持產線原本的樣子。
上線之後,什麼時候該重新訓練
模型交機那天的分數,只代表那天的料件、光源和治具。產線會變,資料就會漂。
出現這些狀況,先查資料再決定要不要重訓
- 換原料、換供應商,或製程參數改過
- 光源換新或明顯衰減。燈什麼時候該換,請用亮度掉到多少來定
- 量產跑出評估時沒見過的瑕疵
- 誤判或人工複判的件數,連續幾天往上爬
- 同一批 OK 品,這週判出來的分數跟上個月不一樣
重訓不是把新圖丟進去重跑就好。新增的影像一樣要照規則書標註、照批次切分。新模型要用同一套測試集比過舊模型,確認關鍵瑕疵沒有退步,才換上線。