科技執法 AI 影像辨識誤判率多少才能上線?
準確率門檻怎麼訂、人工複核與抽查比例怎麼設計

作者:邦邦(瑪尼國際 工程師)· 2026 年 8 月 · 閱讀時間約 9 分鐘

「這套系統的辨識準確率是 99%,可以上線了嗎?」——科技執法案子走到系統測試階段,機關承辦人最常問的就是這一句。問題在於,這個問句本身就少了三個條件:99% 是怎麼算的、錯的那 1% 是哪一種錯、以及錯了之後誰擋得住。少了這三個條件,AI 影像辨識的準確率只是一個沒有辦法拿來做決定的數字。

更精確地說:準確率門檻不是技術問題,是風險分配問題。模型的能力決定「錯誤有多少」,但「錯誤要不要流到民眾手上」是由人工複核的分流設計決定的。兩件事分開處理,門檻才訂得出來;混在一起談,就會變成廠商報一個好看的百分比、機關簽收,然後在申訴案件上升時才發現對不上帳。

這篇文章不談規格書的條文怎麼寫——那部分請見科技執法標案規格書怎麼寫裡的準確率四要件(測試條件/樣本/判定基準/複驗機制)。這篇只談三件事:門檻的數字怎麼推算出來、人工複核怎麼分流、抽查比例訂多少才有統計意義。

先把三個被混用的數字拆開

驗收會議上最常見的失焦,是所有人都在討論一個叫「準確率」的數字,但每個人心裡想的都不是同一件事。真正要分開列的是下面三組。

誤判與漏判:代價完全不對等,不能合併成一個數字

誤判(沒有違規卻被判定違規)會造成錯誤舉發,後果是民眾申訴、行政救濟、機關信譽受損,而且每一件都需要人力善後。漏判(確實違規卻沒有被抓到)的後果只是執法效果打折,不會有人因此受害。把兩種錯誤加總成一個「準確率 99%」,等於把代價相差極大的兩件事平均掉——一套誤判 0.1%、漏判 1.9% 的系統,和一套誤判 1.9%、漏判 0.1% 的系統,在紙上準確率一模一樣,實際風險天差地遠。規格書與驗收報告都應該要求兩個數字分開列。

逐字元與逐張:同一份測試結果可以差 5 個百分點

車牌辨識的正確率有兩種算法。逐字元計算是把每個字元分開算對錯;逐張計算是整面車牌全部正確才算對。兩者的換算是乘冪關係:逐字元正確率 99%,套到一面六字元的車牌上,整面全對的機率約為 94.1%(0.99 的 6 次方),也就是每一百面裡有將近六面至少錯一個字。而舉發實務上,車牌錯一個字這張單就是錯的,沒有「錯一半」這種東西。問廠商報的是哪一種,比問數字本身更重要。

辨識與判定:兩層模型,不能共用一個門檻

「認出車牌是哪幾個字」和「判斷這個行為構成哪一條違規」是兩件事,難度也不同。車牌辨識有明確答案、可以逐張對答案;違規態樣判定則牽涉到時間、位置、號誌狀態與行為連續性的綜合認定,主觀成分較高。實務上應該分違規態樣各報一組誤判與漏判:有號誌連動可以佐證的態樣,與需要判讀行為意圖的態樣,本來就不該套用同一個門檻。

還有一個容易被忽略的變因是測試集的組成。日間、晴天、無遮蔽的樣本本來就容易辨識,如果夜間、雨天、逆光、車牌污損或部分遮蔽的樣本只佔測試集的一小部分,平均數字自然會很漂亮。要求分場景列出結果,並且由機關自行提供未經廠商挑選的現地影像複驗,是最省力也最有效的一道防線。整條資料流從影像辨識到紅單寄達各有哪些環節,可對照科技執法一條龍全流程解析逐段檢視。

門檻怎麼訂?從「每月可容忍幾件錯單」回推

不要一開始就問「準確率要幾趴」。這個問法沒有錨點,最後多半是抄別的標案的數字,或是接受廠商建議的數字。可以落地的問法是倒過來走:先確定機關能承受什麼後果,再回推模型要達到什麼水準。

需要先回答的只有三個問題:本機關每月的案件量級距是多少、每月最多可以承受幾件錯誤舉發流到民眾手上、承辦人力每月最多能複核幾件。這三個數字機關手上都有,或至少估得出來,而且都不需要技術背景。

回推的順序

① 可容忍錯單件數 ÷ 月案件量 = 複核後可接受的錯誤率上限
② 複核後錯誤率上限 ÷ (1 - 人工複核攔截率) = 複核前模型誤判率門檻
③ 需複核件數 × 單件複核秒數 ÷ 3600 = 每月複核工時(回頭檢查人力撐不撐得住)

用一組試算把它走一遍。假設某交通隊每月案件量約 10,000 件(各警察機關的實際量體差異很大,我們協力建置的單位落在每月 1,000 至 20,000 件之間),機關評估每月最多可以承受 5 件錯誤舉發,那麼複核後的錯誤率上限就是 0.05%。若人工複核對誤判的攔截率保守估在 95%,模型本身的誤判率門檻大約是 1%——也就是每月會有 100 件誤判案件被送進複核佇列,其中 95 件被攔下、5 件流出。

這組試算真正的價值不在那個 1%,而在於它逼出了兩個平常不會被寫下來的假設:複核攔截率是多少、以及機關對錯單的容忍值是多少。攔截率若只有 80%,同樣要守住每月 5 件,模型誤判率門檻就得壓到 0.25%,難度差了四倍。這個推導過程應該寫進機關的內部評估文件,而不是留在會議室的口頭討論裡。

最容易出錯的一件事:門檻訂在複核前還是複核後

AI 判定在完整的入案流程中只是預審分流,最終舉發與否一律由承辦人員複核裁決。因此對外說明時該講的是複核後的錯誤率,對廠商驗收時該量的是複核前的模型指標。兩個數字混用,會出現兩種典型爭議:機關拿複核後的低錯誤率去驗收,等於把自己人力的功勞算給廠商;或是廠商拿模型指標對外宣稱系統整體錯誤率,一旦有錯單見報就沒有人說得清楚責任在哪一段。合約與對外說帖都要標明每一個百分比是在哪一個環節量的。

人工複核不必全件看:信心值分流的三層設計

把每一件都送人工複核,安全但撐不久;全部信任模型自動放行,快但沒有人擋得住錯誤。實務上可行的中間解,是用模型輸出的信心值設兩道門檻,把案件分成三層,各走各的路。

第一層:高信心 — 進抽查池,不逐件複核

信心值在上界門檻以上的案件,經系統自動彙整後進入舉發流程,僅以固定比例抽查。這一層通常佔案件量的大宗,也是分流設計省下人力的主要來源。

前提:上界門檻必須經過校準驗證,見下方「門檻怎麼定」。

第二層:中信心 — 全件人工複核

落在兩道門檻之間的案件逐件由承辦人員判斷。這一層是誤判攔截的主戰場,介面設計要讓複核者能在同一畫面看到原始影像、辨識結果、信心值與判定依據,減少切換視窗的時間。

單件複核耗時是可量測的驗收指標,也是人力估算的輸入值。

第三層:低信心 — 不進舉發流程

信心值低於下界門檻,或影像品質不足、車牌被遮蔽污損、辨識結果與車籍資料不一致的案件,直接退回或轉人工重新判讀,不進入舉發程序。這一層要記錄退件原因分布,它是攝影機角度、鏡頭髒污或路口環境變化最早的預警訊號。

退件原因若集中在單一路口或單一時段,通常是硬體問題而非模型問題。

兩道門檻該定在哪裡

不要直接採用模型預設值。正確做法是用一批已知答案的歷史樣本,畫出「信心值區間 vs 該區間的實際正確率」的校準曲線,再找出實際正確率穩定達到目標水準的切點作為上界。這一步之所以不能省,是因為模型輸出的信心值本身並不等於機率——信心值 0.95 不代表這件有 95% 是對的,兩者的關係必須用資料量出來。沒有校準就設門檻,等於用一把沒有刻度的尺在量。

另一個實務上的取捨是:上界門檻拉得越高,高信心層越小、越安全,但中信心層會膨脹,複核人力可能直接爆掉。門檻不是越嚴越好,它是一條準確率與人力之間的取捨曲線。因此系統必須把兩道門檻做成後台可調參數,而且每次調整都要留下稽核軌跡:誰調的、什麼時候調的、調整前後各層的案件比例與錯誤率變化。這件事在驗收時要實際操作一次,不能只看規格書寫有支援。這類參數與稽核紀錄同時牽涉權限分級與資料保存,機關若採委外維運,平台端的網站代管責任範圍、備份頻率與存取紀錄保存期限應一併寫進契約。

抽查比例怎麼訂才有統計意義

抽查最常見的誤解,是把它當成「多抓幾件錯的」。實際上高信心層的錯誤本來就稀少,靠抽查去撈個案效率極低。抽查真正的目的是估計高信心層的實際錯誤率——也就是驗證「當初設的上界門檻現在還成不成立」。目的講清楚了,樣本數就有算法。

估計比例所需的樣本數取決於要求的精度,而不是母體有多大(母體遠大於樣本時,母體大小的影響可以忽略)。在 95% 信心水準下的保守估算是 n ≈ 0.25 ÷ 誤差²

要求的估計精度所需樣本數實務意義
正負 5 個百分點 約 385 件 只能看出大方向,不足以判斷門檻是否需要調整
正負 3 個百分點 約 1,068 件 適合上線初期每月的例行監看
正負 1 個百分點 約 2,401 件 適合模型改版前後的對照驗證,成本較高

把樣本數換算成比例才是可執行的排程。以每月 10,000 件、高信心層佔 70%(7,000 件)為例,要達到正負 3 個百分點的精度,每月要抽 1,068 件,約為高信心層的 15%——這對多數交通隊是不切實際的。務實的做法是分階段:上線前三個月採較高比例(例如高信心層的 10%)建立基準,指標穩定後降到 1% 至 3% 的例行水準,並改用季度累積樣本來取得需要的精度。

抽查比例要自動回升的六個觸發條件

  • 模型改版或重新訓練——新版本的信心值分布會位移,舊門檻不一定還適用。
  • 攝影機更換、位移或維修後復位——角度差幾度,辨識條件就變了。
  • 路口工程或標線重劃——判定違規態樣的參考基準改變。
  • 季節性光線變化——日照角度與日落時間隨月份移動,逆光時段會跟著移。
  • 申訴或撤銷率上升——外部訊號,通常比內部指標晚,但最不容易自欺。
  • 新增違規態樣或新增路口——尚未累積樣本的部分,一律視為新系統重新建立基準。

還有一個常被忽略的細節:抽查必須盲抽。如果介面上把抽查件標示出來,複核人員自然會格外謹慎,估出來的錯誤率就會系統性偏低,失去監看的意義。抽查結果至少要記錄三欄——抽查件數、判定不成立件數、推估錯誤率與信賴區間——並且逐月留存,才能看出趨勢而不是只看單月數字。

上線後要盯的五個數字與複核人力試算

系統驗收通過只是起點。門檻與分流設計是活的,路口環境、車流結構與模型版本都會變,因此需要一組固定的月報指標。建議固定看下面五個。

每月固定監看的五項指標

  • 三層分流比例:高/中/低信心層各佔多少。比例明顯位移,通常代表現場條件或模型版本變了。
  • 高信心層抽查推估錯誤率:附信賴區間。這是上界門檻是否仍成立的直接證據。
  • 中信心層複核推翻率:人工把 AI 判定改掉的比例。推翻率長期偏低,代表這一層其實可以往高信心層挪,省下人力。
  • 低信心層退件原因分布:集中在特定路口或時段,優先查硬體與環境,不要急著調模型。
  • 舉發後的申訴與撤銷率:從外部驗證整套設計的指標,但有數週到數月的延遲,不能拿來當即時控制訊號。

人力面則用一條算式就能估。以前面的例子推算:每月 10,000 件、需全件複核的中信心層佔 30%(3,000 件),單件複核以 30 秒計,等於每月 25 小時;再加上抽查 1% 的高信心層(70 件)約 0.6 小時。相比傳統人工逐案登打的每件 5 至 10 分鐘,同樣的案件量差距是數量級的。這條算式也是談 SLA 與人力編制時最有說服力的依據——它把「要不要導入」從感覺變成可以算的帳。

最後補一個上線節奏的建議:不要直接切換,要設並行期。讓新系統與既有作業對同一批案件各跑一次,比對雙方判定的差異件,差異率收斂之後再正式切換。並行期通常一到三個月,看起來多花人力,但這是少數能在真實案件上驗證門檻與分流設計的機會,比測試環境跑出來的數據可靠得多。多模型交叉驗證與高可用架構的技術背景,可另參2026 科技執法趨勢解析

瑪尼國際深耕資訊服務 20 年、服務逾 500 家企業,並以協力廠商身分參與新竹市、新竹縣、宜蘭縣、苗栗縣、新北市、金門警察局交通隊及鐵路警察局台北分局的入案系統建置與維運。機關若正在評估準確率門檻該怎麼訂、複核分流的參數該怎麼設,或想估算導入後的複核人力,我們可以依實際路口條件與月案件量提供技術說明。從 AI 辨識、複核介面、M3 資料界接到後端主機維運都在同一個技術體系內完成,是一條龍服務對機關最實際的價值;成效公開專區與宣導頁面的網頁設計也可一併納入同一案處理。系統的完整技術規格與資安設計,請見智慧警政科技執法系統方案頁。

常見問題

Q:科技執法的 AI 影像辨識誤判率要低到多少才能上線?

沒有一個放諸各機關皆準的數字,因為門檻要從機關自己可以承受的後果回推,而不是從技術規格挑一個好看的百分比。建議的算法是先問三個問題:本機關每月案件量級距多少、每月最多可以承受幾件錯誤舉發流到民眾手上、承辦人力每月最多能複核幾件。把可容忍的錯單件數除以月案件量,得到的就是複核後可接受的錯誤率上限;再依人工複核的攔截能力往前推,才會得到模型本身的誤判率門檻。特別要注意門檻是訂在複核前還是複核後,兩者差距很大:AI 判定在完整的入案流程中只是預審分流,最終舉發與否由承辦人員複核裁決,所以對外承諾的是複核後的錯誤率,對廠商驗收的則是複核前的模型指標,兩個數字不能混用。

Q:科技執法系統的人工複核,一定要每一件都看嗎?抽查比例怎麼訂?

不一定要全件複核,但要用信心值分層,而不是憑感覺放行。實務上的做法是設兩道門檻把案件分成三層:高信心層進入抽查池、中信心層全件人工複核、低信心層不進舉發流程直接退回或轉人工重判。抽查的目的是估計高信心層的實際錯誤率,不是把每一件錯的都抓出來,所以樣本數取決於要求的估計精度而非母體大小。在 95% 信心水準下,若要把錯誤率的估計誤差控制在正負三個百分點,樣本數約需一千件出頭;要控制在正負一個百分點,樣本數則要兩千四百件左右。建議上線前三個月採高比例抽查,指標穩定後再降低,並保留模型改版、攝影機更換或位移、路口工程與申訴率上升時自動回升抽查比例的機制。抽查必須盲抽,抽出的案件不要在介面上標示為抽查件,否則複核人員會特別謹慎,估計值就失真了。

Q:廠商說 AI 車牌辨識準確率 99%,這個科技執法數字要怎麼判斷好不好?

先追問三件事,數字才有意義。第一是計算單位:逐字元計算與逐張車牌整面計算差很多,若逐字元正確率為 99%,一面六字元車牌要全部正確的機率約為 94.1%,等於每一百面就有將近六面至少錯一個字。第二是誤判與漏判的組成:把兩種錯誤合併成一個準確率會掩蓋真正的風險,沒違規卻被判違規的誤判會造成錯誤舉發與行政救濟,違規沒被抓到的漏判只是執法效果打折,兩者代價並不對等,必須分開列出。第三是測試場景的組成:日間標準場景本來就容易,夜間、雨天、逆光、車牌污損或遮蔽的樣本若只佔測試集的一小部分,平均數字會被稀釋得很好看。要求廠商分場景、分違規態樣列出誤判與漏判兩個數字,並以機關自行提供、未經廠商挑選的現地影像複驗,比追問一個總平均百分比有用得多。

想先算一次貴單位的準確率門檻與複核人力?

提供月案件量、路口數與現行複核人力,我們可以協助推算合理的誤判率門檻、三層分流比例與每月複核工時。

預約技術諮詢 →

免費諮詢專線 0800-670000

📞 技術支援(24小時):0921-070-027  |  📞 免費諮詢:0800-670000 📍 411 台中市太平區育賢路366號4樓之2  |  ✉ mani@mani.com.tw