模型與訓練

Evaluation 評測是什麼?用一套固定標準看 AI 到底做得好不好

Evaluation 評測,簡稱 Eval,是用預先準備好的測試題目與明確的評分標準,客觀衡量 AI 產出品質的做法。它把「感覺變好了」變成可比較的數字,讓你在換模型、改提示詞或調參數時,知道究竟是變好還是變差。
Evaluation 評測是什麼?用一套固定標準看 AI 到底做得好不好:文章重點卡

Evaluation 評測是什麼?用一套固定標準看 AI 到底做得好不好

改了一版提示詞,覺得回答變好了。但真的變好了嗎?還是只是這次剛好抽到一個好答案?

沒有評測,你所有的優化都建立在直覺上。而直覺在多輪迭代之後,一定會騙你。

你將學到什麼

定義

用固定的測試集與評分標準,客觀衡量 AI 產出品質,讓不同版本可以被比較。

白話比喻

像期中考。同一份考卷考不同的人,才知道誰比較強,而不是憑印象。

跟誰容易搞混

常跟 Benchmark 基準測試與 Review 檢查混用,三者的對象與時機不同。

定義

評測是用一組固定的測試題目與明確的評分標準,去衡量 AI 產出的品質。重點在於「固定」:題目不變、標準不變,得到的分數才可以互相比較。

它要回答的問題很具體:這一版比上一版好嗎?好多少?在哪一類題目上退步了?沒有評測,這三個問題都只能用感覺回答。

白話比喻

評測就是期中考。同一份考卷考不同的人,才知道誰比較強。如果每次考卷都不一樣,分數再高也說明不了什麼。

所以評測集一旦定下來就不要隨便改。要擴充可以新增題目,但舊題目要留著,否則歷史成績就斷了。

跟相近名詞的差別

名詞評的是什麼誰在用
Evaluation 評測你自己的應用在你的任務上表現如何開發者與使用者,針對自家場景
Benchmark 基準測試模型在公開標準題庫上的分數模型供應商與研究單位,跨模型比較
Review 檢查單次產出有沒有問題使用當下的即時把關

簡單記法:基準測試比的是模型本身,評測比的是你的整套做法,檢查看的是眼前這一份輸出。

實際用例

客服機器人可以準備一百題真實客戶問題,標註期望答案與必須提到的重點,每次改版都跑一次,看答對率與漏答率。

知識庫問答則可以評兩件事:檢索有沒有找到正確的來源,以及生成的答案有沒有超出來源亂講。這兩個要分開評,才知道問題出在哪一段。

常見誤解第一個誤解是「試了幾題感覺不錯就算通過」,樣本太少時運氣的影響遠大於實力。第二個是只看總分不看分類,總分沒動但某一類題目大幅退步,上線後就會踩雷。
本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

評測要準備什麼?
三樣東西:一組固定不變的測試題目、每題的期望輸出或評分標準、以及一個能重複執行的流程。缺了固定測試集,比較就沒有意義。
評分一定要人工嗎?
不一定。有標準答案的題目可以自動比對,開放式產出可以用另一個模型當評審打分,再抽樣人工複核。實務上多半混用。
多久該跑一次?
每次要改動提示詞、換模型、調參數或更新知識庫之前跑一次基準,改完再跑一次對照。這樣才知道改動有沒有效。