模型與訓練
Evaluation 評測是什麼?用一套固定標準看 AI 到底做得好不好
Evaluation 評測是什麼?用一套固定標準看 AI 到底做得好不好
改了一版提示詞,覺得回答變好了。但真的變好了嗎?還是只是這次剛好抽到一個好答案?
沒有評測,你所有的優化都建立在直覺上。而直覺在多輪迭代之後,一定會騙你。
你將學到什麼
定義
用固定的測試集與評分標準,客觀衡量 AI 產出品質,讓不同版本可以被比較。
白話比喻
像期中考。同一份考卷考不同的人,才知道誰比較強,而不是憑印象。
跟誰容易搞混
常跟 Benchmark 基準測試與 Review 檢查混用,三者的對象與時機不同。
定義
評測是用一組固定的測試題目與明確的評分標準,去衡量 AI 產出的品質。重點在於「固定」:題目不變、標準不變,得到的分數才可以互相比較。
它要回答的問題很具體:這一版比上一版好嗎?好多少?在哪一類題目上退步了?沒有評測,這三個問題都只能用感覺回答。
白話比喻
評測就是期中考。同一份考卷考不同的人,才知道誰比較強。如果每次考卷都不一樣,分數再高也說明不了什麼。
所以評測集一旦定下來就不要隨便改。要擴充可以新增題目,但舊題目要留著,否則歷史成績就斷了。
跟相近名詞的差別
| 名詞 | 評的是什麼 | 誰在用 |
|---|---|---|
| Evaluation 評測 | 你自己的應用在你的任務上表現如何 | 開發者與使用者,針對自家場景 |
| Benchmark 基準測試 | 模型在公開標準題庫上的分數 | 模型供應商與研究單位,跨模型比較 |
| Review 檢查 | 單次產出有沒有問題 | 使用當下的即時把關 |
簡單記法:基準測試比的是模型本身,評測比的是你的整套做法,檢查看的是眼前這一份輸出。
實際用例
客服機器人可以準備一百題真實客戶問題,標註期望答案與必須提到的重點,每次改版都跑一次,看答對率與漏答率。
知識庫問答則可以評兩件事:檢索有沒有找到正確的來源,以及生成的答案有沒有超出來源亂講。這兩個要分開評,才知道問題出在哪一段。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
HE101|Harness Engineering Foundation(3 小時)
三小時的地圖課,不是操作課。把 Model 與 AI System 分開,拆解一套 AI Harness 的八個組成(Goal、Context、Knowledge、Rules、Tools、Workflow、Evaluation、Iteration),再帶你逆向拆解四個你已經在用的系統,最後畫出自己的第一張 Harness Blueprint。5 章 27 課,附學員講義 PDF 與術語速查表。
NT$ 2,599

