模型與訓練
Loss Function 損失函數是什麼?模型怎麼知道自己錯了
Loss Function 損失函數是什麼?模型怎麼知道自己錯了
模型不會看著答案說「啊我錯了」。它需要一個可以計算的錯誤指標,而那個指標就是損失函數。
這是理解訓練的第一顆零件。沒有它,模型連往哪裡改都不知道。
你將學到什麼
定義
把預測值與真實值之間的差距換算成一個數字的函數。
白話比喻
像考卷的扣分規則。分數低代表扣得少,模型考得好。
訓練在做什麼
算損失、算梯度、更新參數、再算一次,重複到損失收斂。
怎麼挑
看任務。回歸常用 MSE 或 MAE,分類常用交叉熵。
定義
損失函數衡量模型的預測值與真實值差多少,並把它變成一個數字。數值越小,代表差距越小,模型表現越好。
訓練的目標就是找出一組參數,讓所有訓練資料上的損失總和或平均降到最小。
白話比喻
損失函數就像成績分數,只是方向相反:分數越低代表模型越好。
而且它不只算對錯,還算「錯得多離譜」。同樣是答錯,差一點跟差很多扣的分不一樣,模型才知道該用多大的力氣去修正。
訓練是怎麼跑的
流程是一個固定的循環:輸入訓練資料、模型做出預測、用損失函數算出差距、再由優化器沿著讓損失下降最快的反方向去更新參數。
然後回到第一步再跑一次。損失值一開始掉得很快,接著越來越慢,最後幾乎不動,那就是收斂了。
常見的幾種損失函數
| 名稱 | 適用任務 | 特點 |
|---|---|---|
| MSE 均方誤差 | 回歸,預測連續數值 | 懲罰大誤差較重,對離群值敏感 |
| MAE 平均絕對誤差 | 回歸 | 對離群值比較不敏感,更穩健 |
| Binary Cross Entropy 二元交叉熵 | 二分類,答案是零或一 | 常與 Sigmoid 輸出搭配 |
| Categorical Cross Entropy 多類別交叉熵 | 多分類 | 常與 Softmax 輸出搭配 |
實際用例
以判斷病人有沒有生病的二分類為例。真實值是一而模型給出零點九,損失很小;真實值是一卻只給零點一,損失就會大很多。
模型會透過降低這些「大損失」的樣本,把整體平均拉下來,預測也就越來越準。你在微調時看到的那條下降曲線,量的就是這件事。
最常見的誤解是以為損失值可以跨模型比較。不同任務、不同損失函數算出來的數字尺度不一樣,零點三不一定比一點二好,只有同一套設定下的前後比較才有意義。
第二個誤解是把損失降到零當成目標。損失為零通常代表模型把資料背下來了,那是過度擬合,不是學會了。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

