模型與訓練
Attention 是什麼?模型怎麼決定該看哪裡
Attention 是什麼?模型怎麼決定該看哪裡
「小明把書放在桌上,因為它太重了。」你一秒就知道「它」指的是書不是桌子。模型靠什麼做到同一件事?答案是注意力機制。
這是現代語言模型的核心零件。不用會算,但值得知道它在幹嘛。
你將學到什麼
定義
處理每個詞時,計算它跟其他詞的相關程度,依權重決定要參考誰。
白話比喻
像在會議室裡聽多人講話,你會自動把注意力分配給跟主題最相關的人。
為什麼重要
每個位置都能直接看到全部位置,長距離的關聯才抓得住。
代價
計算量隨序列長度快速增加,這是上下文長度會有上限的原因之一。
定義
注意力機制讓模型在處理每一個詞的時候,動態決定要參考序列裡的哪些詞。它會算出每一對詞之間的相關程度,再依照相關程度分配權重。
權重高的位置影響大,權重低的影響小。這個分配不是寫死的規則,而是模型從資料裡學出來的。
白話比喻
像你坐在一場多人會議裡。所有人都在講話,但你不會平均分配耳朵。
你會自動把注意力放在跟當下議題最相關的那幾個人身上,其他的當背景音。模型做的就是這件事,只是它對每個字都重算一次。
它解決了什麼問題
在注意力機制之前,序列模型是一個字一個字往下傳遞資訊。距離越遠,前面的訊息越容易被稀釋掉。
注意力讓每個位置都能直接看到全部位置,中間不需要接力。長距離的指涉與呼應因此才抓得住。
跟相近名詞的差別
| 名詞 | 它是什麼 | 關係 |
|---|---|---|
| Attention | 決定看哪裡的計算機制 | 零件 |
| Transformer | 以注意力為核心的模型架構 | 由這個零件組成 |
| Context Window | 模型一次能處理的長度上限 | 受注意力的計算成本影響 |
| KV Cache | 把算過的中間結果暫存起來 | 為了讓注意力不必重算 |
實際用例
你會在幾個地方間接遇到它。長文摘要時模型能抓出跨段落的主線、翻譯時代名詞對得上、程式碼補全時能對應到前面幾十行的變數。
另一個實務影響是 中段遺失:內容太長時,中間位置分到的注意力相對稀薄,重要資訊放在開頭或結尾通常比較安全。
最常見的誤解是把注意力權重當成模型的解釋。權重高只代表計算上參考得多,不等於「模型是因為這個原因才這樣回答」,兩者不能畫等號。
第二個誤解是以為注意力等於理解。它是一種相關性的加權運算,理解是這個運算堆疊很多層之後浮現的結果,不是機制本身。
延伸學習
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599

