AI 素養

AI 的能力與限制:一張框架看懂它為什麼又強又會出錯

AI 不是均勻地聰明或均勻地不可靠,它沿著四個可預測的軸線又強又弱:下一個 token 預測、知識、工作記憶、可操控性。關鍵洞察是強項和弱點來自同一個機制:AI 寫得流暢是因為它是模式補全引擎,會幻覺也是因為它是模式補全引擎。理解這四個性質與它們的邊界,你就能校準信任,而不是全盤相信或全盤拒絕。
AI 的能力與限制:一張框架看懂它為什麼又強又會出錯:文章重點卡

AI 的能力與限制:一張框架看懂它為什麼又強又會出錯

同一個 AI,昨天幫你把報告改得漂漂亮亮,今天卻一本正經地掰出一條不存在的文獻。它到底是聰明還是不可靠?答案是:都是,而且原因是同一個。AI 寫得流暢動人,因為它是模式補全引擎;它會產生幻覺,也因為它是模式補全引擎。同一枚硬幣的兩面。

這份框架是 AI Fluency 4D 框架的姊妹篇:4D 講的是人該具備的協作能力,這份框架講的是那些能力所回應的機器性質。你沒辦法準確評估一個 AI 產出,除非你心裡有一個「這個產出是怎麼來的」的模型。這篇把四個核心性質整理給你。

你將學到什麼

AI 的性格從哪來

預訓練造出文件補全器,微調把它訓練成助理,兩階段各留下指紋。

四個核心性質

下一個 token 預測、知識、工作記憶、可操控性,每個都是連續帶不是開關。

能力區與邊界

同一個機制一直在跑,差別只在你的任務落在帶上的哪個位置。

錯誤的組合來源

幻覺引文、長對話漂移、自信算錯數學,都是兩個性質相遇的結果。

先說清楚:這裡講的 AI 是哪種 AI

「AI」這個詞涵蓋的範圍太廣。世界上現在跑著的 AI 大多不是生成式的:推薦影片的引擎、信箱的垃圾信過濾、刷卡盜刷偵測、客服電話的分流系統,全都是 AI,但它們做的是排序、分類、預測,不生成任何東西。近年改變一切的是生成式 AI:產生新內容(文字、圖像、程式碼、音訊、影片)的系統。

這份框架針對的是其中以 transformer 為基礎的文字模型,也就是你在聊天機器人與寫作助理裡對話的那種,一次預測一個 token 地把回應寫出來。

AI 的性格是怎麼來的:兩個階段

AI 為什麼會想幫忙?為什麼有禮貌?為什麼會拒絕某些要求?

這些都不是天生的,是分階段造出來的。第一階段是預訓練:讓模型讀海量文字,只練一件事:「給定目前為止的內容,預測接下來是什麼」,重複數十億次。練出來的不是助理,是一台文件補全器

問它「美國總統是誰」,它不會回答問題,只會朝統計上最像的方向把文件寫下去:也許接一堂公民課、也許列出歷任總統、也許出一份測驗。它沒有「你」的概念,也沒有「幫忙」的概念。

第二階段是微調:先用「好的助理行為長這樣」的示範例子再訓練一次,然後用獎勵訊號把它推向多數人偏好的良好、安全回應。它在這裡學會把你的輸入當成請求、學會回答而不是漫談、學會拒絕有害的要求、學會在不確定時說「我不確定」。

但要記住:助理行為是罩在文件補全器上面的一層訓練外衣,而那層外衣的形狀來自人類對「什麼是好回應」的判斷。

四個核心性質:每個都是連續帶

每個性質都是連續帶(continuum)而不是開關:同一個機制一直在運轉,變的只是你的任務落在帶上的哪裡。落在能力區,你體驗到的是強項;漂到邊緣,同一個機制就變成限制。功力就在於學會判斷邊緣在哪。

性質它回答的問題能力區邊緣地帶
下一個 token 預測答案從哪裡來?摘要、改寫、解釋常見概念這類「路走得很熟」的任務新穎、罕見、需要分辨「真的」與「像真的」的任務
知識AI 到底知道什麼?訓練資料中頻繁、近期、一致的主題罕見、太新、小眾、有爭議的主題;截止日之後的世界
工作記憶AI 現在注意著什麼?材料舒服地裝進 context window、對話在當下進行文件太長、對話太久、期待跨對話的記憶
可操控性我有多少控制權?簡短、具體、可驗證的指令長推理鏈、抽象指令、需要原生精確度的算術與邏輯

幾個值得展開的細節。下一個 token 預測是整份框架裡解釋力最強的一件事:系統不是在查找答案,是在逐字書寫答案,它更接近一台無比精密的自動完成,而不是搜尋引擎。知識那條的自我檢查句很好用:別問「AI 知道嗎」,問「這件事在它讀過的東西裡有多常出現」。

工作記憶是四個性質中唯一常見「懸崖」而非「漸層」的:在視窗內一切都好,超出去就是突然斷裂。

可操控性則要記住:會聽指令不等於理解指令,模型執行你的指示的方式跟它做其他事一樣,都是在延續模式,你的字面與你的意圖之間永遠有縫隙,多數有趣的失誤就住在那道縫裡。

真實世界的失誤,多半是兩個性質相遇

四個性質不是各自獨立運作,它們無時無刻在互動,多數真實世界的失誤是兩個性質相遇的結果。

幻覺引文token 預測:生成看似合理的內容+ 知識:模型不自知的缺口格式完美,出處不存在長對話漂移工作記憶:早期脈絡淡出+ 可操控性:後來的指令蓋掉先前的聊越久越忘記一開始的要求自信地算錯數學token 預測:流暢與正確脫鉤+ 可操控性:沒有原生的數量感對數字跑模式,不是在計算附和錯誤前提訓練出的傾向:討好(sycophancy)+ token 預測:順著你的框架接下去你錯它也跟著錯,還很客氣
四種典型失誤,每一種都是兩個機器性質交會的產物。

這張圖的用法是反向診斷:下次 AI 出錯時,先辨認它是哪一種錯。引文查無此文?那是 token 預測遇上知識缺口,解法是要求來源並自己查證。

改到後面越改越歪?那是工作記憶遇上可操控性,解法是開新對話、把關鍵要求重新整理進去。數字兜不攏?

別叫它「再算一次」,給它工具或自己驗算。它一直順著你?換個問法,請它專門挑你的毛病。

目標不是背下所有錯誤,而是校準信任

流暢的 AI 使用,不是記住每一種失誤模式,而是心裡帶著一個小小的機器模型,清晰到當事情出錯時,你認得出這是哪一種錯、定位得出自己漂到了連續帶的哪裡,然後對症下藥。

這讓你能夠校準信任:不是全盤給予,也不是全盤收回,而是知道在哪些任務上可以放手、在哪些任務上要瞇著眼睛看。

值得一提的是,這份框架自己就附了一份 AI diligence 聲明,誠實交代哪些部分由 Claude 起草研究、哪些判斷由人類做成與查核,並在 Claude 的自我評估與外部證據不一致時採信外部證據。這正是 4D 框架裡 Transparency Diligence 的示範:把 AI 的角色講清楚,然後為成品負責。工具怎麼用,作者自己先做了一次給你看。

參考出處本文取材自 Anthropic 官方 Claude Academy 免費課程「AI Capabilities and Limitations」,由酒Ann 消化後以自己的視角重新編寫。想看英文原版課程,可到 Claude Academy 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

AI 為什麼會產生幻覺(hallucination)?
因為它不是在查答案,而是在一個字一個字地寫答案:根據「什麼通常接在什麼後面」生成看起來合理的內容。當任務碰到知識的缺口,而模型不知道那裡有缺口時,模式補全就會填進貌似可信但不真實的東西,例如一條格式完美卻不存在的引文。
AI 的知識為什麼有時準有時不準?
模型的知識來自訓練資料,在訓練結束的那一刻凍結(knowledge cutoff)。訓練資料裡出現頻繁、近期、一致的主題(主流科學、熱門程式語言)很可靠;罕見、太新、小眾或有爭議的主題就靠不住。該問的不是「AI 知道嗎」,而是「這件事在它讀過的東西裡有多常出現」。
什麼是 context window(工作記憶)?
AI 當下能注意到的所有東西:你的指示、上傳的文件、先前的回應,都裝在一個固定大小的工作區裡。超出視窗的內容它就看不到,而且預設每個新對話都從空白開始。這是四個性質中邊界最硬的一個:常常不是漸漸變差,而是好好的突然就不行了。
怎麼下指令 AI 最聽話?
指令越短、越具體、越可驗證,控制力越高:「用表格回覆」「一百字以內」「照這個格式」。推理鏈越長、指令越抽象、任務越需要原生精確度(算術、形式邏輯),控制力就越衰減。要問的不是「我的指示夠不夠好」,而是「我的字面和我的意圖之間有多少縫隙」。