AI 素養

AI Fluency 怎麼評量?三種取向、一套評量矩陣與十二種作業元件

評量 AI Fluency 要能分辨「只是背了幾句聰明 prompt」和「真的具備協作能力」的差別。課程給的解法是三種取向並用:成果導向看學生和 AI 做出了什麼、過程導向看協作歷程怎麼演變、反思導向看學生能不能說清楚為什麼。搭配 4D 各自的評量矩陣與作業元件,就能把看不見的協作能力變成可觀察、可評分的證據。
AI Fluency 怎麼評量?三種取向、一套評量矩陣與十二種作業元件:文章重點卡

AI Fluency 怎麼評量?三種取向、一套評量矩陣與十二種作業元件

教 AI Fluency 最棘手的問題不是教材,而是評量:你怎麼分辨一個學生只是抄了幾句好用的 prompt,還是真的在發展與 AI 協作的能力?考不出來的能力,教了也不知道有沒有教會。

這件事有一組很實用的工具可以處理:三種評量取向、每個 D 一份的評量矩陣(assessment matrix),還有一整份可以拆著用的作業元件指南。這篇把它們整理成你可以直接套用的樣子。

你將學到什麼

三種評量取向

成果、過程、反思各看什麼,為什麼最好三個一起用。

4D 各自怎麼評

Delegation 到 Diligence,每個能力在三種取向下的具體問法。

評量矩陣的用法

從矩陣長出 rubric、回饋語言與同儕互評的四個步驟。

作業元件與批改量

十二種可組裝的作業元件,以及應付爆量內容的四招。

三種取向:成果、過程、反思

有三種互補的評量取向。成果導向(outcome-based)看學生透過 AI 協作產出了什麼:有沒有達成宣稱的目標?過程導向(process-based)看協作歷程:迭代的模式、從失敗嘗試中復原的能力、方法上的成熟度。反思導向(reflection-based)看後設認知:學生能不能說清楚哪些策略有效、為什麼,以及下次要怎麼做。

核心主張最有效的 AI Fluency 評量會三種取向並用:不只評學生能和 AI 做出什麼,也評他們作為 AI 協作者是怎麼思考、怎麼成長的。評量本身要是一次學習機會,不只是一次測量。
AI Fluency完整圖像成果導向做出了什麼過程導向協作怎麼演變反思導向能不能說出為什麼
三種取向各看一個面向,合起來才是完整的 AI Fluency 圖像。

把三種取向套到 4D 上

每個 D 在三種取向下都有具體的問法。下表整理成濃縮版,你可以直接拿去對照自己的作業設計。

能力成果導向問什麼過程導向看什麼反思導向問什麼
Delegation分工計畫合理嗎?目標務實嗎?工具選對了嗎?附註解的對話紀錄裡,怎麼探索選項、做出決定還考慮過什麼替代方案?分工決定如何影響後續一切?
Descriptionprompt 清楚嗎?脈絡給足了嗎?從初版到終版怎麼演化?對話紀錄裡的迭代修正、失敗後的轉向、共享脈絡的累積哪些溝通策略最有效?為什麼?不同任務怎麼調整?
Discernment對 AI 產出的註解:哪裡強、哪裡弱、哪裡要再修當場抓錯與修正的證據、跨多次互動的模式辨識評估標準怎麼演變?一開始漏看了什麼?學到什麼?
Diligencediligence 聲明完整嗎?標註恰當嗎?有查核的證據嗎?對話紀錄裡的資料處理、敏感資訊的刻意迴避、確認規範的紀錄遇過什麼倫理兩難?如何理解自己的責任?

舉一個綜合例子:請學生在 AI 協助下寫一篇「生成式 AI 對社會的影響」的文章,繳交四樣東西:文章本身、AI 對話連結、diligence 聲明、學習日誌

評量時三個角度各看一樣:成果角度看文章與聲明(有沒有明顯的人為把關痕跡)、過程角度看對話紀錄(有沒有建立共享脈絡、有沒有修正軌跡)、反思角度看日誌(能不能說出什麼有效、什麼無效)。

評量矩陣:從「要看什麼」到 rubric

附上四份可自由改作的評量矩陣(CC BY-NC-SA 4.0 授權),每個 D 一份。每份矩陣都是同一個結構:先列出「強表現長什麼樣」的總綱,再分成果、過程、反思三列,每列給「要看什麼」(What to look for)與「強表現的證據」(Evidence of strong performance)兩欄。

例如 Delegation 的強表現是「探索目標、任務與工具能力三者的關係」;Description 的強表現包括「建立會在單一對話內與跨對話演化的高脈絡」;Discernment 要看「有領域專屬性的細緻評估標準」;Diligence 則要看「倫理思考貫穿全程,而不是只在最後檢查一次」。

矩陣的使用指引也很具體。要發展 rubric 有四步:挑出這份作業最相關的 D、為每個 D 選評量取向、把證據指標改寫成你的情境、定義表現等級(建議分 emerging、developing、proficient 三級)。給回饋時直接引用矩陣的欄位語言;做同儕與自我評量時,先把相關段落發給學生,讓他們自己找出自己能力的證據。

作業設計:三個原則與十二種元件

設計作業時有三個原則。真實性:作業要貼近真實世界的 AI 協作,而不是人工演練。迭代性:一次定生死的作業抓不到協作的迭代本質,要留出修正、重想、再試的機會。教學透明:明白告訴學生你評的是協作過程與反思的品質,不只是產出。

接著是可以拆著用、組著用的作業元件,Assignment Component Guide 一共給了十二種,每種都附學生版說明範本:

  • 成果導向四種:改良平庸的 AI 產出(先註解弱點再引導 AI 改到優秀)、多平台成果比較(同一任務用不同 AI 系統或模式做,交比較矩陣與建議報告)、限制條件挑戰(在明確的格式、長度、風格、受眾限制下與 AI 完成任務)、同儕作品互評(對照對方宣稱的目標評 AI 使用是否恰當、標註是否足夠)。
  • 過程導向四種:附註解的對話紀錄(標出轉折點、突破、失敗與復原)、即時旁白錄影(邊操作邊說出決策理由)、個人策略手冊(整理自己在不同任務類型的協作策略與品質檢查清單)、AI 或同儕協助的覆盤(把對話紀錄交給第三方一起找盲點)。
  • 反思導向四種:引導式提問(例如「描述一次 AI 讓你意外的時刻,它教了你什麼」)、學習日誌(定期記錄並每月綜整)、情境與案例分析(例如「新主管要你用 AI 做徵才決策,你的建議是什麼」)、個人政策聲明(把所學綜整成自己的 AI 協作原則文件)。
只能出一份反思作業的話,選哪個?答案很明確:選個人政策聲明(personal policy statement)。讓學生寫下自己的 AI 使用倫理原則、決定何時與 AI 協作的標準、品質底線、透明度承諾與不跨越的界線。它逼出最深的反思,也讓學生對自己的 AI 互動感到有主導權、有責任感,還很適合接同儕討論。

現實面:內容量會爆炸,先想好怎麼改

這些作業產生的內容量遠超過傳統作業,有四招可以管理:一、用顆粒很細的交付物 rubric,能快速核對學生是否完成,前提是交付物要和學習目標對得很緊;二、善用自我與同儕互評,設計得好的互評能把大量 AI 產出濃縮成教師能及時回應的東西;三、用五分鐘口頭快評取代部分書面回饋,短短的討論常比長篇評語更有價值;四、選擇性抽樣:教學生自己標記關鍵時刻供你檢閱,不必逐字讀完每份對話紀錄。

最大的收穫是心態上的:評量 AI Fluency 不是抓學生有沒有用 AI,而是把「怎麼用得好」變成可以觀察、可以練習、可以回饋的東西。把矩陣發給學生、把評量標準攤開講,評量就從防弊變成教學的一部分。

參考出處本文取材自 Anthropic 官方 Claude Academy 免費課程「Teaching AI Fluency」,由酒Ann 消化後以自己的視角重新編寫。想看英文原版課程,可到 Claude Academy 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

評量 AI Fluency 為什麼不能只看最後交出來的作品?
因為成品看不出協作品質。兩個學生可能交出相似的成果,但一個是反覆迭代、抓錯修正後的產物,另一個只是照抄別人的 prompt。過程與反思的證據才能區分表面操作與深層能力。
什麼是評量矩陣(assessment matrix)?
課程為 4D 各提供一份矩陣,每份都列出成果、過程、反思三種評量重點下「要看什麼」與「強表現的證據長什麼樣」,並附上發展 rubric、給回饋、同儕與自我評量的使用指引,是設計評分標準的起點。
過程很私密又稍縱即逝,要怎麼評?
課程的解法是讓學生自己把過程變成可繳交的東西:附註解的對話紀錄、邊做邊講的螢幕錄影、個人策略手冊(process playbook),或與 AI 或同儕進行結構化覆盤,都能把看不見的決策變可見。
這些作業會產生大量內容,改得完嗎?
課程給了四招:用顆粒很細的交付物 rubric 快速核對、善用自我與同儕互評、用五分鐘的口頭快評取代部分書面回饋、教學生自己標記重點段落供教師抽樣,不必逐字讀完每份對話紀錄。