ChatGPT 實戰

AI 會唬爛,還能信嗎?用 ACHIEVE 框架挑對問題

想把生成式 AI 用得值得信賴,重點不是逼它不出錯,而是挑對問題:選那些答案容易驗證、答錯了也有價值、風險低、且在你專業範圍內的任務。課程提出的 ACHIEVE 框架把合適用法歸納為五類:協助人類協調、砍掉繁瑣雜務、提供安全網、激發思考與創意、讓好點子快速放大。
AI 會唬爛,還能信嗎?用 ACHIEVE 框架挑對問題:文章重點卡

AI 會唬爛,還能信嗎?用 ACHIEVE 框架挑對問題

「AI 會一本正經地胡說八道,所以不能用。」這句話我聽過無數次,而 Vanderbilt 大學的 Trustworthy Generative AI 這門課,開場就把這個說法翻了過來:幻覺(hallucination)不是故障,是特性。拿它來腦力激盪、編故事、發想點子,能無中生有正是它的價值;只有當你用錯地方,幻覺才變成災難。

所以「值得信賴的生成式 AI」不是一個更乖的模型,而是一套挑問題的眼光:哪些任務交給它是安全又划算的,哪些從一開始就不該交給它。這篇整理課程第一個模組給我的幾把尺,以及授課教授 Jules White 提出的 ACHIEVE 框架。

你將學到什麼

幻覺是特性

先弄懂它為什麼編東西,才知道何時該防。

不是事實來源

生成事實靠不住,導航與過濾才是正解。

挑問題的尺

好驗證、錯了也有價值、風險低、在專業內。

ACHIEVE 框架

五類合適用法,指向擴增智慧而非取代人。

先接受一件事:它不是事實來源

課程裡有個讓我印象很深的示範。教授請 ChatGPT 介紹「Vanderbilt 大學的 Jules White」,也就是他自己。模型流暢地生出一段履歷:助理教授、某年加入 Vanderbilt、貢獻卓著。聽起來可信,但其中職稱是過時的、加入年份是憑空生的。它生成的是「看起來像事實的文字」,不是事實

課程給的心智模型是:把它當「計算引擎」而不是搜尋引擎。它能對你給它的材料做很了不起的推理、歸納、改寫,但你不給材料、只叫它憑記憶生事實,就是在抽獎。

同一個道理反過來說:搜尋服務之所以能結合 AI,是因為先檢索出真實文件,再請模型「摘要這些結果」,而不是請模型自己發明結果。

挑問題的幾把尺

那什麼問題適合交給它?課程第一個模組給了幾條非常實用的判斷標準,我把它整理成四把尺:

  • 驗證要便宜:如果你在乎正確性,檢查答案的成本必須遠低於自己做。像填字遊戲的答案,一眼就能核對規則,錯了也只是重來;反例是課程裡「把電腦科學翻成古巴比倫楔形文字」的示範,驗證它得去找真正的專家,那還不如一開始就去找專家。
  • 答錯了也有價值:腦力激盪、列選項、打草稿這類任務,重點是啟動你的思考,對錯根本不是重點。十個點子裡有三個不可行,剩下七個仍然是你原本想不到的。
  • 風險要低:答錯會傷到人的事不要交給它。「我吃這個藥安全嗎」是反面教材;把問題改成「我該問醫師哪些問題」,風險就從決策移回了對話。
  • 要在你的專業內:專家看得出草稿裡的錯,所以敢放心用它衝速度;外行看不出來,就等於把方向盤交給了運氣。誠實盤點自己的專業範圍,是安全使用的前提。

兩個特別安全的操作:過濾與導航

課程點名了兩種天生就容易驗證的用法。第一是過濾:把一批資料給它,請它挑出符合條件的子集合,並保留原始編號或行號。

因為輸出必然是輸入的子集,你可以逐項核對「這真的在原始清單裡嗎」,摘要時再請它在每句話後面附上支持該句的原文行號,查證就從苦工變成順手的事。

第二是導航:處理敏感資訊時,別讓它「生成」答案,讓它「帶路」。課程用醫療 App 舉例:病人問「我的下次回診是什麼時候」,與其讓模型生成一個可能是編的時間,不如讓它回答「這個資訊在預約排程頁」,甚至直接把使用者帶到那個畫面。

帶錯路只是小小的挫折,生成錯誤的回診時間卻是真實的傷害,兩種錯的代價天差地遠。

ACHIEVE:五類值得做的事

課程的核心主張是「擴增智慧」(augmented intelligence):AI 不是來取代你的替代品,而是「心智的動力外骨骼」,放大你的創造力與解題能力。ACHIEVE 框架就是把這個理念落成五類具體的用法:

ACHIEVE:擴增智慧的五類用法放大人的能力,而不是取代人A 協助協調摘要會議、找出計畫裡的模糊與衝突之處C 砍掉雜務歸類問卷回覆、整理資料把時間留給真正的思考H 安全網審視簡報與計畫在出包前先抓到錯IEV 激發思考讓它當懷疑者提出尖銳問題刺激你跳出自己的框架E 放大點子把一個好構想批量展開做到一個人做不到的規模
ACHIEVE 框架:五類把生成式 AI 用在刀口上的方式

課程用「籌辦一場教師工作坊」把五類用法從頭走了一遍,我覺得特別有說服力。協調:把會議紀錄丟給它,請它列出計畫裡的模糊之處、以及兩個小組的決議哪裡互相衝突。雜務:把報名表單的開放式回答丟給它,一句話就完成受眾分群,還能隨口再要三種不同的分法。

安全網:上傳簡報,請它找出「對這批聽眾來說沒定義過的術語」。激發:請它「扮演我內容的懷疑者,提出十個尖銳的問題」。放大:為每個系所的與會者客製一則專屬的示範提示,這種規模的客製化,一個人手工做根本不可能。

一切的前提:輸出永遠是草稿

貫穿整門課的一句話是:把所有輸出當草稿,事實查核、修訂、改進是你的工作。課程講得很直白:如果你的用法只是複製問題、貼上答案、原封不動交出去,那你做的事本身就能被自動化,被取代的不是被 AI,而是被「會用 AI 的人」。

反過來,把輸出當起點去編輯、質疑、疊上你的專業,它就是你能力的放大器。

修完這個模組,我自己的改變是動手前多問一句:這個任務答錯了會怎樣、我驗證得了嗎。光這一句,就已經把大部分的風險擋在門外了。

本文源起本文取材自 Coursera 上的「Trustworthy Generative AI」課程(Vanderbilt University),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

為什麼說幻覺是特性不是缺陷?
因為生成式 AI 的本職是生成文字,不是查詢資料庫。同一個「能生出訓練資料裡沒有的內容」的能力,用在寫故事與腦力激盪叫創造力,用在查事實叫幻覺。工具沒變,變的是任務合不合適。
那想用它處理事實類資訊該怎麼辦?
把「生成」改成「過濾」或「導航」。把原始資料直接給它,請它篩選、摘要並附上行號或編號讓你能核對;或讓它告訴你資訊在系統的哪個位置,而不是憑空產生內容。答案來自你給的材料,才驗證得了。
ACHIEVE 框架的五個字母各代表什麼?
A 是協助人類協調(aiding human coordination),C 是砍掉繁瑣任務(cutting out tedious tasks),H 是提供安全網(helping provide a safety net),IEV 是激發更好的解題與創意(inspiring better problem solving),E 是讓好點子更快放大(enabling ideas to scale)。
什麼樣的任務不該交給生成式 AI?
答案必須正確、你卻無法便宜驗證的任務,以及答錯會傷到人的任務。課程的例子是拿它判斷用藥安不安全:它不了解你的身體狀況,錯了代價又大。這種情境該做的是請它幫你準備要問專業人士的問題,而不是代替專業人士回答。