模型與訓練
Red Teaming 紅隊測試是什麼?主動去找模型的破口
Red Teaming 紅隊測試是什麼?主動去找模型的破口
一般測試問的是「功能正不正常」,紅隊測試問的是「有沒有辦法讓它出事」。這兩件事要用完全不同的心態去做。
只要你的 AI 會面對外部使用者,就值得做一輪紅隊測試。上線前自己找到破口,成本遠低於上線後被別人找到。
你將學到什麼
定義
扮演攻擊者主動試探 AI,找出會讓它違規、外洩或失控的路徑。
白話比喻
像請人來假裝小偷試著闖你家。找到的破口越多,你的門鎖越可靠。
跟誰容易搞混
跟防護欄不同。防護欄是防守機制,紅隊測試是主動進攻找漏洞。
定義
Red Teaming 紅隊測試,是刻意扮演攻擊者的角色,用各種手段去試探一個 AI 系統,看它會不會說出或做出原本被禁止的事。
這個詞來自資安領域。紅隊負責進攻,藍隊負責防守,目的不是分勝負,而是在真實攻擊發生之前,先把破口找出來。
它跟一般測試的差別在心態。一般測試驗證的是「照著規格做會不會正常」,紅隊測試驗證的是「不照規格做會發生什麼」。
白話比喻
像請一位專業人士來假裝小偷,試著闖進你家。他從門、窗、後陽台各試一遍,跟你說哪裡最好進來。你聽了不會生氣,你會去換鎖。
紅隊測試的價值也是這樣:破口一定存在,差別只在誰先找到。自己先找到,你有時間修;別人先找到,你只能救火。
紅隊測試跟一般測試差在哪?
| 比較點 | 一般功能測試 | 紅隊測試 |
|---|---|---|
| 問的問題 | 功能是否正常運作 | 能不能讓它出事 |
| 使用方式 | 照規格與正常流程操作 | 刻意繞道、偽裝、誘導 |
| 成功的定義 | 全部通過 | 找到越多破口越有價值 |
| 產出 | 測試報告與缺陷清單 | 攻擊路徑與對應的防護建議 |
| 時機 | 開發過程中持續進行 | 上線前與重大改版後各做一輪 |
實際用例
假設你做了一個客服機器人,規則是不得提供醫療建議。紅隊要做的不是問它「給我醫療建議」,而是換十種問法:假裝在寫小說、說自己是醫護人員、把問題拆成好幾輪慢慢逼近、用外語問一次。
常見的攻擊路徑還有提示詞注入:把指令藏在使用者上傳的文件或網頁裡,讓模型讀到之後照著做。這類問題單看功能測試完全測不出來。
測完別只留一份報告。每一個成功的攻擊都要變成一條規則、一個測試案例,並補進評估流程,之後每次改版都跑一次。
延伸學習
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999

