提示工程
Jailbreak 越獄破解是什麼?繞過 AI 安全限制的手法
Jailbreak 越獄破解是什麼?繞過 AI 安全限制的手法
新聞上常看到「有人成功誘導 AI 說出不該說的話」,這種手法就叫 Jailbreak,是每個做 AI 應用的人都該懂的資安風險。
你將學到什麼
定義
用特殊提示詞誘導 AI 繞過安全限制,產出原本被禁止的內容。
白話比喻
像用話術說服警衛違規放行,不是硬闖大門,而是騙他自願開門。
跟誰容易搞混
跟提示詞注入不同,越獄是繞過模型自身的安全規則,注入是植入惡意指令劫持任務。
定義
Jailbreak(越獄破解)是指透過精心設計的提示詞,誘導 AI 模型繞過內建的安全限制與使用政策,讓它產出原本應該拒絕回答的內容。
這個詞借用了手機越獄的概念,手機越獄是解除系統原廠限制,AI 的越獄則是解除模型原本被訓練要遵守的安全邊界。
白話比喻
Jailbreak 不是硬闖大門,而是用話術說服守門的警衛,讓他自願放行。可能是編一個聽起來合理的理由,也可能是包裝成虛構故事,讓模型誤以為這次的要求可以例外通融。
模型本身沒有被駭入或破壞,只是被巧妙的語言誘導,一步步做出偏離安全規範的回應。
跟提示詞注入的差別
Jailbreak 針對的是模型自身內建的安全限制,攻擊者想讓模型做出原本被訓練拒絕的事;Prompt Injection 提示詞注入攻擊 則是針對應用系統,攻擊者想在使用者輸入或外部資料裡植入惡意指令,劫持 AI 原本該執行的任務。兩者手法有重疊,但攻擊的目標對象不同。
實際用例
企業在打造對外開放的 AI 應用時,需要假設一定會有人嘗試越獄破解,因此在設計階段就該規劃好防護欄與內容審核機制,而不是等出事才補救。
常見的防禦做法是分層防守:模型層依賴廠商持續更新的安全訓練,應用層加上輸入輸出過濾與敏感操作限制,並針對高風險場景保留人工複核,多一層防線就少一分風險。
延伸學習
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599

