生成與推論
Prompt Caching 提示詞快取是什麼?重複的前綴不用重算
Prompt Caching 提示詞快取是什麼?重複的前綴不用重算
你的客服機器人每一次對話,都要先讀一遍三千字的系統規則加上一份產品手冊。同一段內容,一天算幾萬次。
提示詞快取要解決的就是這件事。它是少數同時省錢又省時間的優化。
你將學到什麼
定義
把重複的提示詞前綴存起來,命中就不必重算。
白話比喻
像會議前不用每次重講背景,大家接續上次的共識就好。
關鍵限制
只對前綴有效,前面改一個字,後面全部失效。
定義
提示詞快取是把一段固定不變的提示詞前綴,在服務端計算一次之後保存起來。之後只要新的請求開頭跟它完全一致,就可以直接沿用計算結果。
省下來的是重複計算的成本。對使用者的體感是首字出現得更快,對帳單的影響則是這段重複內容的單價通常明顯下降。
白話比喻
想像每週固定的專案會議。如果每次開場都要把整個專案背景重講一遍,一小時的會有二十分鐘在複習。
有了共同的背景共識之後,你可以直接說「延續上次,今天談第三項」。快取做的就是這件事,把重複的開場省掉。
它只對前綴有效
這是整個機制最重要、也最常被忽略的一點。快取比對的是從第一個字開始的連續片段,不是把提示詞裡任何重複的段落挑出來。
所以提示詞的排列順序會直接決定它有沒有用。正確做法是把最穩定的內容放最前面,最容易變動的放最後面。
| 位置 | 該放什麼 | 原因 |
|---|---|---|
| 最前面 | 系統提示、角色設定、固定規則 | 幾乎不會改,命中率最高 |
| 中間 | 參考文件、知識片段、範例 | 一段時間才更新一次 |
| 最後面 | 對話歷史、這一輪的問題 | 每一次都不同 |
反過來說,只要你在最前面插入一個會變的值,例如當下時間或使用者編號,後面再穩定的內容也全部失效。
什麼場景最划算
- 長系統提示:角色、規則、格式規範寫得很完整的應用。
- 固定參考資料:每次都要附上的產品手冊、法規條文、程式碼庫。
- 多輪對話:同一段開場在每一輪都會被重送一次。
- 批次處理:用同一組指令處理大量不同的輸入。
反過來,一次性的短提問幾乎沒有效益,因為根本沒有重複的部分可以省。
跟相近名詞的差別
| 名詞 | 在講什麼 |
|---|---|
| Prompt Caching 提示詞快取 | 跨請求重用同一段前綴的計算結果。 |
| KV Cache 鍵值快取 | 單次生成過程中,避免重算已產生詞元的內部機制。 |
| RAG 檢索增強生成 | 從外部知識庫撈資料塞進提示詞,跟快不快取無關。 |
兩者的關係是:KV Cache 是引擎內部的機制,提示詞快取則是把這個機制的成果保留下來給下一次請求用。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

