生成與推論
Batch Inference 批次推論是什麼?用等待換更低的成本
Batch Inference 批次推論是什麼?用等待換更低的成本
要把三萬筆客戶回饋分類,一筆一筆呼叫模型,帳單很快就會嚇到你。其實這件事根本不需要即時。
批次推論就是把「不急」變成折扣。你願意等,系統就用比較便宜的方式幫你跑完。
你將學到什麼
定義
把大量請求打包送出、不要求即時回覆,等處理完再一起取回結果。
白話比喻
像寄普通掛號而不是叫快遞。晚一點到,但便宜很多。
跟誰容易搞混
跟即時推論相對。使用者在等的路一律走即時,沒人在等的才走批次。
定義
Batch Inference 批次推論,是把大量請求集中打包成一批送出,不要求即時回應,等系統排程處理完之後再一起取回結果。
它省錢的原理很單純:即時服務必須隨時保留算力等你呼叫,那份「隨時待命」是要付錢的。批次不需要待命,系統可以挑資源比較空的時候跑,因此單位成本明顯較低。
代價是延遲。你換到的是成本,付出的是等待時間,所以它只適合沒有人在等的工作。
白話比喻
像寄件。急件叫快遞,一小時到,但每件都貴;不急的整批寄普通掛號,隔天到,單價低很多。東西一樣,差別只在你願不願意等。
所以判斷標準不是「重不重要」,而是「有沒有人在等」。很重要但沒人在等的工作,正是批次最好的對象。
批次推論跟即時推論差在哪?
| 比較點 | 即時推論 | 批次推論 |
|---|---|---|
| 回應時間 | 秒級,使用者當場看到 | 分鐘到小時級 |
| 單位成本 | 較高 | 明顯較低 |
| 適合的任務 | 對話、搜尋、互動功能 | 分類、標註、摘要、批次生成 |
| 設計方式 | 同步等待回覆 | 非同步,送出後再取結果 |
| 失敗處理 | 當場重試 | 整批重跑或補跑失敗的部分 |
實際用例
常見的三個場景。一是客戶回饋分類:把一整年的問卷與評論打包,一次跑完分類與情緒標註。二是知識庫建置:把上千份文件切片後批次轉成向量,隔天再上線查詢。三是內容整理:把大量會議逐字稿批次摘要成重點。
實務上我會把系統切成兩條路:使用者在等的功能一律走即時,其餘一律排進批次。這條分界線畫清楚,帳單跟延遲兩邊都會漂亮很多。
另外要注意速率限制。就算走批次,服務端仍有每分鐘的處理上限,一次丟太多可能被擋,設計時要留重試與分段送出的機制。
延伸學習
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599

