生成與推論
Latency 是什麼?使用者體感的快慢就看這個數字
Latency 是什麼?使用者體感的快慢就看這個數字
同樣一個模型,有人覺得很順,有人覺得很卡,差別常常不在模型本身,而在延遲。想優化使用者體驗,先學會把延遲拆開來看。
你將學到什麼
定義
延遲是從送出請求到 AI 開始回應或回應完成所花的時間。
白話比喻
像點餐:服務生多久來接單是 TTFT,菜全部上齊是 TTL。
跟誰容易搞混
容易跟吞吐量混淆。延遲是一個人等多久,吞吐量是一小時能服務多少人。
定義
Latency(延遲時間)是指從使用者送出請求,也就是按下送出的那一刻,到 AI 開始回應或回應完成所花費的時間。延遲越低,互動體驗越即時、越流暢。
一次請求會經過六個環節:使用者送出、請求傳輸、模型處理、開始回應、持續生成、回應完成。延遲就發生在這條路上的每一段。
白話比喻
你去餐廳吃飯,坐下之後服務生多久來接單,決定你覺得這家店有沒有在理你,那是 TTFT。
菜什麼時候全部上齊,決定你這一餐花了多久,那是 TTL。兩個數字都重要,但讓人不耐煩的通常是前者。
延遲、TTFT 與吞吐量差在哪?
| 名詞 | 衡量什麼 | 誰在意 |
|---|---|---|
| TTFT 首字時間 | 送出到第一個字出現 | 使用者的等待感 |
| TTL 總回應時間 | 送出到整段回答結束 | 任務的完成效率 |
| Throughput 吞吐量 | 單位時間能處理多少請求 | 服務的整體容量 |
實際用例
影響延遲的關鍵因素有六個:網路延遲、模型大小、硬體效能、伺服器負載、生成長度、解碼策略。模型越大、回應越長,時間就越久。
要降低延遲,可以從幾個方向下手:選擇效能更好的模型或版本、使用高效能硬體、減少回應長度、優化取樣參數、善用快取與預填充減少重複計算。
延伸學習
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599

