生成與推論

Latency 是什麼?使用者體感的快慢就看這個數字

Latency(延遲時間)是指從使用者送出請求,到 AI 開始回應或回應完成所花費的時間。它通常拆成兩段來看:TTFT 是送出到吐出第一個字的時間,TTL 是送出到整段回應完成的時間。延遲越低,互動體驗越即時、越流暢,其中 TTFT 對「等待感」的影響最大。
Latency 是什麼?使用者體感的快慢就看這個數字:文章重點卡

Latency 是什麼?使用者體感的快慢就看這個數字

同樣一個模型,有人覺得很順,有人覺得很卡,差別常常不在模型本身,而在延遲。想優化使用者體驗,先學會把延遲拆開來看。

你將學到什麼

定義

延遲是從送出請求到 AI 開始回應或回應完成所花的時間。

白話比喻

像點餐:服務生多久來接單是 TTFT,菜全部上齊是 TTL。

跟誰容易搞混

容易跟吞吐量混淆。延遲是一個人等多久,吞吐量是一小時能服務多少人。

定義

Latency(延遲時間)是指從使用者送出請求,也就是按下送出的那一刻,到 AI 開始回應或回應完成所花費的時間。延遲越低,互動體驗越即時、越流暢。

一次請求會經過六個環節:使用者送出、請求傳輸、模型處理、開始回應、持續生成、回應完成。延遲就發生在這條路上的每一段。

白話比喻

你去餐廳吃飯,坐下之後服務生多久來接單,決定你覺得這家店有沒有在理你,那是 TTFT。

菜什麼時候全部上齊,決定你這一餐花了多久,那是 TTL。兩個數字都重要,但讓人不耐煩的通常是前者。

延遲、TTFT 與吞吐量差在哪?

名詞衡量什麼誰在意
TTFT 首字時間送出到第一個字出現使用者的等待感
TTL 總回應時間送出到整段回答結束任務的完成效率
Throughput 吞吐量單位時間能處理多少請求服務的整體容量

實際用例

影響延遲的關鍵因素有六個:網路延遲、模型大小、硬體效能、伺服器負載、生成長度、解碼策略。模型越大、回應越長,時間就越久。

要降低延遲,可以從幾個方向下手:選擇效能更好的模型或版本、使用高效能硬體、減少回應長度、優化取樣參數、善用快取與預填充減少重複計算。

常見誤解很多人以為延遲高就是模型不好,其實常常是回應太長或伺服器排隊造成的。另外要注意:串流輸出不會讓總時間變短,它是讓第一個字提早出現,把等待感壓下去。感覺變快跟真的變快,是兩件事。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

TTFT 跟 TTL 差在哪?
TTFT 是 Time To First Token,從送出請求到 AI 吐出第一個字的時間;TTL 是 Time To Last Token,從送出請求到整段回應完成的時間。前者影響等待感,後者影響完成效率。
哪些因素會影響延遲?
網路距離與品質、模型大小、硬體效能、伺服器負載、生成長度,以及解碼與取樣策略,都會影響延遲。使用者變多、排隊時間變長,延遲也會跟著上升。
怎麼降低延遲?
選擇效能較好的模型或版本、限制最大輸出長度、使用更靠近的伺服器與更好的硬體、善用快取與預填充,都是實務上有效的做法。