生成與推論

Throughput 吞吐量是什麼?AI 每秒能產出多少字

Throughput 吞吐量指 AI 模型每秒鐘能處理或生成多少個 Token,單位是 Tokens 每秒。吞吐量越高,代表單位時間內能產出的內容越多,回覆越流暢。它衡量的是整體產能,跟衡量等待時間的延遲是兩個不同的指標。
Throughput 吞吐量是什麼?AI 每秒能產出多少字:文章重點卡

Throughput 吞吐量是什麼?AI 每秒能產出多少字

當你覺得某個模型「打字很慢」,你在感受的其實就是吞吐量。它是評估 AI 服務效能時最常被提到的數字之一。

它跟延遲、速率限制常常一起出現,但三者管的是不同的事。

你將學到什麼

定義

AI 每秒能處理或生成的 Token 數量,單位是 Tokens 每秒,數字越高越流暢。

白話比喻

像水管的粗細,決定每秒能流多少水;延遲則是你打開水龍頭到第一滴水出來的時間。

跟誰容易搞混

常跟 Latency 延遲與 Rate Limit 速率限制混為一談,三者可以同時很好或同時很差。

定義

吞吐量是指 AI 模型每秒鐘能處理或生成多少個 Token。單位寫成 Tokens 每秒,也就是一秒內處理或生成的 Token 數量。

影響它的關鍵因素有五個:硬體效能、模型大小、輸入長度、批次大小、系統負載。模型參數量越大,計算量越高,吞吐量通常越低。

白話比喻

把 AI 服務想成一條水管。吞吐量是水管的粗細,決定每秒能流出多少水;延遲是你轉開水龍頭到第一滴水滴出來的等待時間。

水管很粗但要等很久才出水,跟出水很快卻細細一條,是兩種不同的難受。所以這兩個指標要分開看。

跟相近名詞的差別

指標衡量什麼什麼場景最在意
Throughput 吞吐量每秒產出的 Token 數,整體產能文件處理、摘要生成、批次任務
Latency 延遲從送出到收到回應的等待時間即時對話、客服、互動場景
TTFT 首字時間第一個字出現需要多久使用者對「反應快不快」的直覺感受
Rate Limit 速率限制服務方允許你在單位時間內用多少多人共用、量大的正式服務

實際用例

即時對話與客服的重點是低延遲,批次大小抓小、優化首字時間、選較小的模型。文件處理與摘要生成的重點是高吞吐量,可以把批次大小拉大、啟用量化與並行。

離線的批次任務則追求極高吞吐量,批次大小可以再放大,並用多張 GPU 並行處理。實務上就是依場景在 延遲 與吞吐量之間取平衡。

常見誤解第一個誤解是把吞吐量當成唯一指標,結果做出一個「總量很高但第一個字要等很久」的服務。第二個是忽略輸入長度,提示詞越長處理時間越久,吞吐量自然掉下來。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

吞吐量高就一定體驗好嗎?
不一定。即時對話與客服更在意首字延遲,吞吐量再高但第一個字要等三秒,使用者還是覺得慢。要看場景取捨。
怎麼提升吞吐量?
常見做法有升級硬體、調整批次大小、啟用量化與模型並行、精簡提示詞減少輸入 Token,以及選用參數量較小的模型。
吞吐量跟速率限制有什麼關係?
吞吐量是實際產出速度,速率限制是服務方對你設定的用量上限。兩者都會影響你的實際體驗,但一個是能力,一個是規則。