生成與推論
Throughput 吞吐量是什麼?AI 每秒能產出多少字
Throughput 吞吐量指 AI 模型每秒鐘能處理或生成多少個 Token,單位是 Tokens 每秒。吞吐量越高,代表單位時間內能產出的內容越多,回覆越流暢。它衡量的是整體產能,跟衡量等待時間的延遲是兩個不同的指標。
Throughput 吞吐量是什麼?AI 每秒能產出多少字
當你覺得某個模型「打字很慢」,你在感受的其實就是吞吐量。它是評估 AI 服務效能時最常被提到的數字之一。
它跟延遲、速率限制常常一起出現,但三者管的是不同的事。
你將學到什麼
定義
AI 每秒能處理或生成的 Token 數量,單位是 Tokens 每秒,數字越高越流暢。
白話比喻
像水管的粗細,決定每秒能流多少水;延遲則是你打開水龍頭到第一滴水出來的時間。
跟誰容易搞混
常跟 Latency 延遲與 Rate Limit 速率限制混為一談,三者可以同時很好或同時很差。
定義
吞吐量是指 AI 模型每秒鐘能處理或生成多少個 Token。單位寫成 Tokens 每秒,也就是一秒內處理或生成的 Token 數量。
影響它的關鍵因素有五個:硬體效能、模型大小、輸入長度、批次大小、系統負載。模型參數量越大,計算量越高,吞吐量通常越低。
白話比喻
把 AI 服務想成一條水管。吞吐量是水管的粗細,決定每秒能流出多少水;延遲是你轉開水龍頭到第一滴水滴出來的等待時間。
水管很粗但要等很久才出水,跟出水很快卻細細一條,是兩種不同的難受。所以這兩個指標要分開看。
跟相近名詞的差別
| 指標 | 衡量什麼 | 什麼場景最在意 |
|---|---|---|
| Throughput 吞吐量 | 每秒產出的 Token 數,整體產能 | 文件處理、摘要生成、批次任務 |
| Latency 延遲 | 從送出到收到回應的等待時間 | 即時對話、客服、互動場景 |
| TTFT 首字時間 | 第一個字出現需要多久 | 使用者對「反應快不快」的直覺感受 |
| Rate Limit 速率限制 | 服務方允許你在單位時間內用多少 | 多人共用、量大的正式服務 |
實際用例
即時對話與客服的重點是低延遲,批次大小抓小、優化首字時間、選較小的模型。文件處理與摘要生成的重點是高吞吐量,可以把批次大小拉大、啟用量化與並行。
離線的批次任務則追求極高吞吐量,批次大小可以再放大,並用多張 GPU 並行處理。實務上就是依場景在 延遲 與吞吐量之間取平衡。
常見誤解第一個誤解是把吞吐量當成唯一指標,結果做出一個「總量很高但第一個字要等很久」的服務。第二個是忽略輸入長度,提示詞越長處理時間越久,吞吐量自然掉下來。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook。
延伸學習
常見問答
吞吐量高就一定體驗好嗎?
不一定。即時對話與客服更在意首字延遲,吞吐量再高但第一個字要等三秒,使用者還是覺得慢。要看場景取捨。
怎麼提升吞吐量?
常見做法有升級硬體、調整批次大小、啟用量化與模型並行、精簡提示詞減少輸入 Token,以及選用參數量較小的模型。
吞吐量跟速率限制有什麼關係?
吞吐量是實際產出速度,速率限制是服務方對你設定的用量上限。兩者都會影響你的實際體驗,但一個是能力,一個是規則。
