生成與推論

Max Output Tokens 最大輸出長度是什麼?回答被砍斷通常就是它

Max Output Tokens(最大輸出長度)是你設定的上限,限制 AI 在這一次回答裡最多可以生成多少個 Token。內容一旦達到這個上限,回答就會被強制截斷,通常會停在句子中間。它管的只有輸出那一段,跟模型一次能讀進多少內容的上下文容量是兩回事,兩者都會影響你看到的結果,但調整的地方不同。
Max Output Tokens 最大輸出長度是什麼?回答被砍斷通常就是它:文章重點卡

Max Output Tokens 最大輸出長度是什麼?回答被砍斷通常就是它

AI 寫到一半突然停在句子中間,很多人以為是壞掉或當機。九成的情況是撞到最大輸出長度。

這個設定在 API 與大部分工具裡都調得到,知道它在哪,斷尾問題就結束了。

你將學到什麼

定義

限制 AI 這一次回答最多能生成幾個 Token,達到上限就強制停止。

白話比喻

像水桶的容量。水一直裝,裝到設定的水位就再也裝不下。

怎麼認出來

內容停在半句、清單只列到一半,而且沒有結尾語。

怎麼處理

調高上限,或直接請 AI「繼續未完的部分」。

定義

最大輸出長度是你設定的上限,限制 AI 這次最多能生成多少個 Token達到上限,生成立刻停止。

它不是模型的能力上限,是你給的閘門。所以斷尾多半不是模型不會寫,而是你沒給它足夠的額度。

白話比喻

把它想成水桶的容量。AI 回答的時候不斷往桶裡裝水,也就是持續生成文字。

裝到你設定的水位就停。桶子沒滿的時候它會自己講完就收尾,滿了就是硬生生截斷。

跟上下文容量差在哪

名詞管的是撞到會怎樣
Max Output Tokens這一次最多寫多少回答被截斷,停在半句
Context Window 上下文容量一次最多讀進多少前面的內容被擠掉,模型忘記早先講過的事
Stop Sequences 停止序列遇到指定字串就停在指定的位置乾淨停下,是主動控制

三者都會讓輸出提早結束,但原因不同。斷在句中通常是最大輸出長度,答非所問或忘記前文比較像上下文被擠掉。

實際用例

同一個提示詞「介紹京都的必去景點與美食」,上限五十只寫得出兩個景點就斷;一百五十可以列到四五個;五百才寫得完景點加美食的完整版本。

實務上的判斷很簡單:先想清楚你要的是摘要還是完整內容,再回頭設定。要完整就給足,之後再嫌長也比補不回來容易處理。

常見誤解

最常見的誤解是把它跟上下文容量搞混,於是一直去換更長脈絡的模型,其實只要把輸出上限調高就好。

第二個誤解是以為 AI 會自己抓長度、寫到快滿就收尾。它不會預留結尾,是寫到哪裡斷到哪裡,所以輸出結構化格式時特別危險,斷掉的 JSON 直接解析失敗。

本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

一個中文字等於幾個 Token?
常見的估法是一個中文字大約一到兩個 Token,一個英文單字大約一個,標點通常也各算一個。實際數量會因模型與語言而有差異,所以設定上限時要留一點餘裕,不要抓得剛剛好。
最大輸出長度要設多少才對?
看用途。要一句話回答或快速摘要,二十到八十就夠;一般問答與短篇說明大約一百到三百;長篇文章或教學內容通常要三百到一千以上。輸出的是程式碼或結構化資料就依需求放寬,寧可多留一點,斷在中間的 JSON 是不能用的。
設定得很大會不會比較花錢?
上限本身不計費,實際生成多少才計費,所以設大不等於變貴。但它是安全閥:上限很高又遇到模型囉唆的時候,可能真的寫出一大篇,時間與費用都跟著上去。合理設定仍然值得。