易混淆對照
Token 跟中文字數差在哪?一個中文字常常不只算一個 Token
Token 跟中文字數差在哪?一個中文字常常不只算一個 Token
「這個模型有 128K 的上下文」聽起來很多,換算成中文卻沒有你想的那麼多。原因就在於人類算字,AI 算 Token,兩者不是同一把尺。
這個對照弄清楚,你才估得準成本,也才知道為什麼同一份資料,中文版比英文版貴。
你將學到什麼
定義
字元是人類的單位,Token 是 AI 把文字切塊之後的計算單位。
白話比喻
像碎紙機,文字被切成大小不一的碎塊,再轉成數字編碼。
換算比例
英文一個單字約 1.3 個,繁體中文一個字約 2 到 3 個。
跟誰容易搞混
標點、空格、換行、程式碼、圖片全部都算,不是只有文字算。
定義
字數與字元是人類的計算單位,我們看的是「字」。Token 中文叫字詞單位,是 AI 的計算單位,它看的是切塊之後的碎片。
模型不會直接讀你的句子,而是先把文字切成一塊一塊,再轉換成數字編碼來處理。所以同樣一句話,字數與 Token 數幾乎不會相等。
白話比喻
像把一張紙送進碎紙機。切出來的碎塊大小不一,有的是一個完整單字,有的是半個詞,有的只是一個符號。
AI 看不懂字,只懂數字。它把每一塊碎片換成一個編號,再拿這些編號去做運算。
各語言的換算參考
| 語言 | 換算關係(約略) | 範例 |
|---|---|---|
| 英文 | 1 個單字約 1.3 個 Token | Hello world 兩字約 2 到 3 個 Token |
| 中文簡體 | 1 個字約 1.5 到 2 個 Token | 四個字約 6 到 8 個 Token |
| 中文繁體 | 1 個字約 2 到 3 個 Token | 六個字約 12 到 18 個 Token |
| 日文 | 1 個字約 1.5 到 2 個 Token | 五個字約 7 到 10 個 Token |
| 程式碼 | 符號與空格也會算 | 一行短程式約 6 到 10 個 Token |
實際數量會因模型使用的分詞器而異,這裡的比例只當估算用。重點是記住繁體中文最吃 Token 這件事。
不是只有文字才算
很多人以為只有中文字與英文字才計費,其實標點符號、空格、換行、程式碼、表情符號都會算成 Token,圖片在多模態模型裡更是大戶。
所以一份排版整齊、附了表格與截圖的文件,Token 數常常遠超過你用字數估出來的值。
為什麼要在意
兩個地方會痛。第一是上下文容量,也就是模型的記憶上限;你輸入的內容越多,它能記住的歷史對話就越少,超過上限之後最前面的內容會被丟掉。
第二是費用,大多數 API 的計費方式就是按輸入與輸出的 Token 計價。要省,就把長對話定期壓縮成 Context Summary 說明摘要,比一路硬塞有效得多。
延伸學習
思維邏輯自我訓練:28 天養成計畫(含入門練習版)
四週把「有感覺」練成「有觀點」。每天一題、一個高階任務配一個低階任務,忙的日子也接得上。買這門課直接附贈《入門練習版》八單元 22 課完整講義與練習單,排在課程最前面,先把思維訓練三部曲、知識吸收金三角這些底層工具建立起來,再進入 28 天的每日練習。
NT$ 999
做出你的第一個 Skill
一場快閃直播的完整重製。從搞懂 Skill 的五個層級開始,帶你把一件你每天在做的重複工作,寫成一支 AI 真的會照做的 Skill ── 命名、description、輸入拆解、Workflow 訪談、Output 與 Checks,最後組成一份能通過格式檢查的 SKILL.md。
NT$ 999

