提示工程

Self-Consistency 是什麼?多跑幾次再取共識答案

Self-Consistency(自洽採樣)是搭配思維鏈使用的提示技術。做法是對同一個問題讓模型跑好幾次,每次都獨立產生一條推理路徑與答案,最後取出現次數最多的那個答案當結論。它的前提是:錯誤的推理會錯得五花八門,正確的推理則會殊途同歸,所以多數決比單次結果可靠。代價是成本與時間都跟著次數倍增。
Self-Consistency 是什麼?多跑幾次再取共識答案:文章重點卡

Self-Consistency 是什麼?多跑幾次再取共識答案

同一道題目問模型三次,得到三個不同的答案,這種事很常見。多數人的反應是重問到看順眼為止。

自洽採樣把這個直覺變成方法:不要挑你喜歡的那個,要挑出現最多次的那個。

你將學到什麼

定義

同一題跑多次,各自獨立推理,最後取出現次數最多的答案。

白話比喻

像找三個人分別算同一筆帳,兩個算出同樣的數字,那個數字比較可信。

前提

錯誤的推理會錯得各不相同,正確的推理容易殊途同歸。

代價

成本與時間跟次數成正比,答案發散的開放題也不適用。

定義

自洽採樣是讓模型對同一個問題產生多條獨立的推理路徑,再取出現次數最多的答案。用共識取代單次結果。

它的核心假設很直覺:錯的方式有很多種,對的方式通常只有幾種。所以重複出現的那個答案,正確的機率比較高。

白話比喻

像請三個人分別算同一筆帳,而且不准互相對答案。如果其中兩個人算出同樣的數字,那個數字通常就是對的。

重點是「分別」。如果他們互相參考,就變成一起錯,多數決就失去意義了。

怎麼操作

  1. 要求展開推理:先用 思維鏈 請模型一步步說明過程。
  2. 重複多次:同一個問題獨立跑三到五次,每次都是新的開始。
  3. 收集答案:只取結論,不要把前一次的推理帶進下一次。
  4. 取多數決:出現次數最多的那個答案就是結論。
  5. 看分布:如果票數很分散,代表題目本身不清楚,回頭補資訊。

跟相近名詞的差別

名詞怎麼運作適合什麼
CoT 思維鏈一次推理,把過程展開需要推理的單一問題
Self-Consistency多次推理,取多數決有明確答案、想提高可靠度
ToT 思維樹同一次裡分岔探索並回頭比較策略規劃、方案比較
Reflection產出後自我檢查再修正想抓出自己的錯誤

實際用例

適合的場景:數學與邏輯題、資料判讀、分類標註、以及任何「答案只有一個、但模型偶爾會滑掉」的任務。

實務上常跟 Temperature 一起調:溫度太低每次結果都一樣,取共識就沒有意義;溫度太高則會散到收斂不了。

常見誤解

最常見的誤解是「多數決等於正確」。如果模型對某一類題目有系統性的偏誤,它會很穩定地錯同一個方向,票數再多也救不回來。

第二個誤解是拿它來取代查證。它提高的是內部一致性,不是事實正確性。涉及事實的答案還是要靠 錨定 與引用來源。

本文源起本文為酒Ann 的 AI 名詞彙編系列,用白話把常見名詞一次講清楚。歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

自洽採樣跟思維鏈是什麼關係?
自洽採樣是建立在思維鏈之上的。要讓每次的推理路徑真的不同,模型必須把推理過程展開,而不是直接給答案。所以實務上是先要求逐步推理,再重複跑多次取共識。
要跑幾次才夠?
沒有固定數字,通常從三到五次開始試,看答案分布收不收斂。如果幾次結果都一致,代表題目對模型來說不難,加次數也不會改善。如果分布很散,通常是題目描述不夠清楚,該補的是資訊不是次數。
哪些題目不適合用?
開放式創作、文案發想、策略腦力激盪都不適合。這些題目本來就沒有唯一解,取多數決只會把最平庸的那個選出來。它適合的是有明確正確答案的推理與計算。