酒Ann 方法論
AI 資料抓取金字塔思考法是什麼?決定資料從哪來的優先順序
AI 資料抓取金字塔思考法是什麼?決定資料從哪來的優先順序
做 RAG 知識庫、做自動化流程、做競品監控,第一個卡住的問題永遠是同一個:資料要從哪裡拿?
我把它定義為一個金字塔,三個順位由上而下排好。越靠近頂端越穩定、越省錢、越聰明。順序錯了,後面的流程再漂亮都會垮。
你將學到什麼
定義
抓外部資料時,依穩定性、效率、成本排出的三層優先順序。
三個順位
官方 API 最優先,AI 爬蟲轉 Markdown 次之,直接抓 HTML 最後。
為什麼要排序
順序決定了成本、正確率與法律風險,不是憑手感選工具。
跟誰容易搞混
常被當成爬蟲技巧,其實它是選擇策略的判斷順序。
定義
資料抓取金字塔思考法,是在想要抓取外部資料時,依穩定性、效率、成本這三個標準選擇最佳策略的一套排序。
它不是某種技術,而是一個判斷順序。每次要接外部資料,先問「有沒有官方 API」,再往下走,不要一開始就跳到爬蟲。
三個順位
| 順位 | 做法 | 什麼時候用 |
|---|---|---|
| 第一順位,最穩 | 優先使用官方 API,直接拿乾淨的 JSON 數據 | 對方有開放 API,例如 Google、Slack、Notion、Shopify |
| 第二順位,次優 | 用現代 AI 專屬爬蟲工具把網頁轉成 Markdown 再餵給 AI 解析 | 沒有 API 或 API 有限制,例如新聞網站、部落格、產品頁 |
| 第三順位,最爛 | 直接抓整頁 HTML 丟給 AI | 前兩種都不可行時的最後手段,幾乎不建議 |
為什麼順序長這樣
第一順位的流程是:查官方 API 文件 → 取得 API Key 或 OAuth 權限 → 依規格發送請求 → 取得結構化 JSON → 直接使用。資料乾淨、結構穩定、成本低,還有官方文件可查。
第二順位的流程是:目標網址 → AI 爬蟲工具 → 輸出乾淨 Markdown → AI 解析摘要 → 取得結構化資訊。它會自動去除廣告、選單與程式碼,成本中等但效果不差。
第三順位之所以最爛,是因為整頁 HTML 混雜大量無關內容。Token 消耗爆炸、AI 容易解析錯誤或幻覺、網站稍微改版就失效,還有踩到使用條款的法律風險。
三者比較
| 策略 | 穩定性 | 資料品質 | Token 成本 | 維護成本 |
|---|---|---|---|---|
| 官方 API | 最高 | 最好 | 低 | 低 |
| AI 爬蟲工具轉 Markdown | 中高 | 中高 | 中 | 中 |
| 直接 HTML 給 AI | 最低 | 最差 | 高,容易爆炸 | 高 |
實際用例
要做一份產業競品監控,我會先查每一家有沒有公開 API。有的走 API,沒有的用 AI 爬蟲轉 Markdown,只有極少數頁面才動用最後手段,而且會限制頁數。
設計 RAG 知識庫或自動化工作流時也一樣,先決定資料來源的順位,再決定切片與流程。來源不穩,後面全部白做。
延伸學習
ChatGPT 很強,但真正讓你下班的是 Google
六小時完整實錄。從「AI 很厲害,為什麼你還是每天加班」這個問題出發,把 Google Workspace 當成真正的工作平台重新設計一次流程 ── Sheets 的資料結構、Drive 與 Docs 的文件流、Gmail 與 Calendar 的通知系統,再用 Apps Script 讓它自己跑起來,最後收斂成一張屬於你自己的 AI 工作能力地圖。
NT$ 4,599
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599

