ChatGPT 實戰

讓 AI 睜開眼睛:GPT 視覺功能的實用場景與地雷

GPT 的視覺功能讓你上傳圖片搭配文字提問,AI 能描述畫面、讀出圖中文字、解讀圖表、分析介面截圖,甚至把白板草稿變成整理過的內容。用法是「圖片加上明確的問題」,越具體越好。但它在精確計數、小字辨識與空間關係上仍會出錯,高風險判讀與含個資的影像也不該交給它。
讓 AI 睜開眼睛:GPT 視覺功能的實用場景與地雷:文章重點卡

讓 AI 睜開眼睛:GPT 視覺功能的實用場景與地雷

文字聊得再流暢,有些東西就是用看的比較快:一張塞滿數字的圖表、一頁手寫筆記、一個怎麼按都不對的軟體畫面。GPT 的視覺能力補上的就是這一塊:你上傳圖片、搭配文字問題,它「看著圖」回答你。

我修 Vanderbilt 大學的 GPT Vision 這門課時,最大的心得是:這不是「上傳圖片的聊天室」,而是一種新的提問方式。

這篇整理視覺輸入的實用場景、讓它看得更準的提問技巧,以及幾個實際使用時一定會撞到的地雷。

你將學到什麼

基本用法

圖片加明確問題,指出你要它看哪裡。

實用場景

讀圖表、抄手寫、解截圖、盤點實物。

提問技巧

怎麼問,決定它看見什麼。

已知地雷

計數、小字、空間關係與隱私風險。

從「用講的」到「給它看」

視覺輸入改變的是溝通成本。過去你得把眼前的東西翻譯成文字:「畫面左上角有一個齒輪圖示,按下去出現一排選單⋯⋯」,翻譯得不完整,答案就歪。現在你直接把截圖丟上去,問「為什麼我找不到匯出按鈕」,它看著跟你一樣的畫面回答。少掉一層轉述,就少掉一層失真

技術上這叫多模態(multimodal):模型同時接收影像與文字,把兩者放在同一個脈絡裡理解。所以最好的用法從來不是丟一張圖問「這是什麼」,而是圖片與問題成對出現,你的文字負責把它的注意力引到對的地方。

五個一用就有感的場景

  • 解讀圖表與報表:把統計圖或報表截圖丟給它,請它講出趨勢、異常點,或轉成表格文字。看不懂別人簡報裡的圖時特別好用。
  • 手寫與白板數位化:會議白板、紙上筆記拍照上傳,請它整理成條列或行動清單。比自己重打快非常多。
  • 看懂軟體畫面:卡在某個設定頁面、看到看不懂的錯誤視窗,截圖問它「我現在該按哪裡」,等於隨身帶一位看得到你螢幕的工程師朋友。
  • 實物辨識與建議:拍冰箱裡的食材問能煮什麼、拍植物問照顧方式、拍家具擺設請它給佈置建議。
  • 圖轉結構:把流程草圖、介面手稿丟給它,請它轉成文字流程、需求描述甚至程式碼骨架,從草稿到初版的距離被大幅縮短。

怎麼問,決定它看見什麼

跟純文字提示一樣,視覺提問也有基本功。第一,指定範圍:「看右下角那張表」比「看這張圖」精準。第二,指定輸出:「把圖裡的數字整理成兩欄表格」比「幫我看一下」有用。第三,給脈絡:告訴它這是什麼場合的圖、你打算拿答案做什麼,它的回答會立刻從泛泛描述變成對症下藥。

一個實用習慣先請它「描述你在這張圖裡看到什麼」,確認它看對了,再問真正的問題。這一步能提早抓到「它把 7 看成 1」「它根本沒注意到第二張表」這類誤讀,跟資料分析先確認欄位是同一個道理。

已知的地雷區

視覺能力進步很快,但幾個弱點目前仍然公認存在。精確計數不可靠:數合照裡有幾個人、貨架上有幾罐,常常差個一兩個。小字與模糊文字:解析度不夠的文字它會「猜著讀」,而且猜錯時語氣照樣自信。

空間與方位:左右、前後、重疊關係的描述偶爾會錯亂。共通的對策只有一個:涉及數量、金額、劑量的讀取,一律自己對照原圖驗證

另一類地雷是使用邊界。醫療影像判讀、法律文件的效力判斷、以圖識人,這些要嘛風險太高、要嘛涉及隱私與倫理,都不是它該扮演的角色。上傳前也多看一眼畫面背景:桌上的合約、螢幕上的信箱、路人的臉,圖片洩漏資訊的能力遠比文字強。

把它當眼力好的助手,不是鑑定師

總結我的使用心法:它是一位眼力很好、動作很快、但偶爾看走眼的助手。適合交給它的是「看了之後幫我整理、解釋、起草」的工作,不適合交給它的是「看了之後替我做高風險判定」的工作。

分清楚這條線,視覺功能會是你日常裡用最順手的 AI 能力之一:因為這個世界上,值得看的東西實在比值得讀的文字多太多了。

本文源起本文取材自 Coursera 上的「GPT Vision: Seeing the World through Generative AI」課程(Vanderbilt University),由酒Ann 修畢後以自己的視角重新編寫成中文。原版課程可在 Coursera 修習。

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

視覺功能可以讀什麼樣的圖?
照片、螢幕截圖、掃描文件、手寫筆記、圖表、地圖、白板塗鴉都可以。它擅長描述內容、讀出文字、解讀結構,也能一次比較多張圖。圖片越清晰、拍得越正,辨識品質越好。
它讀圖會出錯嗎?最常錯在哪?
會。公認的弱點是精確計數(數人數、數物件常差一兩個)、太小或模糊的文字、以及物件之間的精細空間關係。涉及數量與金額時,把它的輸出當初稿,自己再核對一次原圖。
可以拿它看醫療影像或檢驗報告嗎?
不建議把它當判讀者。X 光、皮膚照片這類高風險判讀,錯了的代價是健康,這正是最不該交給生成式 AI 的任務型態。合理的用法是請它幫你整理「該問醫師的問題」,判讀本身留給專業人員。
上傳的圖片有隱私疑慮嗎?
有。圖片經常比文字洩漏更多:背景裡的螢幕、桌上的文件、路人的臉。上傳前檢查畫面裡有沒有不該外流的資訊,含個資、機密或他人肖像的影像,先裁切或遮蔽再上傳,或乾脆不要傳。