ChatGPT 實戰
讓 AI 睜開眼睛:GPT 視覺功能的實用場景與地雷
讓 AI 睜開眼睛:GPT 視覺功能的實用場景與地雷
文字聊得再流暢,有些東西就是用看的比較快:一張塞滿數字的圖表、一頁手寫筆記、一個怎麼按都不對的軟體畫面。GPT 的視覺能力補上的就是這一塊:你上傳圖片、搭配文字問題,它「看著圖」回答你。
我修 Vanderbilt 大學的 GPT Vision 這門課時,最大的心得是:這不是「上傳圖片的聊天室」,而是一種新的提問方式。
這篇整理視覺輸入的實用場景、讓它看得更準的提問技巧,以及幾個實際使用時一定會撞到的地雷。
你將學到什麼
基本用法
圖片加明確問題,指出你要它看哪裡。
實用場景
讀圖表、抄手寫、解截圖、盤點實物。
提問技巧
怎麼問,決定它看見什麼。
已知地雷
計數、小字、空間關係與隱私風險。
從「用講的」到「給它看」
視覺輸入改變的是溝通成本。過去你得把眼前的東西翻譯成文字:「畫面左上角有一個齒輪圖示,按下去出現一排選單⋯⋯」,翻譯得不完整,答案就歪。現在你直接把截圖丟上去,問「為什麼我找不到匯出按鈕」,它看著跟你一樣的畫面回答。少掉一層轉述,就少掉一層失真。
技術上這叫多模態(multimodal):模型同時接收影像與文字,把兩者放在同一個脈絡裡理解。所以最好的用法從來不是丟一張圖問「這是什麼」,而是圖片與問題成對出現,你的文字負責把它的注意力引到對的地方。
五個一用就有感的場景
- 解讀圖表與報表:把統計圖或報表截圖丟給它,請它講出趨勢、異常點,或轉成表格文字。看不懂別人簡報裡的圖時特別好用。
- 手寫與白板數位化:會議白板、紙上筆記拍照上傳,請它整理成條列或行動清單。比自己重打快非常多。
- 看懂軟體畫面:卡在某個設定頁面、看到看不懂的錯誤視窗,截圖問它「我現在該按哪裡」,等於隨身帶一位看得到你螢幕的工程師朋友。
- 實物辨識與建議:拍冰箱裡的食材問能煮什麼、拍植物問照顧方式、拍家具擺設請它給佈置建議。
- 圖轉結構:把流程草圖、介面手稿丟給它,請它轉成文字流程、需求描述甚至程式碼骨架,從草稿到初版的距離被大幅縮短。
怎麼問,決定它看見什麼
跟純文字提示一樣,視覺提問也有基本功。第一,指定範圍:「看右下角那張表」比「看這張圖」精準。第二,指定輸出:「把圖裡的數字整理成兩欄表格」比「幫我看一下」有用。第三,給脈絡:告訴它這是什麼場合的圖、你打算拿答案做什麼,它的回答會立刻從泛泛描述變成對症下藥。
已知的地雷區
視覺能力進步很快,但幾個弱點目前仍然公認存在。精確計數不可靠:數合照裡有幾個人、貨架上有幾罐,常常差個一兩個。小字與模糊文字:解析度不夠的文字它會「猜著讀」,而且猜錯時語氣照樣自信。
空間與方位:左右、前後、重疊關係的描述偶爾會錯亂。共通的對策只有一個:涉及數量、金額、劑量的讀取,一律自己對照原圖驗證。
另一類地雷是使用邊界。醫療影像判讀、法律文件的效力判斷、以圖識人,這些要嘛風險太高、要嘛涉及隱私與倫理,都不是它該扮演的角色。上傳前也多看一眼畫面背景:桌上的合約、螢幕上的信箱、路人的臉,圖片洩漏資訊的能力遠比文字強。
把它當眼力好的助手,不是鑑定師
總結我的使用心法:它是一位眼力很好、動作很快、但偶爾看走眼的助手。適合交給它的是「看了之後幫我整理、解釋、起草」的工作,不適合交給它的是「看了之後替我做高風險判定」的工作。
分清楚這條線,視覺功能會是你日常裡用最順手的 AI 能力之一:因為這個世界上,值得看的東西實在比值得讀的文字多太多了。
延伸學習
寫給升國一的你的筆記術
寫給剛升上國中的你:筆記不是寫給老師看的,是寫給考前的自己看的。18 章 85 課圖文,從「為什麼要寫」講到七科各自怎麼記,附 78 份可以印出來寫的練習單,以及 80 課家長專區與 34 張三年筆記養成路徑圖。沒有閱讀期限,國一買、國三還在。
NT$ 3,599
HE201|Harness Engineering System Design(6 小時)
六小時的實作課:從 Blueprint 走到可以跑的規格,再用 No-code、n8n 低程式碼與程式碼三條路各做一次同一個 harness,最後處理可靠度——重試、錯誤處理、人工覆核。7 章 54 課,含常見坑與排錯、Capstone 實作,附學員講義 PDF。
NT$ 5,999

