多模態與應用
STT 語音轉文字是什麼?把錄音一鍵變成逐字稿
STT 是 Speech-to-Text,語音轉文字,也叫聽寫。它把人的語音、錄音檔或會議音訊,透過語音辨識模型精準轉換成可編輯的文字逐字稿,通常支援多語言、口音辨識、說話人分離與時間戳記,可匯出成純文字、字幕或結構化檔案。
STT 語音轉文字是什麼?把錄音一鍵變成逐字稿
兩小時的會議錄音,人工聽打要四小時起跳。語音轉文字幾分鐘就給你一份帶時間戳記的逐字稿,剩下的只是校對。
它是很多 AI 工作流的第一步。逐字稿出來之後,摘要、待辦、字幕、知識庫,全都接得上去。
你將學到什麼
定義
把語音或錄音檔透過語音辨識模型轉換成可編輯的文字逐字稿。
白話比喻
像一位打字很快的聽寫員,還會標時間、分辨說話的人。
跟誰容易搞混
跟文字轉語音方向相反。文字轉語音是把字唸出來,語音轉文字是把話寫下來。
定義
STT 的全名是 Speech-to-Text,中文叫語音轉文字或聽寫。它能將人類語音內容轉換成可編輯的文字,透過深度學習的語音辨識模型,實現高準確率的轉寫。
四個核心特色:高精準度、多語言支援、辨識多種口音、多格式輸出。輸出可以是純文字、文件檔、字幕檔或結構化資料。
進階功能還包含長時間音訊辨識、說話人分離、專業術語客製化與背景音樂過濾。
白話比喻
它就是一位打字很快的聽寫員,而且比人多兩個本事:每一句都標上時間,還能分辨這句是誰講的。
所以它交出來的不只是一整段文字,而是一份可以跳轉定位的逐字稿。你要找「第三十七分鐘那段結論」,點一下就到。
STT 跟 TTS 差在哪?
| 比較點 | STT 語音轉文字 | TTS 文字轉語音 |
|---|---|---|
| 方向 | 聲音變文字 | 文字變聲音 |
| 輸入 | 錄音檔或即時語音 | 一段文字稿 |
| 輸出 | 逐字稿、字幕、結構化資料 | 語音檔、旁白、朗讀內容 |
| 典型用途 | 會議紀錄、訪談整理、影片字幕 | 有聲內容、語音導覽、無障礙朗讀 |
| 常見難點 | 口音、專業術語、背景噪音 | 情感語調、斷句、名詞唸法 |
實際用例
應用場景很集中:會議紀錄自動產生逐字稿、訪談與採訪快速整理、課程與演講生成講義與字幕、客服對話記錄以優化服務品質、影片字幕自動生成節省後製時間、醫療紀錄語音輸入減輕護理負擔。
我自己的用法是把它當工作流的第一段。錄音進來先轉逐字稿,再交給模型做摘要與待辦整理,最後有價值的段落才進知識庫。中間這幾步都自動化,只有最後的取捨要人做。
常見誤解第一個誤解是把逐字稿當成會議紀錄。逐字稿是原料,還要經過摘要與整理才是紀錄。第二個是以為準確率高就不用校對,人名、品牌名與專有名詞仍然是重災區,重要文件一定要有人看過一遍。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook。
延伸學習
常見問答
語音轉文字的流程是什麼?
五步:上傳音訊或即時錄音、降噪與分段等語音處理、用語音辨識模型把語音轉成文字、產出帶時間戳記的逐字稿、後處理斷句標點與格式化,再匯出成需要的檔案格式。
中文跟口音辨識得準嗎?
主流模型支援上百種語言與方言,對常見口音的辨識已經相當可用,但專業術語、人名與品牌名仍容易出錯。做法是匯入自訂詞彙表提高特定領域的準確率,並在重要場合保留人工校對。
隱私怎麼辦?
看部署方式。可以走雲端 API,也可以本地部署或私有化部署。內容敏感的會議與訪談建議選本地或私有方案,並確認服務商的資料保存與訓練使用政策。
