多模態與應用

STT 語音轉文字是什麼?把錄音一鍵變成逐字稿

STT 是 Speech-to-Text,語音轉文字,也叫聽寫。它把人的語音、錄音檔或會議音訊,透過語音辨識模型精準轉換成可編輯的文字逐字稿,通常支援多語言、口音辨識、說話人分離與時間戳記,可匯出成純文字、字幕或結構化檔案。
STT 語音轉文字是什麼?把錄音一鍵變成逐字稿:文章重點卡

STT 語音轉文字是什麼?把錄音一鍵變成逐字稿

兩小時的會議錄音,人工聽打要四小時起跳。語音轉文字幾分鐘就給你一份帶時間戳記的逐字稿,剩下的只是校對。

它是很多 AI 工作流的第一步。逐字稿出來之後,摘要、待辦、字幕、知識庫,全都接得上去。

你將學到什麼

定義

把語音或錄音檔透過語音辨識模型轉換成可編輯的文字逐字稿。

白話比喻

像一位打字很快的聽寫員,還會標時間、分辨說話的人。

跟誰容易搞混

跟文字轉語音方向相反。文字轉語音是把字唸出來,語音轉文字是把話寫下來。

定義

STT 的全名是 Speech-to-Text,中文叫語音轉文字或聽寫。它能將人類語音內容轉換成可編輯的文字,透過深度學習的語音辨識模型,實現高準確率的轉寫。

四個核心特色:高精準度多語言支援辨識多種口音多格式輸出。輸出可以是純文字、文件檔、字幕檔或結構化資料。

進階功能還包含長時間音訊辨識、說話人分離、專業術語客製化與背景音樂過濾。

白話比喻

它就是一位打字很快的聽寫員,而且比人多兩個本事:每一句都標上時間,還能分辨這句是誰講的。

所以它交出來的不只是一整段文字,而是一份可以跳轉定位的逐字稿。你要找「第三十七分鐘那段結論」,點一下就到。

STT 跟 TTS 差在哪?

比較點STT 語音轉文字TTS 文字轉語音
方向聲音變文字文字變聲音
輸入錄音檔或即時語音一段文字稿
輸出逐字稿、字幕、結構化資料語音檔、旁白、朗讀內容
典型用途會議紀錄、訪談整理、影片字幕有聲內容、語音導覽、無障礙朗讀
常見難點口音、專業術語、背景噪音情感語調、斷句、名詞唸法

實際用例

應用場景很集中:會議紀錄自動產生逐字稿、訪談與採訪快速整理、課程與演講生成講義與字幕、客服對話記錄以優化服務品質、影片字幕自動生成節省後製時間、醫療紀錄語音輸入減輕護理負擔。

我自己的用法是把它當工作流的第一段。錄音進來先轉逐字稿,再交給模型做摘要與待辦整理,最後有價值的段落才進知識庫。中間這幾步都自動化,只有最後的取捨要人做。

常見誤解第一個誤解是把逐字稿當成會議紀錄。逐字稿是原料,還要經過摘要與整理才是紀錄。第二個是以為準確率高就不用校對,人名、品牌名與專有名詞仍然是重災區,重要文件一定要有人看過一遍。
本文源起本文內容出自酒Ann 的「AI 實戰陪跑班」課程教材,由酒Ann 編寫成彙編條目。想系統性搞懂 AI 名詞,歡迎追蹤 酒Ann 的 Facebook

延伸學習

把這篇文章分享給需要的人FacebookLINEThreadsX

常見問答

語音轉文字的流程是什麼?
五步:上傳音訊或即時錄音、降噪與分段等語音處理、用語音辨識模型把語音轉成文字、產出帶時間戳記的逐字稿、後處理斷句標點與格式化,再匯出成需要的檔案格式。
中文跟口音辨識得準嗎?
主流模型支援上百種語言與方言,對常見口音的辨識已經相當可用,但專業術語、人名與品牌名仍容易出錯。做法是匯入自訂詞彙表提高特定領域的準確率,並在重要場合保留人工校對。
隱私怎麼辦?
看部署方式。可以走雲端 API,也可以本地部署或私有化部署。內容敏感的會議與訪談建議選本地或私有方案,並確認服務商的資料保存與訓練使用政策。