AI 應用地圖 · 聲音/音樂

Whisper

語音轉文字常用方案(可自建或整合到產品)

在互動地圖中開啟 回AI 應用地圖
  • 開發型態Pro-code

觀念教學

OpenAI 開源的語音轉文字模型,幾乎成了 STT 的代名詞 — 你手上的逐字稿工具,底層很可能就是它。

它是什麼

  • 開發商:OpenAI(模型以開源形式釋出,可自行部署)
  • 核心能力:語音轉文字(Speech-to-Text) — 多語言辨識與翻譯,可自建部署,也常被整合進各種產品
  • 同類定位:AssemblyAI 是託管 API 全餐,Whisper 是開源引擎 — 自己架、自己養,換來資料不出門

典型情境

  • 會議錄音在公司內部伺服器轉逐字稿,資料不外流
  • 開發者把它整合進產品,加上字幕或語音輸入功能
  • 研究者批次處理訪談錄音,產出可分析的文字資料
  • 多語言影片自動產生字幕初稿,人工只做校對

選型重點

  • 地端部署、資料主權、成本可控 → 自建 Whisper;要免維運、還要摘要與說話者分離等加值 → AssemblyAI;方向相反的「文字轉語音」→ ElevenLabs
  • Pro-code 屬性:需要工程能力與運算資源,非工程團隊建議用包好它的現成產品
  • 注意:辨識品質受口音、雜訊影響,重要文件仍需人工校對
💡 一句話記憶:Whisper = 開源的耳朵,聽懂多國語言,還能搬回家自己架。

iPAS 考點

科目二方向辨析必考:Whisper 屬「語音轉文字(STT)類」,判斷關鍵字是語音轉文字、開源、多語言。陷阱一:和 TTS(ElevenLabs)方向搞反;陷阱二:題目給「資料不能上雲」情境,答案是可自建的 Whisper,不是雲端 API。開源身分也常入題:題目強調「不依賴外部 API、可接受自行維運」,同樣指向 Whisper。

應用場景

語音轉文字開源多語言

外部連結

相關節點