2026 開源選型指南 · ASR・TTS・聲紋・增強・分離 · 持續追蹤
作者:TonTon Huang Ph.D. | 更新:2026-07-28
本頁為語音處理各主題的快速導覽入口,涵蓋語音辨識 (ASR)、語音合成 (TTS)、聲紋辨識、語音增強去噪、語者分離與全雙工即時對話框架。每個子主題都源自團隊投入 ~150 天的實戰踩坑經驗。
💡 核心原則:「垃圾進,垃圾出」在語音領域比影像或文本更嚴重。與其花時間微調模型,不如先好好清洗音檔、處理好降噪與 VAD。
📅 2026-08-17 更新
📅 2026-07-25 更新
| 模型 | 優勢 | 推薦場景 |
|---|---|---|
| Whisper / WhisperX | 通用高精度,詞級時間戳 | 字幕、會議轉寫 |
| FunASR (阿里) | 6 萬小時中文訓練,標點強 | 中文專用、邊緣部署 |
| FireRedASR2S | VAD+LID+ASR+Punc 四合一,方言最強 | 短影音字幕、方言客服 |
| Qwen3-ASR | 52 種語言,方言霸主 | 多語種客服、出海應用 |
| parakeet.cpp | 純 C++,CPU 快 27 倍於 Whisper large | 邊緣 / IoT / 嵌入式 |
| MAI-Transcribe-1 | 25 語言超越 Whisper,$0.36/小時 | 企業高併發雲端轉寫 |
包含 ASR / TTS / 聲紋 / 增強 / 分離各主題深度技術解讀、GitHub 連結、資料集彙整與實戰踩坑筆記。
前往 Deep Learning 101 完整版 →