🎤 語音處理 (Speech AI) 資源總整理

2026 開源選型指南 · ASR・TTS・聲紋・增強・分離 · 持續追蹤

作者TonTon Huang Ph.D.更新:2026-07-28

本頁為語音處理各主題的快速導覽入口,涵蓋語音辨識 (ASR)、語音合成 (TTS)、聲紋辨識、語音增強去噪、語者分離與全雙工即時對話框架。每個子主題都源自團隊投入 ~150 天的實戰踩坑經驗。

💡 核心原則:「垃圾進,垃圾出」在語音領域比影像或文本更嚴重。與其花時間微調模型,不如先好好清洗音檔、處理好降噪與 VAD。

ASR 語音辨識 TTS 語音合成 聲紋辨識 語音增強 語者分離

最新快訊

📅 2026-08-17 更新

🔥 2026-07 Qwen-Audio-Agent:全雙工語音 Agent 框架,支援非阻塞多任務、ACP 協議生態與擇時結果回流
🔥 2026-07-23 VibeVoice-ASR-BitNet:CPU 極速即時轉寫,BitNet 三值量化 + 1.58GB 壓縮,效能超越 Whisper.cpp
🔥 2026-08 Luna-TTS:擴散式語言模型 TTS,全並行生成,首包延遲僅 41.6ms,Seed-TTS-Eval 四項第一

📅 2026-07-25 更新

🔥 2026-07 Wan-Streamer:全球首款端到端全雙工音視訊交互大模型,模型側 ~200ms 亞秒回應
🔥 2026-06 Nemotron-Labs-Audex (30B-A3B / 2B):統一音訊文本模型、單一解碼器、開源通用音效生成
🔥 2026-06 parakeet.cpp:C++17 重寫 NVIDIA Parakeet,CPU 比 Whisper large-v3-turbo 快 27 倍,WER 零損失
🔥 2026-05 Mega-ASR:真實世界複合聲學退化抗噪 ASR,200 萬筆野外合成數據,A2S-SFT 漸進式訓練
🔥 2026-04 MAI-Transcribe-1 (Microsoft):25 種語言超越 Whisper-large-v3,批量轉寫速度 2.5 倍,$0.36/小時
🔥 2026-04 SpeakerRPL V2:開放集聲紋辨識 EER 從 1.72% → 0.24%(降幅 93%),LogitNorm + RPL 混合損失

主題地圖 · 各子領域導覽

🎙️
ASR 語音辨識
目標:讓電腦聽懂「說了什麼」。Whisper 生態系、FunASR、即時對話框架(LiveKit / TEN),以及中文方言特化模型(FireRedASR2S、VibeVoice、Qwen3-ASR)完整選型。
#Whisper #FunASR #LiveKit #即時對話
🔐
聲紋辨識
目標:辨識「是誰說的」。i-vector → d-vector → x-vector 技術脈絡,1:1 驗證與 1:N 識別,ECAPA-TDNN、WeSpeaker、SincNet 實戰選型,EER / FRR / FAR 指標詳解。
#聲紋 #EER #ECAPA-TDNN #WeSpeaker
🎧
語音增強 / 去噪
目標:從噪音中提取純淨人聲。Meta Denoiser (DEMUCS 架構)、DCCRN(Interspeech 冠軍)、Deep Complex U-Net,最終煉出 9MB / RTF=0.08 的極致輕量模型。
#DCCRN #MetaDenoiser #ClearVoice #RTF
👥
語者分離
目標:解決「雞尾酒會問題」,分離多個說話人的聲音。TasNet → Conv-TasNet → DPRNN → DPT-Net 架構演進,VoiceFilter / MossFormer / TOLD 實戰。
#TasNet #DPRNN #VoiceFilter #MossFormer
🗣️
TTS 語音合成
目標:讓 AI 說出人聲。零樣本克隆(GPT-SoVITS、CosyVoice、Fish Audio S2-Pro)、歐美開源(Kokoro、Orpheus)與即時對話 TTS 完整覆蓋。
#零樣本克隆 #GPT-SoVITS #CosyVoice #Fish
🤝
全雙工即時對話
目標:打造 ChatGPT Voice 級別體驗。LiveKit(語義輪次偵測)、TEN Framework(VAD + 輪替)、Sherpa-ONNX(邊緣端側)、Seeduplex(字節跳動全雙工)。
#LiveKit #WebRTC #VAD #全雙工

ASR 開源模型快速比較

模型 優勢 推薦場景
Whisper / WhisperX 通用高精度,詞級時間戳 字幕、會議轉寫
FunASR (阿里) 6 萬小時中文訓練,標點強 中文專用、邊緣部署
FireRedASR2S VAD+LID+ASR+Punc 四合一,方言最強 短影音字幕、方言客服
Qwen3-ASR 52 種語言,方言霸主 多語種客服、出海應用
parakeet.cpp 純 C++,CPU 快 27 倍於 Whisper large 邊緣 / IoT / 嵌入式
MAI-Transcribe-1 25 語言超越 Whisper,$0.36/小時 企業高併發雲端轉寫

實戰選型建議

✅ 中文 ASR 冷啟動:一般場景 → FunASR + WhisperX;方言/短影音 → FireRedASR2S;邊緣離線 → parakeet.cpp / Moonshine;商用高併發 → MAI-Transcribe-1
✅ 全雙工語音 Agent:LiveKit Agents(語義輪次偵測,500ms 重疊語音下召回率 100%)或 TEN Framework(自帶 VAD + 輪替偵測);端對端延遲可穩定在 300ms 以內。
✅ TTS 零樣本克隆:中文首選 GPT-SoVITS(1 分鐘樣本)、CosyVoice 3(3 秒克隆);即時對話選 Orpheus TTS(25ms 延遲);輕量邊緣選 Kokoro / Supertonic v3(CPU 可跑)。
⚠️ 常見踩坑:中文公開語料(aishell / aidatatang)幾乎全是中國大陸口音,台灣口音辨識率會明顯偏低;想達到商用級別,訓練數據至少需要 1 萬小時以上。另,百度雲盤直接封鎖台灣 IP,下載中文數據集務必準備 VPN。

常見問題 FAQ

Q1:即時語音 AI 頻繁搶話怎麼解決?
棄用傳統音量 VAD,改用內建「語義輪次檢測」的 LiveKit Agents 框架,可精準區分真實打斷與咳嗽等噪音,解決 90% 搶話問題。
Q2:如何降低 Whisper 的顯存消耗並加速?
採用 WhisperXFaster-Whisper 架構進行 INT8 量化,實測可減少 70% VRAM 佔用,並將轉寫速度提升 4 倍以上。
Q3:ASR、聲紋辨識、語音增強、語者分離有什麼差別?
ASR 解決「說了什麼」,聲紋解決「是誰說的」,語音增強解決「噪音清除」,語者分離解決「多人同時說話時如何拆開每個人的聲軌」。四者常搭配使用,但技術架構完全不同。
Q4:背景噪音大導致 ASR 錯誤怎麼辦?
在 ASR 前加入語音增強模組(如 Meta DenoiserDCCRN)進行預處理,可提升 20% 以上的惡劣環境辨識率。亦可評估 SenseVoice(內建情感與噪音事件偵測)。
Q5:少量參考音檔能做到高精度聲音克隆嗎?
可以。使用 CosyVoice 3Fish Audio S2-Pro 等零樣本模型,僅需 3~5 秒清晰參考音頻,即可生成 MOS 分數 >4.2 的高品質語音。
🎤

查看完整論文解析與選型指南

包含 ASR / TTS / 聲紋 / 增強 / 分離各主題深度技術解讀、GitHub 連結、資料集彙整與實戰踩坑筆記。

前往 Deep Learning 101 完整版 →