傳統算法 vs LLM · 成本效益選型 · 2018–2026 實戰血淚彙整
ChatGPT、Gemini、Claude 等大型語言模型確實能完成文本分類、NER、問答等幾乎所有 NLP 任務,且效果往往超越傳統模型。但這不代表傳統 NLP 算法已死。
現實是:每呼叫一次 GPT-4o 處理一筆文本,費用約 0.01–0.1 美元;一個日均百萬筆請求的客服系統,光 API Token 費用一個月就燒掉幾十萬台幣。反觀一個微調好的 BERT-base 模型,部署在 CPU 伺服器上,推論一筆僅需 0.1 秒,每月邊際成本趨近於零。
| 維度 | 傳統 NLP(BERT 微調)推薦:封閉域任務 | 大型語言模型(GPT/Gemini/Claude)推薦:開放域任務 |
|---|---|---|
| 推論成本 | 每千筆 <$0.01(GPU/CPU 自架) | 每千筆 $5–100(視 Token 量) |
| 延遲 | CPU 0.1s / GPU <0.01s | API 0.5–5s(網路+推論) |
| 訓練數據量 | 需 1,000–10,000 筆標注數據 | 零樣本可用,少量 few-shot 即強 |
| 可控性 | 輸出格式穩定,分類 100% 可控 | 需 prompt engineering,有幻覺風險 |
| 部署靈活度 | 可完全私有化部署,無資安外洩疑慮 | 雲端 API 有資料外洩風險;私有化需要 A100 |
| 新任務擴充 | 需重新標注、重新訓練 | 修改 prompt 即可,幾乎零額外成本 |
| 適用場景 | 固定分類、批量處理、即時低延遲、隱私敏感 | 開放問答、摘要、多步推理、新場景快速驗證 |
| 任務 | 場景描述 | 優先選擇 | 備用方案 |
|---|---|---|---|
| 📂 文本分類 | 固定 N 類、批量、即時 | BERT 微調 F1 83–92%,CPU 0.1s | 新類別快速驗證用 LLM few-shot |
| 🏷️ NER | 固定實體類型(人名/地名/時間) | BERT+CRF / UIE | 新領域實體(醫療/法律)→ LLM+prompt |
| 🔗 文本相似度 | Q&A 比對、知識庫檢索 | Sentence-BERT / BGE Embedding | 語意理解(反諷/隱語)→ LLM reranker |
| 📖 MRC | 固定文件庫問答(FAQ/知識庫) | BERT + RAG 混合 | 開放域、多步推理 → LLM (GPT/Gemini) |
| ✍️ 糾錯 | ASR 同音字錯誤(即時修正) | MacBERT / pycorrector | 語法/語意錯誤(長文修改)→ LLM |