🤖 AI 技術全景:核心知識地圖

作者TonTon Huang Ph.D.Deep Learning 101

本頁匯整了作者在 blog.twman.orgdeep-learning-101.github.io 發表的 AI 技術文章關鍵摘要,涵蓋從入門到企業部署的完整知識路徑。每個區塊均附有原文連結,適合做為 AI 學習地圖與快速查詢入口。

一、LLM 入門與硬體基礎

從零開始理解大型語言模型的原理、部署與硬體需求。這四篇文章構成了學習 LLM 的完整基礎路徑。

📘
大型語言模型 (LLM) 入門完整指南
從多代理系統(AutoGen、Dify、RAGFlow)到本地端 Ollama 部署,涵蓋 OCR 文件解析、AI 客服自動化、多模態工地分析等真實落地案例。強調地面層執行重於炒作,並深入分析本地 vs 雲端 API 的成本取捨。
#多代理 #本地部署 #RAGFlow #Ollama #實戰踩坑
🛑
踩完所有坑,LLM 就打完收工了嗎?
十年深度學習從業回顧(2016 起),從 Kaldi ASR 到現代 Whisper、AutoGen、GraphRAG 的演進歷程。ChatGPT 的崛起自動化了大量原本需要數年苦工的任務,但也揭示了「技術迭代速度要求持續學習」的殘酷現實。
#十年回顧 #LLM演進 #GraphRAG #持續學習
💻
LLM VRAM 估算指南:從預訓練到推論
詳解 LLM 在預訓練、SFT 微調、推論三階段的 VRAM 需求公式(FP16 = 每 10 億參數 2GB)。介紹 LoRA/QLoRA 如何將微調 VRAM 壓縮至接近推論水準,並分析 Gemini 3.0 時代 Context Window 取代參數量成為核心瓶頸的趨勢。
#VRAM估算 #LoRA #QLoRA #硬體規劃 #FP16
🐧
手把手建置深度學習開發環境
從 GPU 選型、Ubuntu 安裝、NVIDIA Driver/CUDA/cuDNN 到 Docker/NVIDIA-Docker 容器化的完整教學。記錄作者從 2016 年 GTX 960 到 2024 年 RTX 6000 Ada、A100 的硬體升級歷程。清潔容器化環境是省去未來無數除錯時間的關鍵投資。
#Ubuntu #CUDA #Docker #環境建置 #GPU選型
⚠️ 關鍵認知:在 LLM 時代,VRAM 容量而非計算速度才是硬體規劃的核心限制。全量微調一個 70B 模型需要超過 1TB 的 VRAM,而 QLoRA 可將需求壓縮到消費級 GPU 可接受的範圍。

二、RAG 系統與 AI Agent

企業 AI 落地的兩大核心技術路徑:知識庫問答(RAG)與自動化代理(Agent)。兩者都有大量常見的「看起來能跑、實際不堪用」的陷阱。

🔍
從零到一:打造高精準度 RAG 系統實戰指南
完整涵蓋文件切塊策略、Embedding 模型選型(Qwen3-Embedding-8B vs BGE-M3 vs Gemini Embedding 實測比較)、Hybrid Search(向量 + BM25)、Reranking,以及針對表格與複雜版面的 Visual RAG 架構。強調「單純向量搜尋結果極差」,結合切塊紀律+混合檢索+重排序才能將幻覺率壓至 5% 以下。
#RAG #HybridSearch #Reranking #VisualRAG #Embedding選型
🤖
AI Agent 開發必看:5 大實戰陷阱與底層架構解決方案
對比單一 AI Agent 與多代理 Agentic AI 系統,比較 LangGraph、AutoGen、CrewAI、MCP(模型上下文協定)框架。點出五大企業失敗模式(邏輯無限迴圈、API 費用失控等)並提供 OWASP Agentic Security 威脅因應。核心結論:穩健的 Agent 需要狀態機機制、Human-in-the-loop 護欄與 MCP 整合。
#AIAgent #LangGraph #MCP #AgenticAI #OWASP
✅ 實戰建議:RAG 不是萬能藥,Visual RAG(直接向量化頁面截圖)是解決含大量表格與版面複雜 PDF 的最佳方案。Agent 開發則務必設計「費用熔斷」與「最大步驟數」等護欄,避免無限遞迴消耗。

三、語音處理與自然語言處理

多年實戰累積的中文語音與 NLP 踩坑指南。中文環境的特殊性(繁體資料稀少、語境模糊、多說話者問題)使得直接套用英文方案往往失敗。

🎙️
ASR/TTS 開發避坑指南
聚焦 OpenAI Whisper 在中文環境的限制(標點不穩定、推論速度慢),推薦 faster-whisper、WhisperX 與阿里巴巴 FunASR(60,000 小時中文訓練)。涵蓋音訊前處理工具鏈(UVR5 人聲分離、Denoiser、Audio-Slicer)與 ASR 錯誤糾正(pycorrector、FastCorrect)。生產級語音系統需要模型+降噪前處理+後處理糾錯三位一體。
#Whisper #FunASR #TTS #語音降噪 #中文ASR
📝
那些自然語言處理 (NLP) 踩的坑
中文 NLP 實踐者必讀:繁體中文高品質資料集稀缺、缺乏繁中 SQuAD 等級的機器閱讀理解資料、ASR 輸出文字糾錯、類別不平衡的文本分類、中文 NER 斷詞邊界模糊。解決方案涵蓋 BERT 微調、PyCorrector、Seq2Seq、加權損失函數、CRF+BERT for NER。
#NLP #BERT #NER #文本糾錯 #繁體中文
🔊
那些語音處理 (Speech Processing) 踩的坑
五大語音處理挑戰:聲紋識別(VoxCeleb2、d-vector/x-vector)、Kaldi 中文 ASR(AISHELL 語料)、語音增強/降噪(DCCRN、Deep Complex U-Net)、說話者分離(雞尾酒會問題),以及流式推論的模型壓縮。真實部署需要強力前處理+輕量模型+多說話者分離的整合方案。
#聲紋識別 #Kaldi #語音降噪 #說話者分離 #模型壓縮
⚠️ 繁體中文天坑:資料品質與在地化標注才是中文 NLP/語音專案的真正天花板。英文套件直接移植繁中環境幾乎必定失敗,需針對在地資料進行標注與微調。

四、企業 AI 策略與台灣 LLM 評測

面向企業決策者的 AI 導入指南,以及針對繁體中文、台灣在地知識的 LLM 評測報告。

🏢
企業 AI 導入完整指南 2026:10 大致命錯誤
為企業決策者量身打造,歸納十大失敗模式(架構漂移、幻覺風險、IP 法律責任、ROI 不明確等),並提供從 POC 到規模化的路線圖,強調嚴格資料治理與安全護欄。收錄台灣上市公司(金融、製造、電信)在 2024-2025 年的 GenAI 真實部署案例對照表。
#企業AI #ROI #資料治理 #10大失敗 #POC
📊
臺灣大型語言模型性能評測與在地化策略
比較台灣在地化 LLM(Llama-3-Taiwan、TAIDE、Breeze2)與國際模型在繁體中文基準(TMLU、TMMLU+、TW Legal Eval、Truthful QA)的表現,並評估 RAG 場景的 Embedding 模型(Qwen3-Embedding、Gemini Embedding)與 Reranker。結論:針對台灣法律、金融、醫療知識優化的模型,在在地 RAG 場景中顯著優於通用模型。
#TAIDE #TMMLU #繁體中文評測 #RAG選模 #台灣LLM
✅ 選模策略:若 RAG 知識庫涉及大量繁體中文法律、財報或醫療文件,優先考慮在地化微調模型(如 TAIDE)搭配 Qwen3-Embedding 作為 Embedding,效果遠超通用英文模型。

五、工具與實戰生態

兩個讓 AI 開發更高效、更安全的實戰工具指南:Claude Code 作為下一代 AI 編碼代理,以及 Cloudflare Tunnel 作為零信任內網穿透方案。

⌨️
Claude Code 完全整合指南 2026
深度介紹 Claude Code 作為終端機原生 AI Agent 的核心機制:CLAUDE.md 專案記憶、Plan Mode、context 管理、Skills 四層工程學科架構,以及 free-claude-code 本地閘道與 cc-connect 整合。Claude Code 與 Copilot/Cursor 的根本差異在於它理解整個專案系統,能自主執行跨檔案任務。附有大型 Repo 企業部署常見失敗模式的反模式對照表。
#ClaudeCode #CLAUDE.md #PlanMode #Skills #企業部署
🌐
Cloudflare Tunnel:免公網 IP 架設內網穿透
3 分鐘實作 Cloudflare Zero Trust Tunnel,讓 SSH、HTTP、RDP 服務無需公網 IP 或開防火牆埠口即可安全暴露。涵蓋 cloudflared 系統服務自動啟動,以及 Windows 機器無固定外部 IP 時的反向 SSH Tunnel 方案。核心應用場景:為企業內部的 RAG 系統、LLM API 設置身份驗證與稽核存取控制。
#Cloudflare #ZeroTrust #內網穿透 #安全存取 #SSH

六、學習路徑建議

🆕 AI 新手入門路徑

🏗️ 企業 AI 落地路徑

🎙️ 語音/NLP 專項路徑