👁️ 電腦視覺 (CV) 資源總整理

2026 開源模型選型指南 · 持續追蹤最新進展

作者TonTon Huang Ph.D.更新:2026-07-28

本頁為電腦視覺各主題的快速導覽入口,涵蓋異常檢測、目標偵測、圖像分割、OCR、擴散模型、虛擬數字人與 DeepFake 偵測。詳細論文解析、模型比較與實戰踩坑請前往完整版:

工業 AOI YOLO 生態系 SAM 分割 OCR & Document AI Diffusion & 影片生成 Digital Human

最新快訊 Latest Updates

📅 2026-08-17 更新快訊

🔥 2026-06 REF+CFA [CVPR 2026]:跨域異常檢測、擴散非平穩殘差場、無監督遷移
🔥 2026-06 VL-DINO:開放詞表檢測、CLIP 雙線並用、肥訓練瘦推理、長尾類別 SOTA
🔥 2026-06 RMAE-ProGRess [CVPR 2026]:非結構化語義分割、LCA 輕量通道注意力、越野與遙感特化
🔥 2026-06 SOPSeg [CVPR 2026]:遙感小目標實例分割、區域自適應放大 RAM、定向提示 OPM
🔥 2026-06 SFS-DETR [CVPR 2026]:無人機小目標檢測、空間-頻率自適應選擇、96 FPS 即時感知
🔥 2026-03 DEUS [CVPR 2026]:開放世界目標檢測、ETF 雙子空間、能量分離 EUS
🔥 2025-06 DAMO-YOLO:工業落地 SOTA、TinyNAS 搜尋、Efficient RepGFPN、AlignedOTA 標籤分配
🔥 2026-07 SenseNova-Vision:視覺任務大一統、統一多模態生成 UMM、免專屬預測頭、7B-MoT
🔥 2026-03 O2MAG [CVPR 2026]:免訓練缺陷擴樣、三路注意力嫁接 TriAG、異常引導優化 AGO
🔥 2026-05 Stream3D [CVPR 2026]:流式 3D 重建與生成、自適應證據記憶、免訓練機制

📅 2026-07-25 更新快訊

🔥 2026-07 MV3DT:多視角 3D 追蹤、去中心化架構、自動標定、DeepStream 整合
🔥 2026-07 Wan-Streamer:全球首款端到端全雙工音視訊交互大模型,模型側 ~200ms 亞秒回應
🔥 2026-03 VisualAD [CVPR 2026]:零樣本異常檢測、視覺純化、13 個工業與醫療基準全面 SOTA
🔥 2026-03 MAGIC [CVPR 2026]:少樣本缺陷生成全新 SOTA,打通學術與產線現實的擴散模型神作
🔥 2026-03 MoECLIP [CVPR 2026]:零樣本異常檢測(ZSAD)14 個跨域資料集全線稱霸
🔥 2026-03 EReCu [CVPR 2026]:無監督偽裝目標檢測、師生自進化閉環框架

主題分類 Topics

🏭
Anomaly Detection
工業 AOI 異常檢測。涵蓋零樣本 (WinCLIP、CoPS、VisualAD) 與少樣本 (OneNIP、FastRef、SubspaceAD) 前沿方案,CVPR 2026 精選速覽。
#零樣本 #AOI #PatchCore #CLIP
🎯
Object Detection
YOLO 家族生態系(v8/v9/v10/v11)、開放詞彙 OV-DINO、小目標偵測、多視角 3D 追蹤與即時邊緣運算方案。
#YOLOv11 #OpenVocabulary #EdgeAI #3D
✂️
Segmentation
SAM 家族(SAM 3、SAM 2、SAM3-I)、零樣本分割、醫療影像特化、弱監督與跨視角分割最新進展。
#SAM3 #ZeroShot #醫療影像 #弱監督
📖
OCR & Document AI
高精度 OCR(PaddleOCR v6、Chandra、MinerU 2.5-Pro)、PDF 解析清洗、RAG 前處理管線與 LayoutLM 家族。
#PaddleOCR #MinerU #RAG前處理 #LayoutAI
🎨
Diffusion Model
文生圖(Flux、SANA)、影片生成(Wan-Video、SkyReels V2)、ComfyUI 工具鏈與工業瑕疵資料生成方案。
#Flux #SANA #影片生成 #ComfyUI
🧑‍💻
Digital Human
語音驅動虛擬人(SoulX-FlashTalk、EchoMimic V3、Live Avatar)、即時互動系統與全離線部署方案。
#LipSync #RealTime #StreamGeneration
🖼️
Image Recognition
ViT、Swin Transformer、EfficientNetV2 基礎架構,以及 EUPE 通用感知編碼器與 Sapiens2 人體視覺大模型。
#ViT #SwinTransformer #基礎架構
🕵️
DeepFake Detection
多重注意力機制、精確幾何特徵與 3D 臉部解構三大 CVPR 2021 經典防禦架構,防範 AIGC 換臉偽造。
#換臉偵測 #資安防禦 #CVPR2021

實戰選型建議

✅ AOI 零樣本冷啟動:無缺陷樣本 → 優先評估 CoPS / LAVIDA / VisualAD;有少量樣本 → 看 FastRef / SubspaceAD / OneNIP;需跨品類統一部署 → 看 Uni-RCM
✅ YOLO 選型:台灣原生首選 YOLOv9(中研院王建堯)高參數利用率;生態最完整選 YOLOv8/v11;邊緣運算無後處理選 YOLOv10(清華,無 NMS)。
✅ OCR / RAG 前處理:企業私有化知識庫 → MinerU 2.5-Pro + PaddleOCR-VL-1.6;高併發雲端服務 → Falcon OCR (0.3B, 5825 tok/s);多語言財報/論文 → Chandra OCR 2
⚠️ 選型踩坑:DINOv3 在可見光 RGB 表面缺陷上「凍結骨幹躺贏」是偽命題,需全參數微調才有效;X-ray 等強模態偏移任務反而 ImageNet 預訓練更穩健。詳見 Rethinking Transfer Learning 論文。

常見問題 FAQ

Q1:工業 AOI 瑕疵樣本太少怎麼辦?
採用基於 PatchCore 的無監督異常檢測方案,僅需約 50–100 張「正常樣本」即可建立基準,檢出率可達 98% 以上。或導入 TF-IDG / MAGIC 生成合成瑕疵資料進行資料增廣。
Q2:邊緣運算 (Edge AI) 該選哪個物體偵測模型?
首選 YOLOv11 或 YOLOv9。Jetson Nano 級設備上 INT8 量化後可維持 30 FPS 以上即時偵測;需無 NMS 超低延遲則選 YOLOv10。
Q3:如何快速標註大量圖像分割資料集?
導入 LuoHuaLabel(SAM 3 驅動)作為輔助工具,點擊目標即可自動生成邊界,實測可節省 85% 以上人工框選時間,支援 OBB 旋轉框與 YOLO 格式匯出。
Q4:傳統 OCR 無法處理複雜表格怎麼解?
改用 MinerU 2.5-Pro 或 PaddleOCR-VL-1.6 進行端到端解析,版面分析與文字提取的綜合準確率可達 96% 以上,適合作為 RAG 知識庫前處理管線。
Q5:虛擬數字人的口型延遲可以多低?
結合 3D Gaussian Splatting 與輕量化語音驅動模型(如 SoulX-LiveAct),端到端口型同步延遲已可穩定控制在 50ms 以內;SoulX-FlashTalk 可達 0.87 秒極速啟動 + 32 FPS 即時串流。
👁️

查看完整論文解析與選型指南

包含 CVPR 2026 精選速覽、各模型深度技術解讀、GitHub 連結與推薦場景說明。

前往 Deep Learning 101 完整版 →