這套筆記怎麼用
先看懂「地圖」,再走進「細節」——這是本筆記與零散考古題整理最大的不同。
iPAS AI 應用規劃師(初級)的考試內容,其實可以被還原成一條「機器學習專案的生產線」:從資料進來,到模型上線。本筆記把所有名詞,都釘在這條生產線的正確位置上,而不是把 60 幾個名詞當成互不相干的單字卡。
左側選單依「知識領域 A~H」與「章節內小節」分組;點擊任一小節,右側會直接捲動到該段落。頁面上方會有一條「六步驟流程條」,隨時提醒你現在讀到的內容,屬於整條生產線的哪一段。
全課程知識地圖:8 大領域
AI、ML、DL 的關係與三大學習典範
三個名詞常被混用,但它們是「包含關係」,不是三個平行的東西。
| 類型 | 資料特性 | 代表方法 |
|---|---|---|
| 監督式學習 | 有標準答案(標籤) | SVM、KNN、CNN |
| 非監督式學習 | 無標籤,讓模型自行找出資料結構 | K-means、VAE |
| 強化學習 | 透過獎勵訊號、不斷試錯來學習 | Q-Learning、RLHF |
機器學習六步驟工作流程:本章的骨幹
這張流程圖是整套 A~H 章節的「主幹道」——後面每一頁,都能對應回這裡的某一段。
這六步驟就是 A~H 章的骨幹:STEP 4 對應「損失函數與經典演算法(B 章)、神經網路(C 章)」;STEP 5 對應「可解釋 AI(D 章)」;STEP 6 對應「系統治理(H 章)」。
EDA 探索性資料分析
在正式建模之前,先「看懂資料」,而不是急著丟進模型。
📊 常用統計方法
- 平均值、中位數、標準差
- 最大值、最小值、四分位數
- 相關係數矩陣
📈 常用視覺化方法
- 直方圖:看資料的分佈形狀
- 散佈圖:看兩個變數之間的關係
- 箱型圖:看是否存在異常值
ETL 資料處理流程
資料進入模型前的標準加工程序。
| 階段 | 內容 |
|---|---|
| Extract 萃取 | 從資料庫、API、CSV 等來源讀取原始資料 |
| Transform 轉換 | 清理異常值、補齊缺失值、進行編碼、標準化 |
| Load 載入 | 將處理完成的資料寫入訓練系統或資料庫 |
Transform(轉換)這一步,正是接下來三節的內容:特徵編碼、離群值處理、SMOTE,全部都屬於「轉換」階段的工作。
類別特徵編碼:One-hot 與 Label Encoding
機器學習模型只認得數字,文字類別必須先轉換——但轉換方式選錯,會誤導模型。
| 編碼方式 | 適用情境 | 特性 |
|---|---|---|
| One-hot Encoding | 無自然順序的類別(地區、資費方案、性別) | 每個類別轉成獨立 0/1 欄位,不強加數值大小關係;欄位數會隨類別數增加 |
| Label/Ordinal Encoding | 有順序關係的類別(學歷、評等) | 轉成整數,不增加欄位數;但可能誤導模型認為數字大小具有意義 |
| Target Encoding | 類別與目標變數有統計關聯 | 以目標變數的統計值編碼,效果強但需特別防止資料洩漏 |
✅ 適合 One-hot 的情境
- 電信資費方案(基本/進階/企業)——彼此無大小關係
- 客戶所在地區(台北/台中/高雄)
- 模型是線性模型、SVM、神經網路等對數值大小敏感的演算法
✅ 適合 Label Encoding 的情境
- 學歷(小學<國中<高中<大學<研究所)——本身就有順序
- 類別數非常多(高基數),想節省記憶體
- 模型是樹模型(決策樹、隨機森林、XGBoost)
離群值處理:保險理賠金額案例
連續數值的離群值,處理方式和「類別編碼」是兩件完全不同的事——這是最容易被考題誤導的地方。
❌ 最不適合的做法
用 One-hot 編碼把離群值轉成類別特徵——理賠金額是連續數值,硬轉成類別會破壞金額原本的大小意義,也無法真正降低離群值的影響。
✅ 較適合的做法
- Z-score/IQR:先判斷哪些資料可能是離群值
- 截尾 Trimming:刪除極端值(但須先確認是否為真實重大事故)
- Winsorization:將超過門檻的數值裁切至門檻值,而非直接刪除
- 結合領域知識:不能只因數值大就直接視為錯誤刪除
SMOTE:處理類別不平衡資料
當「詐騙交易」只占全部資料的 1%,模型會學到「全部猜正常」就能拿到高準確率——SMOTE 就是為了打破這個懶惰模型。
運作方式:對每一個少數類樣本,找出它在特徵空間中最近的幾個少數類鄰居,隨機挑一個鄰居,並在兩者的連線上插值產生一筆新的合成樣本。例如兩筆詐欺交易金額分別是 10,000 元與 12,000 元,且其他特徵相近,SMOTE 可能在兩者之間合成一筆金額約 11,000 元的新詐欺樣本。
✅ SMOTE 的效果
- 增加少數類別(如詐欺交易)樣本數量
- 改善多數類別/少數類別的比例
- 降低模型偏向多數類別的問題
- 比單純複製樣本更能增加資料多樣性,降低死記硬背(過擬合)的風險
❌ 不是 SMOTE 的功能
- 刪除大量多數類別(正常交易)資料
- 把少數類別標籤直接改成多數類別
- 單純「複製」既有的少數類別樣本
- 把資料轉換成非監督式學習資料
訓練/測試集標準化與資料洩漏防範
標準化的公式不是重點,「先切分還是先算統計量」才是這題的殺手陷阱。
其中 μ(平均值)與 σ(標準差),必須只由訓練資料計算,這是本節唯一必須記住的規則。
| 1 | 先切分資料集:分成訓練集、驗證集、測試集 |
| 2 | 只用訓練集進行 fit:計算平均值、標準差等統計量 |
| 3 | 套用相同參數轉換:訓練集用 fit_transform,測試集只能用 transform |
| 4 | 最後才進行模型評估 |
大數據 5V
在做 EDA、ETL 之前,先理解「大數據」這個資料環境本身有哪五個關鍵維度。
| V | 中文 | 核心意義 | 實務例子 |
|---|---|---|---|
| Volume | 量 | 資料規模超越傳統系統處理能力,通常以 TB、PB 甚至 ZB 計量 | 全球用戶每分鐘上傳大量影片、進行大量搜尋 |
| Velocity | 速度 | 資料產生、傳輸與處理的即時性需求,需秒級甚至毫秒級回應 | 金融詐欺偵測、證券交易所每秒處理大量訂單 |
| Variety | 多樣性 | 資料格式多元:結構化(資料庫表格)、半結構化(JSON/日誌)、非結構化(圖片、影片、文字) | 單一客戶同時產生購買紀錄、客服郵件、點擊流資料 |
| Veracity | 真實性 | 資料的準確度、完整性與可信度;髒資料會導致「垃圾進、垃圾出」 | 聯絡人資料重複、格式不一致,導致預測不可靠 |
| Value | 價值 | 從海量資料中萃取有意義的商業洞見,是大數據的最終目的 | 根據行為訊號找出高成交機率客戶,優先分派給業務 |
演進脈絡:2001 年最初提出 3V(Volume、Velocity、Variety)→ 後續加入 Veracity 成為 4V,強調資料品質 → 再加入 Value 形成現在通行的 5V,凸顯「有價值」才是大數據的最終目的。
口訣:量・速・多・真・值損失函數總覽:模型訓練的「錯誤指南針」
損失函數衡量模型預測值與真實值的差距,訓練過程就是不斷調整參數、讓損失最小化。
| 損失函數 | 任務類型 | 核心概念 |
|---|---|---|
| 均方誤差 MSE | 迴歸 | 誤差平方後取平均,放大大誤差的懲罰 |
| 平均絕對誤差 MAE | 迴歸 | 誤差取絕對值後平均,對極端值較不敏感 |
| 交叉熵損失 | 分類 | 衡量預測機率分佈與真實標籤的差距 |
| Hinge 損失 | 分類(SVM) | 要求分類邊界留有安全「margin」 |
| KL 散度 | 分佈比較 | 衡量一個機率分佈與參考分佈的差異程度 |
回歸損失函數:MAE vs MSE vs RMSE
同樣是衡量「猜得準不準」,三個指標對「離群值」的態度完全不同。
MAE 平均絕對誤差
- 公式概念:|預測值-真實值|取平均
- 對異常值不敏感(線性懲罰)
- 誤差單位與原資料相同,容易解讀
- 例:房價預測平均誤差 50 萬元
MSE 均方誤差
- 公式概念:(預測值-真實值)² 取平均
- 對異常值敏感(平方會放大誤差)
- 大誤差會被強烈懲罰,逼模型避免離譜的單次失誤
- 例:一筆離譜誤差會大幅推高 MSE
分類損失函數:交叉熵 vs Hinge 損失
兩者都用於分類任務,但誕生於不同的演算法家族,考試常拿來互相對照。
交叉熵 Cross-Entropy
- 衡量預測「機率分佈」與真實標籤的差距
- 常搭配 Sigmoid/Softmax 輸出層使用
- 神經網路分類任務的預設選擇(對應 C 章)
- 預測機率越接近真實標籤,損失越低
Hinge 損失
- 要求正確類別的預測分數,領先錯誤類別至少一個「安全邊界 margin」
- 是 SVM 支援向量機的標準損失函數(對應 B 章)
- 只關心分類邊界是否夠穩固,不要求輸出機率
KL 散度:衡量兩個機率分佈的差異
前兩節的損失函數比較「預測值 vs 真實值」;KL 散度比較的是「兩個機率分佈」。
應用場景:
- C 章的 VAE(變分自編碼器)訓練時,用 KL 散度讓學到的潛在分佈盡量接近標準常態分佈
- H 章的知識蒸餾,用 KL 散度讓「學生模型」的輸出分佈逼近「老師模型」
偏差-變異權衡 Bias-Variance Tradeoff
用「射箭」理解模型誤差的兩種截然不同的來源。
Bias 偏差(欠擬合傾向)
- 模型假設過於簡單,系統性地射偏靶心
- 訓練誤差、測試誤差都偏高
- 解法:換用更複雜的模型、增加特徵
Variance 變異(過擬合傾向)
- 模型對訓練資料的細節太敏感,每次結果落點分散不穩定
- 訓練誤差低,但測試誤差高
- 解法:增加訓練資料、使用正則化
正則化:控制模型複雜度,緩解過擬合
在損失函數裡加一個「懲罰項」,逼模型不要把權重養得太大。
Lasso 正則化(L1)
- 懲罰項:權重的絕對值總和
- 效果:可將不重要特徵的權重壓縮至恰好為 0
- 附加效果:自動完成特徵篩選
Ridge 正則化(L2)
- 懲罰項:權重的平方總和
- 效果:讓所有權重普遍變小,但通常不會變成 0
- 適合:特徵之間高度相關的情境
A 章總結地圖+口訣總表
把這一章走過的路,重新串成一句話。
| 主題 | 口訣 |
|---|---|
| 三大學習典範 | 監・無・強 |
| ETL 流程 | 抽・整・載 |
| 類別編碼選擇 | 無序類別→One-hot;有序類別→Label |
| 離群值處理 | 連續數值離群值,不用 One-hot |
| SMOTE | 少數類別+近鄰插值+合成新樣本+改善不平衡 |
| 標準化流程 | 先切分、訓練集 fit、測試集 transform |
| 大數據 5V | 量・速・多・真・值 |
演算法選擇地圖:五種經典方法總覽
A 章決定了「訓練目標怎麼算」;B 章回答「到底要用哪個演算法訓練」。
B 章對應第 A 章「④模型訓練」中的傳統機器學習分支——還沒進入神經網路。下一章 C 才會進入以神經網路為基礎的深度學習分支。這五種方法涵蓋監督式分類、非監督式分群,以及機率圖模型,是 iPAS 初級考試最常出現的經典演算法組合。
| 演算法 | 學習類型 | 核心概念 | 優點/限制 |
|---|---|---|---|
| SVM 支援向量機 | 監督式(分類) | 找最大邊界的分類超平面 | 小樣本表現佳/大資料訓練較慢 |
| KNN K 近鄰 | 監督式(分類/迴歸) | 看最近的 K 個鄰居投票 | 簡單直覺/預測速度隨資料量變慢 |
| K-means | 非監督式(分群) | 將資料分成 K 群,反覆更新中心點 | 快速易懂/需預先指定 K 值 |
| 隨機森林 | 監督式(集成學習) | 多棵決策樹投票取共識 | 準確且抗過擬合/較難解釋單一決策 |
| 貝氏網路 | 機率圖模型 | 用有向圖表示變數間的因果/條件機率 | 可處理不確定性/建圖需要領域知識 |
SVM 支援向量機(Support Vector Machine)
不是隨便找一條線分開兩類資料,而是找「離兩邊都最遠」的那一條。
- 支援向量(Support Vectors):落在邊界上、真正決定超平面位置的關鍵資料點——這也是演算法名稱的由來
- 訓練目標:最大化 margin,這正是 SVM 使用「Hinge 損失」的原因(見第 12 節)——只有落在 margin 內或分類錯誤的點才會被懲罰
- 核函數(Kernel Trick):當資料在原始空間無法線性分開時,把資料映射到更高維度的空間,在高維空間中找到線性可分的超平面,再投影回原始空間,藉此處理非線性分類
✅ 優點
- 對高維、小樣本資料表現良好
- 透過核函數能有效處理非線性問題
- 理論基礎扎實,泛化能力強
⚠️ 限制
- 大規模資料集訓練速度較慢
- 核函數、C 值等參數需要仔細調整
- 不直接輸出機率,需要額外校準
KNN K 近鄰演算法(K-Nearest Neighbors)
沒有真正的「訓練」,預測當下才開始計算——這是 KNN 最特別、也最常被考的特性。
- K 值選擇的權衡:K 太小容易受雜訊干擾(高變異/過擬合傾向);K 太大則決策邊界過於平滑(高偏差/欠擬合傾向)——直接呼應第 14 節的偏差變異權衡
- 使用前提:務必先做特徵標準化(見第 08 節 Z-score),否則量尺較大的特徵會主導距離計算,扭曲「誰是鄰居」的判斷
K-means 分群演算法
本課程第一個「不知道正確答案」的演算法——它自己找出資料裡的群組。
隨機森林與集成學習:Bagging
與其相信一位專家,不如讓很多位專家各自獨立判斷,再多數決。
隨機森林是集成學習(Ensemble Learning)中「Bagging(自助聚合法,Bootstrap Aggregating)」的代表方法——讓多棵樹「平行」訓練,藉由多模型平均來降低變異、提升穩定度,直接呼應第 14 節的偏差變異權衡。
✅ 優點
- 準確度高、能抵抗過擬合
- 可評估特徵重要性
- 對雜訊與離群值相對穩健
⚠️ 限制
- 模型是多棵樹的組合,較難像單一決策樹一樣直接解釋
- 這正是 D 章「可解釋 AI」技術(如 SHAP)派上用場之處
Boosting 家族:梯度提升機與 XGBoost
Bagging 是多位專家「平行」各自判斷;Boosting 則是多位老師「接力」逐題補救。
| 模型 | 訓練方式 | 特性/比喻 |
|---|---|---|
| 隨機森林 (Bagging) | 多棵樹「平行」訓練,投票或平均結果 | 如多位獨立專家各自判斷、多數決;抗過擬合、穩定 |
| 梯度提升機 GBM (Boosting) | 多棵樹「串行」訓練,後一棵樹專門修正前一棵的誤差 | 如老師逐題補救;精度強,但較容易受參數影響 |
| XGBoost 極限梯度提升 | GBM 的工程優化與正則化強化版 | 支援平行運算、能自動處理缺失值、內建 L1/L2 正則化;訓練更快、效果常更好,是表格資料競賽常勝軍 |
貝氏網路 Bayesian Network
用一張「因果關係圖」,把不確定性量化成機率。
- 優點:能處理不確定性、可解釋因果關係、部分資訊缺失時仍能進行推論
- 應用:醫療診斷輔助、風險評估、故障診斷系統
B 章總結地圖+口訣總表
五種經典演算法+集成學習家族,串成一張選型地圖。
| 主題 | 一句話記憶 |
|---|---|
| SVM | 找 margin 最大的超平面,支援向量決定邊界 |
| KNN | 惰性學習,預測當下才計算,用前先標準化 |
| K-means | 無標籤自動分群,需指定 K 值,易陷局部最佳解 |
| 隨機森林 | Bagging:多樹平行投票,降變異、抗過擬合 |
| XGBoost | Boosting:多樹接力修錯,內建正則化 |
| 貝氏網路 | 有向圖表示因果/條件機率,可處理不確定性 |
神經元與三層結構+CNN 骨架
B 章是「傳統機器學習」分支;C 章正式進入「神經網路」分支——同樣對應 A 章「④模型訓練」,只是換一套模型家族。
若沒有激活函數,神經網路無論疊多少層,本質上都只是線性變換的組合,無法學習複雜的非線性關係——這就是下三節「激活函數」存在的原因。CNN(卷積神經網路)則在此基礎上,用「卷積層+激活+池化層+全連接層」的骨架,專門處理具有空間結構的影像資料。
CNN 口訣:卷・激・池・全激活函數總覽:四種函數比較
激活函數決定「這個神經元要不要被啟動、啟動多少」——選對位置,是這一節的核心考點。
| 函數 | 輸出範圍 | 主要用途 |
|---|---|---|
| 線性函數 Linear | 不限(等於輸入) | 迴歸任務的輸出層 |
| Sigmoid | 0 ~ 1 | 二元分類的輸出層(可解讀為機率) |
| Softmax | 0 ~ 1,總和為 1 | 多元分類的輸出層(多類別機率分佈) |
| ReLU | 0 ~ 正無限大 | 目前隱藏層最常用的激活函數 |
激活函數詳解:Sigmoid vs Softmax
兩者都輸出「看起來像機率」的數字,差別在「幾個類別」。
Sigmoid 函數
- 將輸出壓縮到 0~1 之間,可解讀為機率
- 適用:二元分類(是/否、有/無)
- 搭配損失函數:二元交叉熵
- 例:判斷郵件是否為垃圾郵件
Softmax 函數
- 將多個輸出轉換成機率分佈,總和為 1
- 適用:多元分類(3 種以上類別)
- 搭配損失函數:(多類別)交叉熵
- 例:判斷圖片是貓、狗還是鳥
ReLU 家族與死神經元問題
規則簡單到只有「正數保留、負數歸零」,卻是現代深度學習的預設選擇。
✅ 主要優點
- 計算效率極高:只需判斷正負,不需複雜的指數運算
- 緩解梯度消失:正區間梯度恆為 1
- 收斂速度快,通常比 Sigmoid、Tanh 更短
⚠️ 主要缺點
- Dead ReLU 問題:神經元輸入長期為負,梯度恆為 0,該神經元無法再更新權重
- 不適合本身含負值意義的輸入資料
| 變體 | 特點 |
|---|---|
| Leaky ReLU | 負區間保留微小固定斜率(通常 0.01),避免死神經元 |
| PReLU | 負區間的斜率由模型自動學習 |
| ELU | 負區間平滑過渡,輸出可為負值 |
| GELU | 常用於 Transformer 架構(如 BERT、GPT) |
CNN 基礎與 CIFAR-10 準確率地圖
CNN 為什麼比「把圖片攤平丟進全連接層」更聰明?答案在於它保留了空間結構。
| CNN 類型 | 測試準確率約 | 說明 |
|---|---|---|
| 基本、淺層 CNN | 60% ~ 75% | 可學到基本邊緣與形狀特徵 |
| 加入資料增強的 CNN | 約 80% | 翻轉、裁切等方式提升泛化能力 |
| 深層 CNN | 85% ~ 90% | 更多卷積層、加入 Batch Normalization |
| ResNet 等殘差網路 | 約 90% ~ 95% | 利用跳接結構訓練更深的網路 |
| 先進研究模型 | 超過 95% | 精細架構+強化增強+長時間訓練 |
AlexNet:CNN 時代的開端(2012)
深度學習曾經沉寂多年,AlexNet 一舉終結了這段低潮。
- ReLU 激活函數:取代 Sigmoid/Tanh,訓練效率提升約 6 倍
- 重疊最大池化:池化區域重疊,減少特徵遺失
- LRN 局部反應正規化:模仿生物側抑制,當時貢獻約 1.2% 準確率(詳見下一節)
- Dropout (0.5):全連接層隨機關閉 50% 神經元,防止過擬合
- 雙 GPU 並行訓練:證明 GPU 是訓練深度神經網路的必要工具
| 維度 | LeNet | AlexNet |
|---|---|---|
| 層數 | 7 層 | 8 層 |
| 激活函數 | Sigmoid/Tanh | ReLU |
| 正則化 | 無 | Dropout + LRN |
| 硬體 | CPU | 雙 GPU |
| 資料集 | MNIST(小數據) | ImageNet(大數據) |
LRN:曾經重要、如今被淘汰的技術
這是整個 C 章「歷史演進題」最愛考的一個轉折點。
| 維度 | LRN | Batch Normalization |
|---|---|---|
| 正規化範圍 | 局部鄰域(跨通道) | 整個批次(batch) |
| 提出時間 | 2012(AlexNet) | 2015 |
| 使用頻率 | 較少,已被取代 | 廣泛使用 |
| 計算成本 | 較高 | 較低 |
VGG:用小卷積核堆出深度(2014)
VGG 用一個簡單原則證明了「更深 > 更寬」:把大卷積核換成一堆小卷積核疊起來。
ResNet:殘差連接解決梯度消失
網路不是越深越好——除非你給它一條「可以偷懶」的近路。
沒有殘差連接的深層網路,層數增加不一定更好,會遇到梯度消失/爆炸與退化問題(變深後訓練誤差反而變差,不是模型不夠強,而是太難優化)。ResNet 加入 shortcut connection(跳接),把輸入 x 直接加到卷積層輸出上——卷積層只需要學習「需要改變的部分 F(x)」,不必重新學習整個映射。
- 如果某些層其實沒必要做複雜變換,只要學會輸出接近 0 的殘差就好
- shortcut 提供一條更直接的路徑,讓梯度回傳時不必逐層相乘、不容易消失
DenseNet:密集連接、特徵重用
ResNet 讓每層修正「前一層」;DenseNet 讓每層都能直接用到「前面所有層」學到的知識。
✅ 優勢
- 特徵重用:低階特徵(邊緣、紋理)可直接被深層使用,不必重複學習
- 密集連接提供多條梯度回傳路徑,緩解梯度消失
- 參數效率高:更少參數就能達到與 ResNet 相當或更好的性能
⚠️ 限制
- 需保存所有前面層的特徵圖以供串接,記憶體需求較大
- 特徵圖數量多時,串接操作可能成為計算瓶頸
FCNN 全連結網路的極限
CNN 家族擅長「空間」;接下來要處理的是「時間/順序」——FCNN 在這裡會露出它的天生弱點。
✅ 優點
- 結構簡單,能學習任意複雜的映射關係
- 適用表格型資料、特徵已明確定義的分類/迴歸問題
⚠️ 限制
- 參數量隨層數與神經元數快速增加,容易過擬合
- 無法記住「先前輸入」,每筆輸入都是獨立處理,無法有效利用序列或空間結構
RNN 循環神經網路
閱讀一篇文章時,理解目前這句話需要依賴前面讀過的內容——RNN 就是想模仿這個能力。
LSTM:三道閘門解決健忘症
把 LSTM 想成一位會整理筆記的分析員:重要的留下來,過時的就刪掉。
| 閘門 | 功能 |
|---|---|
| 遺忘門 Forget Gate | 決定要丟棄哪些舊的記憶資訊 |
| 輸入門 Input Gate | 決定哪些新資訊值得被記住 |
| 輸出門 Output Gate | 決定當前要輸出哪些記憶內容 |
VAE 變分自編碼器
從「理解資料」進化到「生成新資料」——C 章從這裡開始進入生成模型的領域。
GAN 生成對抗網路
兩個神經網路互相對抗,卻共同進步——這是深度學習裡最像「零和賽局」的設計。
生成器 Generator
- 負責製造以假亂真的資料
- 目標:騙過判別器
判別器 Discriminator
- 負責分辨資料是真實還是生成的
- 目標:識破生成器的假資料
訓練過程如同零和賽局:兩個網路互相競爭進步,最終生成器能產出極為逼真的資料。
GCN 圖積層網路(Graph Convolutional Network)
FCNN 處理表格、RNN/LSTM 處理序列——GCN 專門處理「關聯式」的圖結構資料。
- 應用:社交網路分析、分子結構性質預測、知識圖譜推理、推薦系統
- 意義:讓深度學習能處理「關聯式」資料,而不只是排列式/序列式的資料
C 章總結:依資料型態選擇架構
C 章最重要的不是背每個模型的細節,而是看到「資料型態」就能反射出「該用哪一族架構」。
| 資料型態 | 適合架構 | 任務性質 |
|---|---|---|
| 表格型資料(結構化) | FCNN 全連結神經網路 | 監督式:分類/迴歸 |
| 序列資料(文字/時間序列) | RNN/LSTM | 監督式:序列預測、翻譯 |
| 需要生成新資料 | VAE/GAN | 非監督式:資料生成 |
| 圖結構資料(社交網路/分子) | GCN 圖積層網路 | 監督/非監督:關聯推理 |
評估指標地圖:呼應 A 章損失函數
損失函數是「訓練時」優化的目標;評估指標是「訓練後」用來衡量模型好壞的標準——兩者常常互相對應。
| 任務 | 訓練用損失函數 | 常見評估指標 |
|---|---|---|
| 迴歸 | MSE/MAE(第 11 節) | MAE、MSE、RMSE(誤差平均程度) |
| 分類 | 交叉熵/Hinge 損失(第 12 節) | 準確率、精確率、召回率、F1 分數 |
| 生成/分佈比較 | KL 散度(第 13 節) | KL 散度、重建誤差 |
混淆矩陣與精確率/召回率
四個字母 TP/FP/FN/TN,是幾乎所有分類評估指標的共同語言。
| 指標 | 公式 | 意義 |
|---|---|---|
| 精確率 Precision | TP / (TP+FP) | 被預測為正的樣本中,有多少是真的正 |
| 召回率 Recall | TP / (TP+FN) | 真正是正的樣本中,有多少被成功預測出來 |
| 準確率 Accuracy | (TP+TN) / 全部 | 整體預測正確的比例 |
F1-score:不平衡資料的關鍵指標
F1 用「調和平均」逼模型不能只顧一邊——精確率和召回率必須同時不錯,才能拿高分。
| 指標 | 優點 | 不平衡資料下的缺點 |
|---|---|---|
| Accuracy | 直觀易懂 | 被多數類主導,無法反映少數類表現 |
| Precision | 避免誤報 | 可能忽略大量漏報(Recall 偏低) |
| Recall | 避免漏報 | 可能產生大量誤報(Precision 偏低) |
| F1-score | 平衡 Precision 與 Recall | 未考慮 TN,不適合多類別直接比較 |
SHAP:特徵貢獻量化
從賽局理論借來的概念:每個特徵都是「玩家」,模型預測結果是「整體收益」,SHAP 負責公平分配貢獻。
- 正 SHAP 值:該特徵使預測結果提高/推向正類別
- 負 SHAP 值:該特徵使預測結果降低/推向負類別;絕對值越大,影響力越大
- 可加性:所有特徵的 SHAP 值加總,等於「這筆預測值」與「平均預測值」的差距——這是它比一般特徵重要性更嚴謹的原因
LIME:局部代理模型
不管黑箱模型多複雜,LIME 只想在「這一個預測點附近」,用一個簡單模型假裝看懂它。
- 運作步驟:對關注的那筆資料做微小擾動,產生鄰近樣本 → 用原模型預測這些樣本 → 用簡單模型擬合「擾動樣本+預測結果」,找出局部重要特徵
- 例子:判斷一張圖片是「貓」,LIME 會遮蓋不同區域,找出耳朵、鬍鬚等哪些區域對「貓」的判斷最關鍵
反事實解釋 vs 顯著性圖
同樣是「事後解釋」,一個負責給行動建議,一個負責畫出模型的視線。
反事實解釋 Counterfactual
- 核心問題:「要改變什麼,結果才會不同?」
- 找出讓預測結果翻轉所需的最小輸入變動
- 例:貸款被拒,若月收入提高,結果會變成核准
- 應用:信用評分與貸款核准/拒絕說明,給客戶可採取的改善方向
顯著性圖 Saliency Map
- 核心問題:「模型在看輸入的哪個部分?」
- 常用於影像任務,透過梯度計算標示每個像素的影響程度
- 例:判斷「狗」的圖片中,狗臉區域顏色最深(影響最大)
可解釋 AI 技術選型比較總表
把第 45~47 節四個技術放在同一張表,考試最愛考「這個情境該選哪一個」。
| 技術 | 解釋範圍 | 核心問題 |
|---|---|---|
| SHAP | 全域+局部 | 每個特徵貢獻了多少?(可加性、理論嚴謹) |
| LIME | 局部 | 用簡單模型局部近似,任何黑箱模型皆適用 |
| 反事實解釋 | 局部 | 要改變什麼輸入,結果才會不同? |
| 顯著性圖 | 局部(視覺) | 模型在關注輸入的哪個區域?(多用於影像) |
Clever Hans 效應 vs IBM ART
一個是「發現模型可能學錯了」的警告;一個是「主動把弱點挖出來」的工具箱。
| 比較項目 | Clever Hans 效應 | IBM ART |
|---|---|---|
| 性質 | 問題現象與分析概念 | 開源軟體工具箱 |
| 核心問題 | 模型是否利用錯誤線索學習 | 模型能否抵抗對抗攻擊與干擾 |
| 目的 | 揭露模型可能沒有真正理解任務 | 攻擊、評估、改善模型安全性與穩健性 |
IBM ART(Adversarial Robustness Toolbox)是用來研究機器學習安全性的開源工具,可產生對抗樣本(例如對狗的圖片加入極小的擾動,讓人眼仍看見狗,模型卻判斷成貓)、測試模型脆弱程度、評估防禦方法。
口訣:Clever Hans 是「模型可能學錯了」的警告;IBM ART 是「把弱點測出來」的工具箱D 章總結地圖
模型評估分兩層:先看「準不準」,再看「為什麼」。
強化學習基礎:透過獎勵學習決策
回顧第01節:強化學習是第三種學習典範,不靠標籤資料,而是靠與環境互動、根據獎勵訊號學習最佳行動策略。
目標:學習一個「策略」,使長期累積獎勵最大化——不是只看眼前這一步的獎勵,而是整條路徑走下來的總和。
Q-Learning:學一張 Q 值表
把每種「狀態+行動」的組合,都換算成一個分數,記在一張表裡。
更新方式:每次行動後,根據「實際獲得的獎勵 + 對下一狀態最佳 Q 值的預估」,逐步修正 Q 值表,讓估計值越來越準確。
Deep Q-Learning(DQN)
表格記不下的東西,就交給神經網路去逼近。
輸入
- 當前狀態(例如遊戲畫面像素、感測器數值)
輸出
- 每個可能行動所對應的 Q 值(預期價值)
RLHF:人類反饋強化學習
把強化學習的「獎勵」,換成人類的偏好判斷——這是現行主流對話式 AI 對齊人類期待的方法。
E 章總結地圖
E章份量不大,但是理解G章LLM訓練方式的必要基礎。
隱私與安全技術地圖:AI 落地的五道防線
AI 模型訓練與使用大量資料時,可能洩漏個人隱私或商業機密。以下五項技術,從不同角度提供保護。
| 技術 | 保護的核心問題 |
|---|---|
| 差分隱私 | 如何在公開統計結果時,不洩漏任何個人的資料? |
| 聯邦學習 | 如何在不集中原始資料的情況下,共同訓練模型? |
| 同態加密 | 如何在資料「保持加密」的狀態下完成運算? |
| 安全多方計算 | 如何讓多方共同計算,卻互相不知道對方的輸入? |
| 零知識證明 | 如何證明「我知道某件事」,卻不透露那件事本身? |
差分隱私 Differential Privacy
資料可以集中,但答案要「模糊」到誰也認不出是你的那一筆。
應用:人口普查統計發布、Apple/Google 蒐集使用行為統計、機器學習訓練過程加入雜訊(如 DP-SGD)。
聯邦學習 Federated Learning
資料留在原地,只有「學到的東西」被送出去。
應用:手機輸入法個人化(Gboard)、醫療機構間的模型協作訓練。
同態加密 Homomorphic Encryption
資料全程鎖在保險箱裡,別人卻能隔著箱子幫你加工。
✅ 優勢
- 資料在整個運算過程中「從未」以明文形式暴露,隱私保護程度極高
⚠️ 限制
- 運算成本與時間開銷遠高於明文運算,目前實務應用仍受限於效能
應用:雲端運算隱私保護、醫療與金融敏感資料的委外運算。
安全多方計算 Secure Multi-party Computation(MPC)
大家各自握著秘密,卻能一起算出一個誰也不吃虧的答案。
應用:跨機構聯合風控分析、隱私保護拍賣、多方協同的機器學習訓練。
零知識證明 Zero-Knowledge Proof
證明你知道答案,但一個字都不用說出來。
應用:區塊鏈交易隱私(如零知識證明幣)、免洩漏個資的身份驗證、隱私保護型電子投票。
F 章總結:技術選型比較表
五種技術用「資料是否需要集中」這個問題來分類,是考試最常見的判斷角度。
| 技術 | 資料是否需集中 | 主要防護方式 |
|---|---|---|
| 差分隱私 | 可集中 | 對結果加入隨機雜訊,模糊化個體 |
| 聯邦學習 | 不集中(留在本地) | 只傳輸模型更新,原始資料不出裝置 |
| 同態加密 | 可集中(但加密) | 在加密狀態下直接運算,全程不解密 |
| 安全多方計算 | 不集中(分散各方) | 協同計算,各方輸入互相保密 |
| 零知識證明 | 不需交換資料 | 只證明「知道」而不透露內容本身 |
大型語言模型 LLM 基礎
G 章不重複介紹 Transformer 的技術細節,而是聚焦在「拿到 LLM 之後,怎麼把它用好」。
核心能力:文本生成、問答、翻譯、程式碼撰寫、摘要整理——例如 GPT 系列、Claude、Gemini 皆屬此類模型。
提示工程 Prompt Engineering:四大原則
這四項原則,正好對應接下來四節要展開的具體技術。
| 原則 | 說明 |
|---|---|
| 清楚明確 | 具體描述需求,避免模糊指令,減少模型自行猜測的空間 |
| 提供背景(上下文) | 說明用途、角色、限制條件,讓模型理解情境 |
| 給予範例 | 用範例演示期望的輸出格式與風格(見第 65 節 Few-shot) |
| 逐步引導 | 複雜任務拆解成小步驟,引導模型逐步推理(見第 66-67 節 CoT/ToT) |
Zero-shot vs Few-shot Prompting
要不要先給模型看幾個例子,是準確度與效率之間最簡單的取捨。
Zero-shot(零樣本)
- 不提供任何範例,直接下達任務指令
- 完全仰賴模型預訓練所學到的知識
- 例:「請將這句話翻譯成日文」
- 優點:快速;限制:精準度可能較不穩定
Few-shot(少樣本)
- 在提示中提供 2~5 個範例,示範任務的輸入輸出模式
- 例:「範例1:...→...;範例2:...→...;現在請翻譯:...」
- 優點:準確度通常較高,格式更貼近期望
思維鏈提示 Chain-of-Thought(CoT)
一句「請一步步思考」,往往就能讓模型的多步驟推理準確度明顯提升。
❌ 一般提示
直接問:「小明有5顆蘋果,吃了2顆,又買了3顆,現在有幾顆?」——模型可能跳步驟,複雜問題容易出錯。
✅ CoT 提示
加上「請一步步思考」:引導模型列出「5-2=3」「3+3=6」等推理步驟——複雜的多步驟推理準確度明顯提升。
適用情境:數學計算、邏輯推理、多步驟決策等需要「過程」而非只有「答案」的任務。
樹狀思維提示 Tree-of-Thought(ToT)
CoT 一路想到底,中途很難回頭;ToT 讓模型可以「試錯、比較、再選一條路走」。
CoT 思維鏈
- 單一線性推理路徑
- 一路想到底,中途很難「回頭」修正方向
ToT 樹狀思維
- 同時探索多條推理分支
- 可評估各分支優劣,必要時回溯換路徑重新推理
上下文工程 Context Engineering
「翻譯這句話」和「你是醫療翻譯專家,請把病歷譯成英文」——差別不是禮貌,是模型能不能猜對你要什麼。
❌ 缺乏上下文
「翻譯這句話」——模型不清楚領域、語氣、專業程度要求。
✅ 完整上下文
「你是醫療翻譯專家,請將病歷譯成英文,術語需用專業醫學詞彙」——角色、任務、限制條件一次到位。
自動提示工程 APE(Automatic Prompt Engineer)
連「寫提示詞」這件事,都可以交給 AI 自動最佳化。
LLM 評測基準:如何量化比較不同模型
提示工程再厲害,最終還是要有一套客觀標準,才能比較「哪個模型比較強」。
| 基準 | 測驗內容 |
|---|---|
| MMLU | 涵蓋 57 個學科的多選題,測試模型的廣泛知識與理解能力 |
| GSM8K | 約 8,500 題小學程度數學應用題,測試基礎數學推理能力 |
| MATH | 難度更高的競賽數學題,測試複雜多步驟數學推理能力 |
| C-Eval | 中文綜合評測基準,涵蓋多學科考題,測試中文語境下的能力 |
G 章總結地圖
從「認識 LLM」到「量化評分」,走完提示工程的完整旅程。
H章開場:呼應第02節「⑥部署維運」
六步驟工作流程的最後一哩路——模型不是訓練完就結束,而是要能穩定上線、持續運作。
回到第02節的六步驟地圖:①EDA→②ETL→③特徵工程→④模型訓練→⑤模型評估→⑥部署維運。前五步在 A~E 章都已經走完,H 章要處理的正是最後一步——把訓練好、評估過的模型,安全地送上生產環境,並持續維護下去。
知識蒸餾 Knowledge Distillation(KD)
大模型很聰明,但手機裝不下——讓小模型拜大模型為師,學到接近的判斷能力。
成果:學生模型體積更小、推論速度更快,同時保留接近教師模型的準確度。應用:手機端 AI 助理、邊緣運算裝置上的即時推論。
MLOps(Machine Learning Operations)
模型上線那一刻,不是終點,而是另一段旅程的開始。
批次推論 vs 即時推論
同一個模型,服務方式不同,考量的優先順序完全不一樣。
批次推論 Batch Inference
- 延遲容忍度較大,適合大規模資料處理
- 以吞吐量最佳化為優先
- 典型應用:每日信用評分更新、推薦清單預計算、報表生成
- 執行模式:非同步、排程或按需
即時推論 Real-time Inference
- 需在毫秒到秒級內回應
- 著重請求回應時間的穩定性與低延遲
- 典型應用:推薦系統、詐騙偵測、自駕車決策
- 執行模式:同步、持續運行端點
AutoML:缺人才也能快速上線
當企業沒有足夠的資料科學家,AutoML 讓「自動化」補上這塊缺口。
UML 統一塑模語言 與 解決方案圖
兩者都是「畫圖溝通系統設計」的工具,只是一個學術嚴謹、一個直觀彈性。
UML(Unified Modeling Language)
- 標準化的圖形化塑模語言,描述軟體/系統的結構與行為
- 常見圖類:類別圖、循序圖、流程圖
- 用途:開發 AI 應用前,先溝通清楚系統設計
解決方案圖 Solution Graph
- 將 AI 系統組件(資料源、模型、介面)及其關係視覺化呈現
- 例:使用者輸入 → NLP → LLM 生成 → 知識庫查詢
- 用途:讓團隊快速理解整體架構
AI 能力分級:弱AI/AGI/ASI
從「只會做一件事」到「全面超越人類」,是理解 AI 發展階段的一把尺。
| 分級 | 核心特徵 |
|---|---|
| 弱 AI(Narrow AI) | 只能執行單一或特定任務,是目前所有實際應用的 AI 系統(包含 LLM)所處的層級 |
| 強 AI/AGI (Artificial General Intelligence) | 具備跨領域的通用智慧,能像人類一樣學習、推理、適應各種任務——目前仍屬理論/研究階段 |
| ASI(Artificial Superintelligence) | 全面超越人類智慧的假設性階段,仍屬推測性概念 |
電腦視覺任務層次:分類→偵測→分割
同樣是「看懂一張圖」,任務的精細程度差很多——這正是電腦視覺情境題最愛考的分辨力。
監管沙盒 Regulatory Sandbox
在真正上市之前,先在一個「安全的實驗室」裡把規則和風險都摸清楚。
目的:在真實市場全面推行前,先於可控範圍內驗證技術與商業模式,同時控管潛在風險——這是 AI 治理中「鼓勵創新」與「控管風險」之間的一種平衡機制。
全書總結:A~H 章完整地圖
八個章節,其實只是同一條生產線被拆開檢視——現在,把它重新接回去。
| 章節 | 主題 | 核心內容 |
|---|---|---|
| A | 機器學習基礎與流程 | EDA、ETL、特徵工程、損失函數、正則化 |
| B | 經典機器學習演算法 | SVM、KNN、K-means、隨機森林、貝氏網路 |
| C | 神經網路與深度學習 | 激活函數、CNN家族、RNN/LSTM、VAE、GAN、GCN |
| D | 模型評估與可解釋AI | F1-score、SHAP、LIME、反事實解釋、顯著性圖 |
| E | 強化學習 | Q-Learning、DQN、RLHF |
| F | 隱私與安全技術 | 差分隱私、聯邦學習、同態加密、MPC、零知識證明 |
| G | 大型語言模型與提示工程 | CoT、ToT、Few-shot、上下文工程、評測基準 |
| H | 系統設計、部署與治理 | 知識蒸餾、MLOps、UML、監管沙盒 |