① EDA
② ETL
③ 特徵工程
④ 模型訓練目標
⑤ 模型評估(D章)
⑥ 部署維運(H章)
00 / 開場

這套筆記怎麼用

先看懂「地圖」,再走進「細節」——這是本筆記與零散考古題整理最大的不同。

iPAS AI 應用規劃師(初級)的考試內容,其實可以被還原成一條「機器學習專案的生產線」:從資料進來,到模型上線。本筆記把所有名詞,都釘在這條生產線的正確位置上,而不是把 60 幾個名詞當成互不相干的單字卡。

左側選單依「知識領域 A~H」與「章節內小節」分組;點擊任一小節,右側會直接捲動到該段落。頁面上方會有一條「六步驟流程條」,隨時提醒你現在讀到的內容,屬於整條生產線的哪一段。

🎓
這是全書完整版:A~H 八個章節、共 81 節,已經全部依照相同的版型與邏輯完成。你可以從左側任一章節切入,也可以照順序從頭讀到尾——建議先掃過每章開頭的「總覽/地圖」小節,抓住骨架,再深入細節。

全課程知識地圖:8 大領域

A
機器學習基礎與流程
EDA、ETL、特徵工程、損失函數、正則化(本頁)
B
經典機器學習演算法
SVM、KNN、K-means、隨機森林、貝氏網路
C
神經網路與深度學習
激活函數、RNN/LSTM、VAE、GAN、GCN
D
模型評估與可解釋 AI
SHAP、LIME、反事實解釋、顯著性圖
E
強化學習
Q-Learning、DQN、RLHF
F
隱私與安全技術
差分隱私、聯邦學習、同態加密、零知識證明
G
大型語言模型與提示工程
CoT、ToT、Few-shot、上下文工程
H
系統設計、部署與治理
知識蒸餾、MLOps、UML、監管沙盒
01 / A章・機器學習基礎

AI、ML、DL 的關係與三大學習典範

三個名詞常被混用,但它們是「包含關係」,不是三個平行的東西。

人工智慧 AI 是讓機器展現智慧行為的總稱;機器學習 ML 是其中一種做法——讓機器「從資料中學規則」,不用工程師寫死規則;深度學習 DL 又是機器學習的一支,專門用「多層神經網路」來學習。範圍關係為:AI ⊃ ML ⊃ DL
三種學習典範比較
類型資料特性代表方法
監督式學習有標準答案(標籤)SVM、KNN、CNN
非監督式學習無標籤,讓模型自行找出資料結構K-means、VAE
強化學習透過獎勵訊號、不斷試錯來學習Q-Learning、RLHF
口訣:監・無・強
02 / A章・機器學習基礎

機器學習六步驟工作流程:本章的骨幹

這張流程圖是整套 A~H 章節的「主幹道」——後面每一頁,都能對應回這裡的某一段。

STEP 1
EDA
探索性資料分析,先認識資料特性
STEP 2
ETL
萃取、轉換、載入資料
STEP 3
特徵工程
編碼、標準化、處理不平衡
STEP 4
模型訓練
選擇演算法、設定損失函數
STEP 5
模型評估
指標計算、可解釋性分析
STEP 6
部署維運
MLOps、知識蒸餾、監控

這六步驟就是 A~H 章的骨幹:STEP 4 對應「損失函數與經典演算法(B 章)、神經網路(C 章)」;STEP 5 對應「可解釋 AI(D 章)」;STEP 6 對應「系統治理(H 章)」。

⚠️
考試地雷:考試常出「流程排序題」。務必記住——EDA 一定在 ETL 之前特徵工程一定在模型訓練之前評估一定在部署之前。順序顛倒的選項,就是常見誤答陷阱。
03 / A章・流程① EDA

EDA 探索性資料分析

在正式建模之前,先「看懂資料」,而不是急著丟進模型。

EDA(Exploratory Data Analysis)指在正式建模前,用統計與視覺化方法先認識資料的特性與品質,目的是發現資料分佈、極端值(異常值)、缺失值,以及變數之間的相關性。

📊 常用統計方法

  • 平均值、中位數、標準差
  • 最大值、最小值、四分位數
  • 相關係數矩陣

📈 常用視覺化方法

  • 直方圖:看資料的分佈形狀
  • 散佈圖:看兩個變數之間的關係
  • 箱型圖:看是否存在異常值
來源:iPAS 知識整理系列・機器學習基礎
04 / A章・流程② ETL

ETL 資料處理流程

資料進入模型前的標準加工程序。

ETLExtract(萃取)→ Transform(轉換)→ Load(載入),指資料在進入模型訓練系統之前,必須經過的標準加工流程。
階段內容
Extract 萃取從資料庫、API、CSV 等來源讀取原始資料
Transform 轉換清理異常值、補齊缺失值、進行編碼、標準化
Load 載入將處理完成的資料寫入訓練系統或資料庫

Transform(轉換)這一步,正是接下來三節的內容:特徵編碼、離群值處理、SMOTE,全部都屬於「轉換」階段的工作。

⚠️
考試地雷:ETL 強調「先處理再載入」;ELT(先載入再處理)則是大數據平台常見的另一種架構,兩者順序不同,是常見的混淆考點。
05 / A章・流程③ 特徵工程

類別特徵編碼:One-hot 與 Label Encoding

機器學習模型只認得數字,文字類別必須先轉換——但轉換方式選錯,會誤導模型。

多數機器學習演算法(線性迴歸、邏輯迴歸、神經網路、XGBoost 等)只能處理數值輸入。若直接把類別映射成整數(紅=1、綠=2、藍=3),會讓模型誤以為「藍 > 綠 > 紅」——但這些類別其實沒有大小順序。這就是為什麼需要「特徵編碼」。
三種常見編碼方式比較
編碼方式適用情境特性
One-hot Encoding無自然順序的類別(地區、資費方案、性別)每個類別轉成獨立 0/1 欄位,不強加數值大小關係;欄位數會隨類別數增加
Label/Ordinal Encoding有順序關係的類別(學歷、評等)轉成整數,不增加欄位數;但可能誤導模型認為數字大小具有意義
Target Encoding類別與目標變數有統計關聯以目標變數的統計值編碼,效果強但需特別防止資料洩漏

✅ 適合 One-hot 的情境

  • 電信資費方案(基本/進階/企業)——彼此無大小關係
  • 客戶所在地區(台北/台中/高雄)
  • 模型是線性模型、SVM、神經網路等對數值大小敏感的演算法

✅ 適合 Label Encoding 的情境

  • 學歷(小學<國中<高中<大學<研究所)——本身就有順序
  • 類別數非常多(高基數),想節省記憶體
  • 模型是樹模型(決策樹、隨機森林、XGBoost)
口訣:無序類別→One-hot;有序類別→Label
💡
考古題實例:電信公司要把「資費方案類型」與「客戶地區」轉成模型可用的數值格式——兩者都沒有自然順序,正確作法是 One-hot Encoding,把每個類別轉成獨立的 0/1 欄位,讓模型不會誤判「企業方案」比「進階方案」大。
06 / A章・流程③ 特徵工程

離群值處理:保險理賠金額案例

連續數值的離群值,處理方式和「類別編碼」是兩件完全不同的事——這是最容易被考題誤導的地方。

情境:保險公司的理賠金額資料近似常態分佈,但存在少數極端高額案件,團隊必須在不破壞整體分佈特性的前提下處理這些離群值。

❌ 最不適合的做法

One-hot 編碼把離群值轉成類別特徵——理賠金額是連續數值,硬轉成類別會破壞金額原本的大小意義,也無法真正降低離群值的影響。

✅ 較適合的做法

  • Z-score/IQR:先判斷哪些資料可能是離群值
  • 截尾 Trimming:刪除極端值(但須先確認是否為真實重大事故)
  • Winsorization:將超過門檻的數值裁切至門檻值,而非直接刪除
  • 結合領域知識:不能只因數值大就直接視為錯誤刪除
口訣:連續數值離群值,不用 One-hot
07 / A章・流程③ 特徵工程

SMOTE:處理類別不平衡資料

當「詐騙交易」只占全部資料的 1%,模型會學到「全部猜正常」就能拿到高準確率——SMOTE 就是為了打破這個懶惰模型。

SMOTE(Synthetic Minority Over-sampling Technique,合成少數類別過採樣技術):在少數類別樣本與其鄰近的少數類別樣本之間,用插值法「合成」出新的虛擬樣本——而不是單純複製既有樣本。

運作方式:對每一個少數類樣本,找出它在特徵空間中最近的幾個少數類鄰居,隨機挑一個鄰居,並在兩者的連線上插值產生一筆新的合成樣本。例如兩筆詐欺交易金額分別是 10,000 元與 12,000 元,且其他特徵相近,SMOTE 可能在兩者之間合成一筆金額約 11,000 元的新詐欺樣本。

✅ SMOTE 的效果

  • 增加少數類別(如詐欺交易)樣本數量
  • 改善多數類別/少數類別的比例
  • 降低模型偏向多數類別的問題
  • 比單純複製樣本更能增加資料多樣性,降低死記硬背(過擬合)的風險

❌ 不是 SMOTE 的功能

  • 刪除大量多數類別(正常交易)資料
  • 把少數類別標籤直接改成多數類別
  • 單純「複製」既有的少數類別樣本
  • 把資料轉換成非監督式學習資料
口訣:少數類別+近鄰插值+合成新樣本+改善不平衡
💡
延伸知識:SMOTE 是「過採樣」少數類別;另一種思路是「欠採樣」,也就是刪減多數類別樣本。實務上也有進化版本,例如 Borderline-SMOTE(專注邊界樣本)、ADASYN(依難度動態調整合成比例)。
來源:SMOTE 專題整理・iPAS 知識整理系列
08 / A章・流程③ 特徵工程

訓練/測試集標準化與資料洩漏防範

標準化的公式不是重點,「先切分還是先算統計量」才是這題的殺手陷阱。

z = (x − μ) / σ

其中 μ(平均值)與 σ(標準差),必須只由訓練資料計算,這是本節唯一必須記住的規則。

正確流程(四步驟)
1先切分資料集:分成訓練集、驗證集、測試集
2只用訓練集進行 fit:計算平均值、標準差等統計量
3套用相同參數轉換:訓練集用 fit_transform,測試集只能用 transform
4最後才進行模型評估
⚠️
資料洩漏(Data Leakage):若在切分資料之前就用全部資料計算統計量,測試資料的資訊會偷偷流入訓練流程,導致模型在測試階段的表現「過度樂觀」,但實際部署後的泛化能力會明顯下降。
口訣:先切分、訓練集 fit、測試集 transform
09 / A章・資料基礎特性

大數據 5V

在做 EDA、ETL 之前,先理解「大數據」這個資料環境本身有哪五個關鍵維度。

大數據 5V 是用來定義大數據特性的五個關鍵維度,由 IBM 提出,是 iPAS 考試的必考基礎觀念。
V中文核心意義實務例子
Volume資料規模超越傳統系統處理能力,通常以 TB、PB 甚至 ZB 計量全球用戶每分鐘上傳大量影片、進行大量搜尋
Velocity速度資料產生、傳輸與處理的即時性需求,需秒級甚至毫秒級回應金融詐欺偵測、證券交易所每秒處理大量訂單
Variety多樣性資料格式多元:結構化(資料庫表格)、半結構化(JSON/日誌)、非結構化(圖片、影片、文字)單一客戶同時產生購買紀錄、客服郵件、點擊流資料
Veracity真實性資料的準確度、完整性與可信度;髒資料會導致「垃圾進、垃圾出」聯絡人資料重複、格式不一致,導致預測不可靠
Value價值從海量資料中萃取有意義的商業洞見,是大數據的最終目的根據行為訊號找出高成交機率客戶,優先分派給業務

演進脈絡:2001 年最初提出 3V(Volume、Velocity、Variety)→ 後續加入 Veracity 成為 4V,強調資料品質 → 再加入 Value 形成現在通行的 5V,凸顯「有價值」才是大數據的最終目的。

口訣:量・速・多・真・值
💡
考試常見題型:給一個情境(智慧交通、金融反詐欺⋯),問「主要挑戰落在哪個 V」。判斷關鍵:問即時性 → Velocity;問資料品質/髒資料 → Veracity;問最終商業目的 → Value。
10 / A章・流程④ 訓練目標設計

損失函數總覽:模型訓練的「錯誤指南針」

損失函數衡量模型預測值與真實值的差距,訓練過程就是不斷調整參數、讓損失最小化。

損失函數任務類型核心概念
均方誤差 MSE迴歸誤差平方後取平均,放大大誤差的懲罰
平均絕對誤差 MAE迴歸誤差取絕對值後平均,對極端值較不敏感
交叉熵損失分類衡量預測機率分佈與真實標籤的差距
Hinge 損失分類(SVM)要求分類邊界留有安全「margin」
KL 散度分佈比較衡量一個機率分佈與參考分佈的差異程度
11 / A章・流程④ 訓練目標設計

回歸損失函數:MAE vs MSE vs RMSE

同樣是衡量「猜得準不準」,三個指標對「離群值」的態度完全不同。

MAE 平均絕對誤差

  • 公式概念:|預測值-真實值|取平均
  • 對異常值敏感(線性懲罰)
  • 誤差單位與原資料相同,容易解讀
  • 例:房價預測平均誤差 50 萬元

MSE 均方誤差

  • 公式概念:(預測值-真實值)² 取平均
  • 對異常值敏感(平方會放大誤差)
  • 大誤差會被強烈懲罰,逼模型避免離譜的單次失誤
  • 例:一筆離譜誤差會大幅推高 MSE
RMSE(均方根誤差)= MSE 開根號。它的單位與目標變數相同(例如萬元),因此比 MSE 更直觀易懂,常用於向非技術人員報告模型表現,例如「平均預測誤差約 ±17 萬元」。RMSE 同樣對離群值敏感。
💡
選用原則:資料中有很多異常值、且不想被牽著走 → 選 MAE;希望模型盡量避免「單次重大失誤」,且方便向業務單位溝通 → 選 MSE/RMSE
12 / A章・流程④ 訓練目標設計

分類損失函數:交叉熵 vs Hinge 損失

兩者都用於分類任務,但誕生於不同的演算法家族,考試常拿來互相對照。

交叉熵 Cross-Entropy

  • 衡量預測「機率分佈」與真實標籤的差距
  • 常搭配 Sigmoid/Softmax 輸出層使用
  • 神經網路分類任務的預設選擇(對應 C 章)
  • 預測機率越接近真實標籤,損失越低

Hinge 損失

  • 要求正確類別的預測分數,領先錯誤類別至少一個「安全邊界 margin」
  • 是 SVM 支援向量機的標準損失函數(對應 B 章)
  • 只關心分類邊界是否夠穩固,不要求輸出機率
13 / A章・流程④ 訓練目標設計

KL 散度:衡量兩個機率分佈的差異

前兩節的損失函數比較「預測值 vs 真實值」;KL 散度比較的是「兩個機率分佈」。

KL 散度(Kullback-Leibler Divergence)衡量一個機率分佈 P 與參考分佈 Q 之間的差異程度。數值越大,代表兩個分佈差異越大;數值為 0,代表兩個分佈完全相同。
⚠️
重要特性:KL 散度具有不對稱性——KL(P‖Q) 不等於 KL(Q‖P)。因此嚴格來說,它不是數學上真正的「距離」,這是常見的出題細節。

應用場景:

  • C 章的 VAE(變分自編碼器)訓練時,用 KL 散度讓學到的潛在分佈盡量接近標準常態分佈
  • H 章的知識蒸餾,用 KL 散度讓「學生模型」的輸出分佈逼近「老師模型」
14 / A章・模型能力平衡

偏差-變異權衡 Bias-Variance Tradeoff

用「射箭」理解模型誤差的兩種截然不同的來源。

Bias 偏差(欠擬合傾向)

  • 模型假設過於簡單,系統性地射偏靶心
  • 訓練誤差、測試誤差都偏高
  • 解法:換用更複雜的模型、增加特徵

Variance 變異(過擬合傾向)

  • 模型對訓練資料的細節太敏感,每次結果落點分散不穩定
  • 訓練誤差,但測試誤差
  • 解法:增加訓練資料、使用正則化
15 / A章・模型能力平衡

正則化:控制模型複雜度,緩解過擬合

在損失函數裡加一個「懲罰項」,逼模型不要把權重養得太大。

正則化在損失函數中加入懲罰項,限制參數權重過大——直接回應上一節「高變異(過擬合)」的問題。

Lasso 正則化(L1)

  • 懲罰項:權重的絕對值總和
  • 效果:可將不重要特徵的權重壓縮至恰好為 0
  • 附加效果:自動完成特徵篩選

Ridge 正則化(L2)

  • 懲罰項:權重的平方總和
  • 效果:讓所有權重普遍變小,但通常不會變成 0
  • 適合:特徵之間高度相關的情境
16 / A章總結

A 章總結地圖+口訣總表

把這一章走過的路,重新串成一句話。

EDA 發現問題ETL/特徵工程處理資料損失函數定義訓練目標正則化控制模型複雜度。 下一步,進入 B 章:用什麼演算法訓練?(SVM、KNN、K-means、隨機森林、貝氏網路)
本章口訣總表
主題口訣
三大學習典範監・無・強
ETL 流程抽・整・載
類別編碼選擇無序類別→One-hot;有序類別→Label
離群值處理連續數值離群值,不用 One-hot
SMOTE少數類別+近鄰插值+合成新樣本+改善不平衡
標準化流程先切分、訓練集 fit、測試集 transform
大數據 5V量・速・多・真・值
📝
複習提醒:A 章是全書的地基——B 章以後的演算法選型、C 章的架構選型、D 章的評估指標,幾乎都會回頭引用這裡的損失函數、偏差變異、正則化等概念。這裡沒弄懂,後面章節會一直感覺「卡卡的」,建議這章多讀一次。
17 / B章・開場

演算法選擇地圖:五種經典方法總覽

A 章決定了「訓練目標怎麼算」;B 章回答「到底要用哪個演算法訓練」。

B 章對應第 A 章「④模型訓練」中的傳統機器學習分支——還沒進入神經網路。下一章 C 才會進入以神經網路為基礎的深度學習分支。這五種方法涵蓋監督式分類、非監督式分群,以及機率圖模型,是 iPAS 初級考試最常出現的經典演算法組合。

演算法學習類型核心概念優點/限制
SVM 支援向量機監督式(分類)找最大邊界的分類超平面小樣本表現佳/大資料訓練較慢
KNN K 近鄰監督式(分類/迴歸)看最近的 K 個鄰居投票簡單直覺/預測速度隨資料量變慢
K-means非監督式(分群)將資料分成 K 群,反覆更新中心點快速易懂/需預先指定 K 值
隨機森林監督式(集成學習)多棵決策樹投票取共識準確且抗過擬合/較難解釋單一決策
貝氏網路機率圖模型用有向圖表示變數間的因果/條件機率可處理不確定性/建圖需要領域知識
📍
接下來六節會逐一拆解這五種方法,並補上考試常考、但這張表沒列出的集成學習家族(Bagging vs Boosting)——隨機森林與 XGBoost 常被放在一起互相比較。
18 / B章・經典機器學習演算法

SVM 支援向量機(Support Vector Machine)

不是隨便找一條線分開兩類資料,而是找「離兩邊都最遠」的那一條。

SVM 是一種監督式學習演算法,核心概念是在特徵空間中找出一個超平面,將不同類別的資料盡可能清楚分開,並使兩側的分類邊界(margin最大化,藉此提升模型對新資料的泛化能力。
  • 支援向量(Support Vectors):落在邊界上、真正決定超平面位置的關鍵資料點——這也是演算法名稱的由來
  • 訓練目標:最大化 margin,這正是 SVM 使用「Hinge 損失」的原因(見第 12 節)——只有落在 margin 內或分類錯誤的點才會被懲罰
  • 核函數(Kernel Trick):當資料在原始空間無法線性分開時,把資料映射到更高維度的空間,在高維空間中找到線性可分的超平面,再投影回原始空間,藉此處理非線性分類

✅ 優點

  • 對高維、小樣本資料表現良好
  • 透過核函數能有效處理非線性問題
  • 理論基礎扎實,泛化能力強

⚠️ 限制

  • 大規模資料集訓練速度較慢
  • 核函數、C 值等參數需要仔細調整
  • 不直接輸出機率,需要額外校準
19 / B章・經典機器學習演算法

KNN K 近鄰演算法(K-Nearest Neighbors)

沒有真正的「訓練」,預測當下才開始計算——這是 KNN 最特別、也最常被考的特性。

要預測一筆新資料時,找出訓練集中離它最近的 K 個鄰居,用「多數決」(分類)或「平均值」(迴歸)決定結果。「最近」最常以歐氏距離衡量,也可使用其他距離度量。
⚠️
惰性學習 (Lazy Learning):KNN 在訓練階段幾乎不做運算,所有計算都發生在預測當下,因此預測速度會隨資料量增加而變慢——這與大多數「先訓練、後快速預測」的演算法相反,是常見考點。
  • K 值選擇的權衡:K 太小容易受雜訊干擾(高變異/過擬合傾向);K 太大則決策邊界過於平滑(高偏差/欠擬合傾向)——直接呼應第 14 節的偏差變異權衡
  • 使用前提:務必先做特徵標準化(見第 08 節 Z-score),否則量尺較大的特徵會主導距離計算,扭曲「誰是鄰居」的判斷
20 / B章・經典機器學習演算法

K-means 分群演算法

本課程第一個「不知道正確答案」的演算法——它自己找出資料裡的群組。

將沒有標籤的資料自動分成 K 群,讓同群內的資料盡量相似、群與群之間的差異盡量大。
① 初始化
隨機選 K 個點作為群中心
② 分配
每筆資料歸屬最近的群中心
③ 更新
重新計算各群的中心點
④ 收斂
重複②③直到中心點不再變動
⚠️
限制:需要人為事先指定 K 值;對初始中心點的選擇敏感,容易收斂到「局部最佳解」而非真正最佳的分群結果。
21 / B章・經典機器學習演算法

隨機森林與集成學習:Bagging

與其相信一位專家,不如讓很多位專家各自獨立判斷,再多數決。

隨機森林同時訓練多棵決策樹,每棵樹只看部分資料與部分特徵,最後綜合所有樹的預測結果(分類用投票、迴歸用平均)。

隨機森林是集成學習(Ensemble Learning)中「Bagging(自助聚合法,Bootstrap Aggregating)」的代表方法——讓多棵樹「平行」訓練,藉由多模型平均來降低變異、提升穩定度,直接呼應第 14 節的偏差變異權衡。

✅ 優點

  • 準確度高、能抵抗過擬合
  • 可評估特徵重要性
  • 對雜訊與離群值相對穩健

⚠️ 限制

  • 模型是多棵樹的組合,較難像單一決策樹一樣直接解釋
  • 這正是 D 章「可解釋 AI」技術(如 SHAP)派上用場之處
22 / B章・經典機器學習演算法

Boosting 家族:梯度提升機與 XGBoost

Bagging 是多位專家「平行」各自判斷;Boosting 則是多位老師「接力」逐題補救。

集成學習兩大家族比較
模型訓練方式特性/比喻
隨機森林
(Bagging)
多棵樹「平行」訓練,投票或平均結果如多位獨立專家各自判斷、多數決;抗過擬合、穩定
梯度提升機 GBM
(Boosting)
多棵樹「串行」訓練,後一棵樹專門修正前一棵的誤差如老師逐題補救;精度強,但較容易受參數影響
XGBoost
極限梯度提升
GBM 的工程優化與正則化強化版支援平行運算、能自動處理缺失值、內建 L1/L2 正則化;訓練更快、效果常更好,是表格資料競賽常勝軍
💡
一句話理解:如果把每棵決策樹想成一位不太強的專家,隨機森林是「多位專家平行各自判斷、投票」;XGBoost 則是「把專家排成接力隊,每一棒專門修補前一棒的不足」
23 / B章・經典機器學習演算法

貝氏網路 Bayesian Network

用一張「因果關係圖」,把不確定性量化成機率。

有向無環圖(DAG)表示多個變數之間的條件機率關係:節點代表變數,箭頭代表機率上的依賴關係。其理論基礎建立在貝氏定理之上,能根據已知證據更新對其他變數的機率信念。
💡
直觀例子:「下雨」會影響「地面濕滑」的機率,「地面濕滑」又會影響「交通事故」的機率——貝氏網路能把這一連串因果/條件關係,用機率的方式量化並呈現出來。
  • 優點:能處理不確定性、可解釋因果關係、部分資訊缺失時仍能進行推論
  • 應用:醫療診斷輔助、風險評估、故障診斷系統
24 / B章總結

B 章總結地圖+口訣總表

五種經典演算法+集成學習家族,串成一張選型地圖。

監督式分類選 SVM/KNN/隨機森林;非監督式分群選 K-means;需要因果推論選貝氏網路;想要更高準確率就在 Bagging(隨機森林)Boosting(XGBoost)之間權衡「穩定」與「精度」。 下一步,進入 C 章:神經網路與深度學習(激活函數、RNN/LSTM、VAE、GAN、GCN)
本章重點速記
主題一句話記憶
SVM找 margin 最大的超平面,支援向量決定邊界
KNN惰性學習,預測當下才計算,用前先標準化
K-means無標籤自動分群,需指定 K 值,易陷局部最佳解
隨機森林Bagging:多樹平行投票,降變異、抗過擬合
XGBoostBoosting:多樹接力修錯,內建正則化
貝氏網路有向圖表示因果/條件機率,可處理不確定性
25 / C章・開場

神經元與三層結構+CNN 骨架

B 章是「傳統機器學習」分支;C 章正式進入「神經網路」分支——同樣對應 A 章「④模型訓練」,只是換一套模型家族。

L1
輸入層
接收原始特徵
L2
隱藏層
特徵轉換與學習(可多層)
L3
輸出層
產生預測結果
口訣:輸・隱・輸

若沒有激活函數,神經網路無論疊多少層,本質上都只是線性變換的組合,無法學習複雜的非線性關係——這就是下三節「激活函數」存在的原因。CNN(卷積神經網路)則在此基礎上,用「卷積層+激活+池化層+全連接層」的骨架,專門處理具有空間結構的影像資料。

CNN 口訣:卷・激・池・全
26 / C章・神經網路基礎

激活函數總覽:四種函數比較

激活函數決定「這個神經元要不要被啟動、啟動多少」——選對位置,是這一節的核心考點。

函數輸出範圍主要用途
線性函數 Linear不限(等於輸入)迴歸任務的輸出層
Sigmoid0 ~ 1二元分類的輸出層(可解讀為機率)
Softmax0 ~ 1,總和為 1多元分類的輸出層(多類別機率分佈)
ReLU0 ~ 正無限大目前隱藏層最常用的激活函數
口訣:隱 R 輸 S 軟(隱藏層用 ReLU,輸出層二分類 Sigmoid、多分類 Softmax)
⚠️
考試地雷:「隱藏層最常用?」答案是 ReLU,不是 Sigmoid;「回歸問題輸出層?」答案是線性函數,不是 ReLU——把「隱藏層」和「輸出層」的推薦函數搞混,是這個主題最常見的誤答。
27 / C章・神經網路基礎

激活函數詳解:Sigmoid vs Softmax

兩者都輸出「看起來像機率」的數字,差別在「幾個類別」。

Sigmoid 函數

  • 將輸出壓縮到 0~1 之間,可解讀為機率
  • 適用:二元分類(是/否、有/無)
  • 搭配損失函數:二元交叉熵
  • 例:判斷郵件是否為垃圾郵件

Softmax 函數

  • 將多個輸出轉換成機率分佈,總和為 1
  • 適用:多元分類(3 種以上類別)
  • 搭配損失函數:(多類別)交叉熵
  • 例:判斷圖片是貓、狗還是鳥
28 / C章・神經網路基礎

ReLU 家族與死神經元問題

規則簡單到只有「正數保留、負數歸零」,卻是現代深度學習的預設選擇。

ReLU(x) = max(0, x)

✅ 主要優點

  • 計算效率極高:只需判斷正負,不需複雜的指數運算
  • 緩解梯度消失:正區間梯度恆為 1
  • 收斂速度快,通常比 Sigmoid、Tanh 更短

⚠️ 主要缺點

  • Dead ReLU 問題:神經元輸入長期為負,梯度恆為 0,該神經元無法再更新權重
  • 不適合本身含負值意義的輸入資料
ReLU 改進變體
變體特點
Leaky ReLU負區間保留微小固定斜率(通常 0.01),避免死神經元
PReLU負區間的斜率由模型自動學習
ELU負區間平滑過渡,輸出可為負值
GELU常用於 Transformer 架構(如 BERT、GPT)
口訣:解決死神經元?選 Leaky ReLU,不是 ReLU
29 / C章・CNN 影像架構家族

CNN 基礎與 CIFAR-10 準確率地圖

CNN 為什麼比「把圖片攤平丟進全連接層」更聰明?答案在於它保留了空間結構。

CNN(卷積神經網路)用卷積層擷取局部空間特徵、用池化層降低維度並保留重要資訊、再用全連接層整合特徵做出最終判斷——這正是「卷・激・池・全」口訣的由來。
CNN 在 CIFAR-10 影像分類上的準確率地圖(由淺入深)
CNN 類型測試準確率約說明
基本、淺層 CNN60% ~ 75%可學到基本邊緣與形狀特徵
加入資料增強的 CNN約 80%翻轉、裁切等方式提升泛化能力
深層 CNN85% ~ 90%更多卷積層、加入 Batch Normalization
ResNet 等殘差網路約 90% ~ 95%利用跳接結構訓練更深的網路
先進研究模型超過 95%精細架構+強化增強+長時間訓練
口訣:MLP 攤平圖片易忽略空間結構;CNN 用卷積擷取空間特徵
30 / C章・CNN 影像架構家族

AlexNet:CNN 時代的開端(2012)

深度學習曾經沉寂多年,AlexNet 一舉終結了這段低潮。

由 Hinton 團隊於 2012 年提出,在 ImageNet 競賽以 Top-5 錯誤率 15.3% 奪冠,比第二名低了 10.8 個百分點——被視為深度學習在電腦視覺領域的歷史分水嶺。是一個 8 層深度神經網路:5 層卷積層 + 3 層全連接層
  • ReLU 激活函數:取代 Sigmoid/Tanh,訓練效率提升約 6 倍
  • 重疊最大池化:池化區域重疊,減少特徵遺失
  • LRN 局部反應正規化:模仿生物側抑制,當時貢獻約 1.2% 準確率(詳見下一節)
  • Dropout (0.5):全連接層隨機關閉 50% 神經元,防止過擬合
  • 雙 GPU 並行訓練:證明 GPU 是訓練深度神經網路的必要工具
AlexNet vs LeNet(1998)
維度LeNetAlexNet
層數7 層8 層
激活函數Sigmoid/TanhReLU
正則化Dropout + LRN
硬體CPU雙 GPU
資料集MNIST(小數據)ImageNet(大數據)
31 / C章・CNN 影像架構家族

LRN:曾經重要、如今被淘汰的技術

這是整個 C 章「歷史演進題」最愛考的一個轉折點。

LRN(Local Response Normalization,局部反應正規化)模仿生物視覺的「側抑制」現象:讓響應大的神經元更突出,同時抑制鄰近神經元的反應。由 AlexNet 於 2012 年首次引入。
⚠️
考試重點:LRN 在 AlexNet 中的貢獻僅約 1.2% 準確率提升;2014 年 VGG 論文證實移除 LRN 後準確率沒有明顯下降;2015 年 Batch Normalization 提出後迅速取代 LRN,成為現代 CNN 的標準配置。
LRN vs Batch Normalization
維度LRNBatch Normalization
正規化範圍局部鄰域(跨通道)整個批次(batch)
提出時間2012(AlexNet)2015
使用頻率較少,已被取代廣泛使用
計算成本較高較低
口訣:LRN 是「跨鄰近通道算平方和、抑制當前通道」;現代模型已改用 BN
32 / C章・CNN 影像架構家族

VGG:用小卷積核堆出深度(2014)

VGG 用一個簡單原則證明了「更深 > 更寬」:把大卷積核換成一堆小卷積核疊起來。

由牛津大學視覺幾何組於 2014 年提出,結構簡單統一——大量使用 3×3 小卷積核取代 AlexNet 的 7×7、5×5 大卷積核,透過堆疊多層小卷積核提取更高階特徵。最常用的變體是 VGG16VGG19,數字代表權重層總數。
💡
別搞混:VGG-F 不是 VGG-16/19!VGG-F 的 F 是 Fast,是 VGG 團隊在經典 VGGNet 之前提出的早期系列(還有 VGG-M/VGG-S),架構其實更接近 AlexNet——5 個卷積層+3 個全連接層,第一層用 11×11 大卷積核快速降維,用速度換取部分精度。真正「用小卷積核堆深度」的是後來的 VGG-16/19。
33 / C章・CNN 影像架構家族

ResNet:殘差連接解決梯度消失

網路不是越深越好——除非你給它一條「可以偷懶」的近路。

y = F(x) + x

沒有殘差連接的深層網路,層數增加不一定更好,會遇到梯度消失/爆炸退化問題(變深後訓練誤差反而變差,不是模型不夠強,而是太難優化)。ResNet 加入 shortcut connection(跳接),把輸入 x 直接加到卷積層輸出上——卷積層只需要學習「需要改變的部分 F(x)」,不必重新學習整個映射。

  • 如果某些層其實沒必要做複雜變換,只要學會輸出接近 0 的殘差就好
  • shortcut 提供一條更直接的路徑,讓梯度回傳時不必逐層相乘、不容易消失
34 / C章・CNN 影像架構家族

DenseNet:密集連接、特徵重用

ResNet 讓每層修正「前一層」;DenseNet 讓每層都能直接用到「前面所有層」學到的知識。

DenseNet(Densely Connected Convolutional Network)不只連接前一層,而是讓每一層都取得前面所有層的特徵圖,並沿通道方向串接(concatenation),而非像 ResNet 那樣直接相加。

✅ 優勢

  • 特徵重用:低階特徵(邊緣、紋理)可直接被深層使用,不必重複學習
  • 密集連接提供多條梯度回傳路徑,緩解梯度消失
  • 參數效率高:更少參數就能達到與 ResNet 相當或更好的性能

⚠️ 限制

  • 需保存所有前面層的特徵圖以供串接,記憶體需求較大
  • 特徵圖數量多時,串接操作可能成為計算瓶頸
口訣:ResNet 修正前一層;DenseNet 重用所有層
35 / C章・序列與生成模型

FCNN 全連結網路的極限

CNN 家族擅長「空間」;接下來要處理的是「時間/順序」——FCNN 在這裡會露出它的天生弱點。

FCNN(Fully Connected Neural Network,又稱 Dense Network):每一層的每個神經元,都與下一層所有神經元相連接,是最基礎的神經網路架構。

✅ 優點

  • 結構簡單,能學習任意複雜的映射關係
  • 適用表格型資料、特徵已明確定義的分類/迴歸問題

⚠️ 限制

  • 參數量隨層數與神經元數快速增加,容易過擬合
  • 無法記住「先前輸入」,每筆輸入都是獨立處理,無法有效利用序列或空間結構
36 / C章・序列與生成模型

RNN 循環神經網路

閱讀一篇文章時,理解目前這句話需要依賴前面讀過的內容——RNN 就是想模仿這個能力。

RNN 具有「記憶」機制:會把前一步的隱藏狀態,帶入下一步的計算中,藉此突破 FCNN「每筆輸入都獨立處理」的限制。適用於具有先後順序的序列資料——文字、語音、時間序列、感測器數據。
⚠️
限制:序列太長時會出現梯度消失/爆炸問題,導致模型「忘記」較早之前的資訊——這正是下一節 LSTM 要解決的問題。
37 / C章・序列與生成模型

LSTM:三道閘門解決健忘症

把 LSTM 想成一位會整理筆記的分析員:重要的留下來,過時的就刪掉。

LSTM(Long Short-Term Memory)是 RNN 的改良版本,多了「記憶胞 cell state」與三道閘門,能有選擇性地保留長期重要資訊。
閘門功能
遺忘門 Forget Gate決定要丟棄哪些舊的記憶資訊
輸入門 Input Gate決定哪些新資訊值得被記住
輸出門 Output Gate決定當前要輸出哪些記憶內容
💡
考古題實例:公車到站時間預測需綜合歷史班次、即時路況、天氣——傳統 RNN 難以保留早期重要資訊,最適合的架構是 LSTM。CNN 擅長局部空間特徵、不擅長長期時間依賴;自編碼器 AE 擅長壓縮重建;FCNN 沒有循環記憶結構,都不是本題答案。
口訣:序列要記憶,長期選 LSTM;圖片看局部,用 CNN;壓縮再重建,用 AE
38 / C章・序列與生成模型

VAE 變分自編碼器

從「理解資料」進化到「生成新資料」——C 章從這裡開始進入生成模型的領域。

VAE(Variational Autoencoder)是一種生成模型,屬於非監督式學習,目標是學會資料的潛在結構,並能生成新資料。
① 編碼
Encoder 將輸入壓縮成潛在空間的機率分佈
② 採樣
從該分佈中隨機採樣一個潛在向量
③ 解碼
Decoder 將潛在向量還原/生成新資料
39 / C章・序列與生成模型

GAN 生成對抗網路

兩個神經網路互相對抗,卻共同進步——這是深度學習裡最像「零和賽局」的設計。

生成器 Generator

  • 負責製造以假亂真的資料
  • 目標:騙過判別器

判別器 Discriminator

  • 負責分辨資料是真實還是生成的
  • 目標:識破生成器的假資料

訓練過程如同零和賽局:兩個網路互相競爭進步,最終生成器能產出極為逼真的資料。

💡
GAN vs VAE:VAE 透過機率分佈與 KL 散度學習生成,結果偏平滑保守;GAN 透過對抗訓練學習生成,結果通常更銳利逼真,但訓練較不穩定。
40 / C章・序列與生成模型

GCN 圖積層網路(Graph Convolutional Network)

FCNN 處理表格、RNN/LSTM 處理序列——GCN 專門處理「關聯式」的圖結構資料。

圖(Graph)由節點 Node(如人、物品)與邊 Edge(如關係、連結)組成。GCN 的核心概念:每個節點會「聚合」鄰居節點的資訊來更新自己的特徵表示,逐層擴大能感知的鄰域範圍。
  • 應用:社交網路分析、分子結構性質預測、知識圖譜推理、推薦系統
  • 意義:讓深度學習能處理「關聯式」資料,而不只是排列式/序列式的資料
41 / C章總結

C 章總結:依資料型態選擇架構

C 章最重要的不是背每個模型的細節,而是看到「資料型態」就能反射出「該用哪一族架構」。

深度學習架構選擇地圖
資料型態適合架構任務性質
表格型資料(結構化)FCNN 全連結神經網路監督式:分類/迴歸
序列資料(文字/時間序列)RNN/LSTM監督式:序列預測、翻譯
需要生成新資料VAE/GAN非監督式:資料生成
圖結構資料(社交網路/分子)GCN 圖積層網路監督/非監督:關聯推理
從基礎神經元(第 25 節)→ 激活函數(第 26-28 節)→ CNN 影像架構家族(第 29-34 節)→ 依資料型態選擇架構(第 35-40 節)。 下一步,進入 D 章:模型評估與可解釋 AI(SHAP、LIME、反事實解釋、顯著性圖)——訓練完成後,如何知道模型「準不準」與「為什麼這樣預測」。
42 / D章・開場

評估指標地圖:呼應 A 章損失函數

損失函數是「訓練時」優化的目標;評估指標是「訓練後」用來衡量模型好壞的標準——兩者常常互相對應。

任務訓練用損失函數常見評估指標
迴歸MSE/MAE(第 11 節)MAE、MSE、RMSE(誤差平均程度)
分類交叉熵/Hinge 損失(第 12 節)準確率、精確率、召回率、F1 分數
生成/分佈比較KL 散度(第 13 節)KL 散度、重建誤差
📍
評估「準不準」只是第一步;模型「為什麼」這樣預測,需要靠可解釋 AI 技術——這是 D 章接下來 SHAP、LIME 等主題要回答的問題。
43 / D章・模型評估

混淆矩陣與精確率/召回率

四個字母 TP/FP/FN/TN,是幾乎所有分類評估指標的共同語言。

指標公式意義
精確率 PrecisionTP / (TP+FP)被預測為正的樣本中,有多少是真的正
召回率 RecallTP / (TP+FN)真正是正的樣本中,有多少被成功預測出來
準確率 Accuracy(TP+TN) / 全部整體預測正確的比例
口訣:精・回・準・F1
⚠️
為什麼 Accuracy 會騙人:當多數類別樣本占絕大多數(如 99% 正常品),模型即使幾乎全部預測「正常」,Accuracy 仍可能很高——卻完全沒有辨識出少數類別。這正是下一節 F1-score 存在的理由。
44 / D章・模型評估

F1-score:不平衡資料的關鍵指標

F1 用「調和平均」逼模型不能只顧一邊——精確率和召回率必須同時不錯,才能拿高分。

F1 = 2 × (Precision × Recall) / (Precision + Recall)
F1-score 是精確率與召回率的調和平均數,特性是:若 Precision 與 Recall 差距懸殊,F1 會被拉向較小的那個值——例如 Precision=0.9、Recall=0.1,F1 只有約 0.18,不會被高 Precision 掩蓋低 Recall。
💡
考古題實例:製造業瑕疵品預測,瑕疵品比例極低。模型全預測「正常品」仍可拿到很高 Accuracy,但完全無法辨識瑕疵。此時最適合的主要評估指標是 F1-score;RMSE/R² 用於迴歸問題不適用;Accuracy 在類別不平衡時會失真。
各指標在不平衡資料下的優缺點
指標優點不平衡資料下的缺點
Accuracy直觀易懂被多數類主導,無法反映少數類表現
Precision避免誤報可能忽略大量漏報(Recall 偏低)
Recall避免漏報可能產生大量誤報(Precision 偏低)
F1-score平衡 Precision 與 Recall未考慮 TN,不適合多類別直接比較
45 / D章・可解釋AI

SHAP:特徵貢獻量化

從賽局理論借來的概念:每個特徵都是「玩家」,模型預測結果是「整體收益」,SHAP 負責公平分配貢獻。

SHAP(SHapley Additive exPlanations)源自賽局理論的 Shapley 值,計算「每個特徵」對某一筆預測結果的貢獻程度:比較「有無此特徵」時預測結果的差異,並考慮所有特徵組合的平均邊際貢獻
  • 正 SHAP 值:該特徵使預測結果提高/推向正類別
  • 負 SHAP 值:該特徵使預測結果降低/推向負類別;絕對值越大,影響力越大
  • 可加性:所有特徵的 SHAP 值加總,等於「這筆預測值」與「平均預測值」的差距——這是它比一般特徵重要性更嚴謹的原因
💡
範例:貸款模型判定核貸分數時,SHAP 可以具體說明「收入」把分數往上推、「負債比」把分數往下拉——而不是只給一個籠統的「特徵重要性排名」。
46 / D章・可解釋AI

LIME:局部代理模型

不管黑箱模型多複雜,LIME 只想在「這一個預測點附近」,用一個簡單模型假裝看懂它。

LIME(Local Interpretable Model-agnostic Explanations):不管原模型多複雜,在單一預測點附近,用一個簡單、可解釋的模型(如線性模型)局部近似它。
  • 運作步驟:對關注的那筆資料做微小擾動,產生鄰近樣本 → 用原模型預測這些樣本 → 用簡單模型擬合「擾動樣本+預測結果」,找出局部重要特徵
  • 例子:判斷一張圖片是「貓」,LIME 會遮蓋不同區域,找出耳朵、鬍鬚等哪些區域對「貓」的判斷最關鍵
口訣:分類時點=後處理;依賴模型程度=模型無關;解釋範圍=局部
⚠️
三個分類維度都要背:LIME 屬於後處理解釋(Post-hoc)——在模型訓練完成後才解釋;屬於模型無關(Model-agnostic)——任何黑箱模型都能套用;屬於局部解釋(Local)——只解釋單一預測,不是整體模型行為。三者常被分開考。
47 / D章・可解釋AI

反事實解釋 vs 顯著性圖

同樣是「事後解釋」,一個負責給行動建議,一個負責畫出模型的視線。

反事實解釋 Counterfactual

  • 核心問題:「要改變什麼,結果才會不同?」
  • 找出讓預測結果翻轉所需的最小輸入變動
  • 例:貸款被拒,若月收入提高,結果會變成核准
  • 應用:信用評分與貸款核准/拒絕說明,給客戶可採取的改善方向

顯著性圖 Saliency Map

  • 核心問題:「模型在看輸入的哪個部分?」
  • 常用於影像任務,透過梯度計算標示每個像素的影響程度
  • 例:判斷「狗」的圖片中,狗臉區域顏色最深(影響最大)
48 / D章・可解釋AI

可解釋 AI 技術選型比較總表

把第 45~47 節四個技術放在同一張表,考試最愛考「這個情境該選哪一個」。

技術解釋範圍核心問題
SHAP全域+局部每個特徵貢獻了多少?(可加性、理論嚴謹)
LIME局部用簡單模型局部近似,任何黑箱模型皆適用
反事實解釋局部要改變什麼輸入,結果才會不同?
顯著性圖局部(視覺)模型在關注輸入的哪個區域?(多用於影像)
49 / D章・模型弱點分析

Clever Hans 效應 vs IBM ART

一個是「發現模型可能學錯了」的警告;一個是「主動把弱點挖出來」的工具箱。

Clever Hans 效應源自一匹「看似會算數」的馬——牠其實是在讀訓練者無意間的表情暗示。用在 AI 上,指模型並未學到真正的任務規則,而是利用資料中的背景、浮水印等偶然特徵做出正確預測。例如模型學到「草地背景=狗」,而不是真正辨識狗的身體特徵;一旦背景改變,模型就可能失效。
比較項目Clever Hans 效應IBM ART
性質問題現象與分析概念開源軟體工具箱
核心問題模型是否利用錯誤線索學習模型能否抵抗對抗攻擊與干擾
目的揭露模型可能沒有真正理解任務攻擊、評估、改善模型安全性與穩健性

IBM ART(Adversarial Robustness Toolbox)是用來研究機器學習安全性的開源工具,可產生對抗樣本(例如對狗的圖片加入極小的擾動,讓人眼仍看見狗,模型卻判斷成貓)、測試模型脆弱程度、評估防禦方法。

口訣:Clever Hans 是「模型可能學錯了」的警告;IBM ART 是「把弱點測出來」的工具箱
50 / D章總結

D 章總結地圖

模型評估分兩層:先看「準不準」,再看「為什麼」。

量化準確度(精確率/召回率/F1/RMSE 等第 43-44 節指標)與理解決策邏輯(SHAP/LIME/反事實/顯著性圖,第 45-47 節)——這是可解釋 AI 章節最重要的兩層架構。加上第 49 節的模型弱點分析(Clever Hans、IBM ART),D 章完整回答了「模型訓練完之後,我們還能做什麼」。 下一步,切換到另一種學習典範——E 章:強化學習(Q-Learning、DQN、RLHF)。
51 / E章・開場

強化學習基礎:透過獎勵學習決策

回顧第01節:強化學習是第三種學習典範,不靠標籤資料,而是靠與環境互動、根據獎勵訊號學習最佳行動策略。

狀態 State
目前所處的情境
行動 Action
智能體採取的動作
獎勵 Reward
環境給予的回饋分數
新狀態
進入下一狀態,循環繼續
💡
類比:學走迷宮——你的「位置」是狀態、「往哪走」是行動、「走出迷宮得高分/撞牆得負分」是獎勵。目標是學會從任何位置找出最佳路徑。

目標:學習一個「策略」,使長期累積獎勵最大化——不是只看眼前這一步的獎勵,而是整條路徑走下來的總和。

52 / E章・強化學習

Q-Learning:學一張 Q 值表

把每種「狀態+行動」的組合,都換算成一個分數,記在一張表裡。

Q-Learning 的核心概念是學習一張「Q 值表」,記錄每個「狀態-行動」組合的預期長期價值(Q 值)。決策方式:在每個狀態下,選擇 Q 值最高的行動。

更新方式:每次行動後,根據「實際獲得的獎勵 + 對下一狀態最佳 Q 值的預估」,逐步修正 Q 值表,讓估計值越來越準確。

⚠️
限制:當狀態與行動的組合數量極大(例如圍棋、電玩畫面),Q 值表會大到無法儲存與計算——這正是下一節 Deep Q-Learning 要解決的問題。
53 / E章・強化學習

Deep Q-Learning(DQN)

表格記不下的東西,就交給神經網路去逼近。

用一個神經網路取代龐大的 Q 值表,直接學習「狀態 → 各行動 Q 值」的對應關係。

輸入

  • 當前狀態(例如遊戲畫面像素、感測器數值)

輸出

  • 每個可能行動所對應的 Q 值(預期價值)
54 / E章・強化學習

RLHF:人類反饋強化學習

把強化學習的「獎勵」,換成人類的偏好判斷——這是現行主流對話式 AI 對齊人類期待的方法。

RLHF(Reinforcement Learning from Human Feedback):將強化學習的「獎勵」機制,改由人類偏好判斷提供,用來微調大型語言模型,使其回答更符合人類期待。
① 預訓練模型
用大量文本訓練基礎語言模型
② 人類標註偏好
人類比較不同回答,標記何者較佳
③ 訓練獎勵模型
學習預測人類會給多少分
④ 強化學習微調
用獎勵模型的分數,以 RL 方式優化主模型
💡
考古題陷阱:企業導入 LLM 客服助理,優化回覆一致性——RLHF 典型流程是「收集人類偏好資料→訓練獎勵模型→用獎勵分數+PPO 微調策略模型」。最不屬於 RLHF 典型活動的是:「以大量未標註語料進行長週期表示學習,提升模型基礎語言能力」——這其實屬於預訓練階段的任務,目的是建立一般語言理解能力,而非利用人類偏好對齊。
55 / E章總結

E 章總結地圖

E章份量不大,但是理解G章LLM訓練方式的必要基礎。

狀態—行動—獎勵的基本迴圈 → Q-Learning 用表格記價值 → DQN 用神經網路逼近解決狀態爆炸問題 → RLHF 把「獎勵」換成「人類偏好」,接上大型語言模型的訓練。 下一步,進入 F 章:隱私與安全技術(差分隱私、聯邦學習、同態加密、MPC、零知識證明)。
56 / F章・開場

隱私與安全技術地圖:AI 落地的五道防線

AI 模型訓練與使用大量資料時,可能洩漏個人隱私或商業機密。以下五項技術,從不同角度提供保護。

技術保護的核心問題
差分隱私如何在公開統計結果時,不洩漏任何個人的資料?
聯邦學習如何在不集中原始資料的情況下,共同訓練模型?
同態加密如何在資料「保持加密」的狀態下完成運算?
安全多方計算如何讓多方共同計算,卻互相不知道對方的輸入?
零知識證明如何證明「我知道某件事」,卻不透露那件事本身?
📍
接下來五節逐一詳解,最後在第 62 節提供選型比較表——這五項技術分別代表「加雜訊」「不搬移資料」「加密運算」「協同計算」「零揭露證明」五種完全不同的思路。
57 / F章・隱私與安全技術

差分隱私 Differential Privacy

資料可以集中,但答案要「模糊」到誰也認不出是你的那一筆。

在資料或運算結果中,刻意加入經過精密計算的「隨機雜訊」。效果:即使攻擊者取得統計結果,也幾乎無法推論出「任何一位」特定個人的真實資料。
⚠️
核心取捨:加入的雜訊越多,隱私保護程度越高,但統計/模型的準確度也會隨之下降——這是差分隱私應用時必須權衡的核心矛盾。

應用:人口普查統計發布、Apple/Google 蒐集使用行為統計、機器學習訓練過程加入雜訊(如 DP-SGD)。

58 / F章・隱私與安全技術

聯邦學習 Federated Learning

資料留在原地,只有「學到的東西」被送出去。

資料不離開使用者裝置,僅在各裝置本地訓練後,將「模型更新」上傳彙總。
① 發送模型
中央伺服器將模型發送到各裝置
② 本地訓練
各裝置用自己的本地資料訓練
③ 上傳更新
只上傳模型參數更新,非原始資料
④ 彙總模型
伺服器整合所有更新,產出新模型

應用:手機輸入法個人化(Gboard)、醫療機構間的模型協作訓練。

59 / F章・隱私與安全技術

同態加密 Homomorphic Encryption

資料全程鎖在保險箱裡,別人卻能隔著箱子幫你加工。

允許直接對「加密後的資料」進行運算,運算結果解密後,等同於對原始明文運算的結果。
💡
類比:把資料鎖進一個特製保險箱,別人可以在「不打開保險箱」的情況下對裡面的東西做加工,加工完仍是鎖著的,只有你能打開看結果。

✅ 優勢

  • 資料在整個運算過程中「從未」以明文形式暴露,隱私保護程度極高

⚠️ 限制

  • 運算成本與時間開銷遠高於明文運算,目前實務應用仍受限於效能

應用:雲端運算隱私保護、醫療與金融敏感資料的委外運算。

60 / F章・隱私與安全技術

安全多方計算 Secure Multi-party Computation(MPC)

大家各自握著秘密,卻能一起算出一個誰也不吃虧的答案。

多個互不信任的參與方,共同計算一個函數的結果,但每一方都無法得知其他人的原始輸入資料。
💡
例子:三家銀行想知道彼此的平均放款利率,但都不想透露自己的實際利率——MPC 協議能讓三方算出正確的平均值,同時沒有人洩漏自己的真實數字。

應用:跨機構聯合風控分析、隱私保護拍賣、多方協同的機器學習訓練。

61 / F章・隱私與安全技術

零知識證明 Zero-Knowledge Proof

證明你知道答案,但一個字都不用說出來。

證明者能讓驗證者相信「自己知道某個秘密/某件事為真」,但過程中完全不透露該秘密的任何內容
💡
經典例子——山洞密碼:你知道打開山洞環形通道中間門的密語,朋友想確認你真的知道,但你不想說出密語。你從入口進去、從指定出口出來,重複多次後,朋友便相信你確實知道密語,卻始終沒聽到密語本身。

應用:區塊鏈交易隱私(如零知識證明幣)、免洩漏個資的身份驗證、隱私保護型電子投票。

62 / F章總結

F 章總結:技術選型比較表

五種技術用「資料是否需要集中」這個問題來分類,是考試最常見的判斷角度。

技術資料是否需集中主要防護方式
差分隱私可集中對結果加入隨機雜訊,模糊化個體
聯邦學習不集中(留在本地)只傳輸模型更新,原始資料不出裝置
同態加密可集中(但加密)在加密狀態下直接運算,全程不解密
安全多方計算不集中(分散各方)協同計算,各方輸入互相保密
零知識證明不需交換資料只證明「知道」而不透露內容本身
這五項技術分別從「加雜訊」「不搬移資料」「加密運算」「協同計算」「零揭露證明」五種思路解決隱私問題——遇到情境題,先問自己:「這題的資料到底有沒有集中在一個地方?」通常就能篩掉一半選項。 下一步,進入 G 章:大型語言模型與提示工程(CoT、ToT、Few-shot、上下文工程、評測基準)。
63 / G章・開場

大型語言模型 LLM 基礎

G 章不重複介紹 Transformer 的技術細節,而是聚焦在「拿到 LLM 之後,怎麼把它用好」。

LLM(大型語言模型)以海量文本訓練而成的深度神經網路(多採用 Transformer 架構),能理解與生成人類語言。訓練歷程:預訓練(學習語言規律)→ RLHF 微調(見第 54 節)使回答更符合人類偏好。

核心能力:文本生成、問答、翻譯、程式碼撰寫、摘要整理——例如 GPT 系列、Claude、Gemini 皆屬此類模型。

📍
本章重點:如何透過「提示工程」有效驅動 LLM,發揮其最大效用——這是使用 LLM 的關鍵技能,也是接下來 8 節的主軸。
64 / G章・提示工程

提示工程 Prompt Engineering:四大原則

這四項原則,正好對應接下來四節要展開的具體技術。

原則說明
清楚明確具體描述需求,避免模糊指令,減少模型自行猜測的空間
提供背景(上下文)說明用途、角色、限制條件,讓模型理解情境
給予範例用範例演示期望的輸出格式與風格(見第 65 節 Few-shot)
逐步引導複雜任務拆解成小步驟,引導模型逐步推理(見第 66-67 節 CoT/ToT)
65 / G章・提示工程

Zero-shot vs Few-shot Prompting

要不要先給模型看幾個例子,是準確度與效率之間最簡單的取捨。

Zero-shot(零樣本)

  • 不提供任何範例,直接下達任務指令
  • 完全仰賴模型預訓練所學到的知識
  • 例:「請將這句話翻譯成日文」
  • 優點:快速;限制:精準度可能較不穩定

Few-shot(少樣本)

  • 在提示中提供 2~5 個範例,示範任務的輸入輸出模式
  • 例:「範例1:...→...;範例2:...→...;現在請翻譯:...」
  • 優點:準確度通常較高,格式更貼近期望
💡
選用原則:任務簡單、格式固定 → Zero-shot 即可;任務較特殊、需要特定輸出格式 → 用 Few-shot 提升穩定度。
66 / G章・提示工程

思維鏈提示 Chain-of-Thought(CoT)

一句「請一步步思考」,往往就能讓模型的多步驟推理準確度明顯提升。

引導模型先寫出「一步步的推理過程」,再給出最終答案,而非直接跳到結論。

❌ 一般提示

直接問:「小明有5顆蘋果,吃了2顆,又買了3顆,現在有幾顆?」——模型可能跳步驟,複雜問題容易出錯。

✅ CoT 提示

加上「請一步步思考」:引導模型列出「5-2=3」「3+3=6」等推理步驟——複雜的多步驟推理準確度明顯提升。

適用情境:數學計算、邏輯推理、多步驟決策等需要「過程」而非只有「答案」的任務。

67 / G章・提示工程

樹狀思維提示 Tree-of-Thought(ToT)

CoT 一路想到底,中途很難回頭;ToT 讓模型可以「試錯、比較、再選一條路走」。

ToT 是 CoT 的進階版本:不只走一條推理路徑,而是同時展開多條路徑,評估並選擇最佳路徑。

CoT 思維鏈

  • 單一線性推理路徑
  • 一路想到底,中途很難「回頭」修正方向

ToT 樹狀思維

  • 同時探索多條推理分支
  • 可評估各分支優劣,必要時回溯換路徑重新推理
⚠️
取捨:ToT 對高難度、開放性問題(如複雜規劃、需要試錯的推理題)效果更好,但因為要探索多條路徑,計算成本也比 CoT 更高
68 / G章・提示工程

上下文工程 Context Engineering

「翻譯這句話」和「你是醫療翻譯專家,請把病歷譯成英文」——差別不是禮貌,是模型能不能猜對你要什麼。

有系統地設計並組織提供給 LLM 的背景資訊(角色設定、任務說明、限制條件),而不只是單一句指令。

❌ 缺乏上下文

「翻譯這句話」——模型不清楚領域、語氣、專業程度要求。

✅ 完整上下文

「你是醫療翻譯專家,請將病歷譯成英文,術語需用專業醫學詞彙」——角色、任務、限制條件一次到位。

69 / G章・提示工程

自動提示工程 APE(Automatic Prompt Engineer)

連「寫提示詞」這件事,都可以交給 AI 自動最佳化。

人工撰寫與調整提示詞費時、且效果因人而異,難以系統化最佳化。APE 的解法:用 LLM「自動生成並優化」提示詞本身——讓 AI 幫 AI 寫提示詞。
① 生成候選
用 LLM 自動產生多個候選提示詞
② 評估效果
在測試集上評估各提示詞的表現
③ 迭代優化
保留、修正表現最好的提示詞,重複流程
💡
意義:讓提示詞優化從「人工經驗」走向「自動化、可量化評估」的流程,是提示工程走向系統化的下一步。
70 / G章・評測

LLM 評測基準:如何量化比較不同模型

提示工程再厲害,最終還是要有一套客觀標準,才能比較「哪個模型比較強」。

基準測驗內容
MMLU涵蓋 57 個學科的多選題,測試模型的廣泛知識與理解能力
GSM8K約 8,500 題小學程度數學應用題,測試基礎數學推理能力
MATH難度更高的競賽數學題,測試複雜多步驟數學推理能力
C-Eval中文綜合評測基準,涵蓋多學科考題,測試中文語境下的能力
71 / G章總結

G 章總結地圖

從「認識 LLM」到「量化評分」,走完提示工程的完整旅程。

LLM 基礎提示工程四大原則Zero/Few-shot(範例)→ CoT/ToT(逐步引導)→ 上下文工程(背景資訊)→ APE(自動化優化)→ 用標準化基準評測成果。 下一步,進入最後一章——H 章:系統設計、部署與治理(知識蒸餾、MLOps、UML、監管沙盒)。
72 / H章・開場

H章開場:呼應第02節「⑥部署維運」

六步驟工作流程的最後一哩路——模型不是訓練完就結束,而是要能穩定上線、持續運作。

回到第02節的六步驟地圖:①EDA→②ETL→③特徵工程→④模型訓練→⑤模型評估→⑥部署維運。前五步在 A~E 章都已經走完,H 章要處理的正是最後一步——把訓練好、評估過的模型,安全地送上生產環境,並持續維護下去。

📍
接下來 8 節涵蓋:如何把模型變小變快(知識蒸餾)、如何系統化維運(MLOps)、推論策略怎麼選(批次vs即時)、沒有足夠人才時怎麼辦(AutoML)、如何溝通系統架構(UML/解決方案圖)、以及 AI 治理相關概念(能力分級、監管沙盒)。
73 / H章・系統設計與部署

知識蒸餾 Knowledge Distillation(KD)

大模型很聰明,但手機裝不下——讓小模型拜大模型為師,學到接近的判斷能力。

大型模型準確度高,但運算量大、成本高、速度慢,不利於在手機等資源有限的裝置上運行。解法:讓一個小型「學生模型」,學習模仿大型「教師模型」的輸出(含機率分佈),繼承其判斷能力。

成果:學生模型體積更小、推論速度更快,同時保留接近教師模型的準確度。應用:手機端 AI 助理、邊緣運算裝置上的即時推論。

74 / H章・系統設計與部署

MLOps(Machine Learning Operations)

模型上線那一刻,不是終點,而是另一段旅程的開始。

將機器學習模型從實驗階段帶入正式生產環境、並持續維運的完整工程實踐,直接呼應第02節工作流程的「⑥部署維運」
資料管理
資料版本控制、持續蒐集清理
模型訓練
實驗追蹤、參數調校、驗證
部署上線
模型封裝、API 化、灰度發布
監控維護
偵測資料飄移、定期重新訓練
💡
意義:MLOps 確保模型不是「訓練完就結束」,而是能持續穩定運作、隨資料變化更新——是 AI 專案能否長期成功的關鍵工程能力。
75 / H章・系統設計與部署

批次推論 vs 即時推論

同一個模型,服務方式不同,考量的優先順序完全不一樣。

批次推論 Batch Inference

  • 延遲容忍度較大,適合大規模資料處理
  • 吞吐量最佳化為優先
  • 典型應用:每日信用評分更新、推薦清單預計算、報表生成
  • 執行模式:非同步、排程或按需

即時推論 Real-time Inference

  • 需在毫秒到秒級內回應
  • 著重請求回應時間的穩定性與低延遲
  • 典型應用:推薦系統、詐騙偵測、自駕車決策
  • 執行模式:同步、持續運行端點
⚠️
考古題陷阱:批次推論通常採非同步機制,不是同步請求;即時推論才需要同步、低延遲。此外,兩者的選擇與「資料類型是影像或結構化」無關,取決的是延遲與吞吐量需求;即時推論也可以支援小批次輸入,並非限制單筆。
76 / H章・系統設計與部署

AutoML:缺人才也能快速上線

當企業沒有足夠的資料科學家,AutoML 讓「自動化」補上這塊缺口。

AutoML(Automated Machine Learning)自動化機器學習中重複、需要專業判斷的步驟——例如特徵工程、演算法選擇、超參數調校——讓不具備深厚 AI 專業背景的團隊,也能快速產出可用的模型。
💡
適用情境:企業內部缺乏 AI 專業人員,且需要快速上線驗證效果時,AutoML 平台是常見的解決方案——把「建模的專業知識」封裝進工具本身。
77 / H章・系統設計與部署

UML 統一塑模語言 與 解決方案圖

兩者都是「畫圖溝通系統設計」的工具,只是一個學術嚴謹、一個直觀彈性。

UML(Unified Modeling Language)

  • 標準化的圖形化塑模語言,描述軟體/系統的結構與行為
  • 常見圖類:類別圖、循序圖、流程圖
  • 用途:開發 AI 應用前,先溝通清楚系統設計

解決方案圖 Solution Graph

  • 將 AI 系統組件(資料源、模型、介面)及其關係視覺化呈現
  • 例:使用者輸入 → NLP → LLM 生成 → 知識庫查詢
  • 用途:讓團隊快速理解整體架構
78 / H章・AI治理概念

AI 能力分級:弱AI/AGI/ASI

從「只會做一件事」到「全面超越人類」,是理解 AI 發展階段的一把尺。

分級核心特徵
弱 AI(Narrow AI)只能執行單一或特定任務,是目前所有實際應用的 AI 系統(包含 LLM)所處的層級
強 AI/AGI
(Artificial General Intelligence)
具備跨領域的通用智慧,能像人類一樣學習、推理、適應各種任務——目前仍屬理論/研究階段
ASI(Artificial Superintelligence)全面超越人類智慧的假設性階段,仍屬推測性概念
口訣:弱AI(單一任務)< 強AI/AGI(跨領域)< ASI(全面超越人類)
79 / H章・應用場景

電腦視覺任務層次:分類→偵測→分割

同樣是「看懂一張圖」,任務的精細程度差很多——這正是電腦視覺情境題最愛考的分辨力。

影像分類
判斷「有沒有」——圖中是否存在某物件
物件偵測
判斷「在哪裡」——框出物件的位置範圍
影像分割
判斷「精確範圍」——標出每個像素屬於哪個類別
💡
考古題實例:環保局透過監測站攝影機影像,找出煙霧區域並標示位置與範圍——這屬於影像分割技術(因為需要精確標出每個像素的區域,也涉及物件偵測的定位概念)。判斷「有沒有煙霧」只是影像分類;「煙霧在哪裡並畫框」才到物件偵測;「精確標出每個像素區域」才是影像分割。
80 / H章・AI治理

監管沙盒 Regulatory Sandbox

在真正上市之前,先在一個「安全的實驗室」裡把規則和風險都摸清楚。

政府/主管機關劃設的「限制型」測試環境,允許企業在監督下,以放寬部分法規要求的方式,測試創新的 AI 產品或服務。

目的:在真實市場全面推行前,先於可控範圍內驗證技術與商業模式,同時控管潛在風險——這是 AI 治理中「鼓勵創新」與「控管風險」之間的一種平衡機制。

81 / 全書總結

全書總結:A~H 章完整地圖

八個章節,其實只是同一條生產線被拆開檢視——現在,把它重新接回去。

A 資料與訓練基礎B 經典演算法/C 深度學習架構(依任務選型)→ D 評估與解釋模型E 強化學習(第三種典範)→ F 隱私安全防護G 大型語言模型與提示工程H 系統設計與上線治理
📝
複習建議:準備 iPAS AI 應用規劃師考試時,建議依此順序複習——先掌握每個名詞的「一句話定義」,再理解其在整體工作流程中的「位置與關聯」,最後比較同類技術間的異同。這正是這整套系統筆記從第一頁到最後一頁,貫徹始終的邏輯。
全書章節地圖
章節主題核心內容
A機器學習基礎與流程EDA、ETL、特徵工程、損失函數、正則化
B經典機器學習演算法SVM、KNN、K-means、隨機森林、貝氏網路
C神經網路與深度學習激活函數、CNN家族、RNN/LSTM、VAE、GAN、GCN
D模型評估與可解釋AIF1-score、SHAP、LIME、反事實解釋、顯著性圖
E強化學習Q-Learning、DQN、RLHF
F隱私與安全技術差分隱私、聯邦學習、同態加密、MPC、零知識證明
G大型語言模型與提示工程CoT、ToT、Few-shot、上下文工程、評測基準
H系統設計、部署與治理知識蒸餾、MLOps、UML、監管沙盒
iPAS AI 應用規劃師・初級能力鑑定|系統筆記 A~H 章完整版 81 / 81 節・全書完