首頁 / 教材庫 / 強化學習 / Q-Learning vs Deep Q-Learning
iPAS AI初級
強化學習
⏱ 約 5 分鐘讀完
iPAS AI 初級・漫畫式小白教材
Q-Learning vs Deep Q-Learning
強化學習的「Q表小抄」 vs 「神經網路大腦」
🎬 第一幕:AI 玩遊戲學習
🎮 遊戲世界
🤖🕹️
「我現在站在這裡,要往左還是往右?」
AI 不知道正確答案,要靠與環境互動學習。
🏆 獎勵
⭐🎁
往右 → +10!
撞牆 → -5!
透過 Reward 判斷行動好不好。
🧠 強化學習
🤖➡️🏆
AI 不需要人工一筆一筆告訴它標準答案。
「試 → 得到獎勵 → 更新 → 再試」
🧠 一句話先背起來
Q-Learning=用 Q-Table 記住「狀態+行動」的價值
Deep Q-Learning=用深度神經網路近似 Q 值
📖 Q-Learning
像一本「行動攻略表」。
每個 State × Action 都存一個 Q 值,代表「在這個狀態做這個行動,未來有多好」。
Q-TableTabular
🧠 Deep Q-Learning / DQN
像一個會估算的神經網路大腦。
輸入 State,神經網路輸出各 Action 的 Q 值近似。
Neural NetworkDQN
🎭 第二幕:Q-Table 就像「遊戲攻略本」
📖 Q-Table
📚
表格記錄:
S1+左 → 2.0
S1+右 → 8.5
S1+上 → 3.1
🤖 查表
🔎📖
「現在是 S1……右邊 Q=8.5!」
直接挑 Q 值較大的 Action。
⚠️ 表格變超大
📚📚📚
如果 State 有很多維度:
天氣 × 位置 × 速度 × 血量 × ……
Q-Table 可能大到難以實際儲存。
🚀 第三幕:DQN 登場——「不要把所有答案寫進表格!」
😵 Q-Table
📚💥
狀態太多:
「每個狀態都存起來,我會爆掉!」
🧠 DQN
🧠⚡
「交給神經網路,我來估 Q 值!」
輸入 State → Network → 各 Action 的 Q 值。
🎯 結果
🎮➡️🧠➡️🏆
不需要把每一種狀態都逐格存在 Q-Table。
因此更能擴展到高維狀態空間。
State → Deep Neural Network → Q(Action₁), Q(Action₂), Q(Action₃) …
🔄 第四幕:Q-Learning 怎麼更新?
Q(s,a) ← Q(s,a) + α [ r + γ max Q(s′,a′) − Q(s,a) ]
不必死背公式;考試更重要的是知道:Q 值會依據 Reward 與下一狀態的預期價值持續更新。
🎯 第五幕:DQN 的「神經網路大腦」
📥 輸入
State
例如遊戲畫面、車輛狀態、機器人位置等高維資訊。
📤 輸出
每個 Action 的 Q 值
左:2.1
右:8.7
跳:4.3
選擇 Q 值較大的行動。
⭐ 核心差異:Q-Learning「查表」;DQN「用神經網路估算」。
📦 第六幕:Experience Replay 經驗回放
① 玩遊戲
🎮🤖
每次互動產生一筆經驗:
(State, Action, Reward, Next State)
② 存進 Buffer
📦📦📦
把過去經驗存起來。
Replay Buffer
③ 隨機抽樣
🎲📦➡️🧠
不是照原本時間順序全部拿來學,而是隨機抽一批經驗訓練。
打散時間相關性,提升訓練穩定性。
Experience → Replay Buffer → Random Mini-batch → DQN Training
🎯 第七幕:Target Network 也要一起記
🧠 Online Network
目前正在學習、更新參數的主要神經網路。
🎯 Target Network
提供較穩定的目標 Q 值,通常不是每一步都更新,而是定期同步部分/全部參數。
DQN 常見穩定化技巧:Experience Replay + Target Network
🎯 考試看到「DQN+經驗回放+目標網路」通常是在考 DQN 如何改善直接用神經網路做 Q-learning 時的不穩定問題。
🥊 第八幕:Q-Learning vs DQN 一次搞懂
| 比較 | 📖 Q-Learning | 🧠 Deep Q-Learning / DQN |
| Q 值怎麼表示? | Q-Table | 深度神經網路近似 Q Function |
| 狀態空間 | 適合較小、離散的狀態空間 | 較能處理高維、複雜的狀態表示 |
| 是否需要標記資料? | ❌ 不需要 supervised labels | ❌ 不需要 supervised labels |
| 學習來源 | 環境互動+Reward | 環境互動+Reward |
| 常見技術 | Q-value 更新 | Experience Replay、Target Network |
| 漫畫 | 📖「翻攻略表」 | 🧠「用大腦估答案」 |
⚠️ 第九幕:四個選項的陷阱
❌ A. 差異不是「有沒有標記資料」。兩者都是強化學習,主要依靠環境互動與 Reward,而不是傳統監督式學習的標記答案。
❌ B. 正好相反。Q-Table 在狀態空間很大或連續時會變得難以擴展;DQN 用神經網路近似 Q 值,因此更適合高維狀態。
✅ C. 正確答案
DQN 透過深度神經網路近似 Q 值,避免把所有狀態×行動組合逐一存進龐大的 Q-Table。
❌ D. DQN 不但可以搭配 Experience Replay,而且這是經典 DQN 的重要技巧之一。隨機抽樣正是為了打散連續樣本的時間相關性。
🧠 iPAS 考前超強口訣
Q-Learning=📖 查 Q-Table
DQN=🧠 神經網路估 Q 值
Experience Replay=📦 存經驗+🎲 隨機抽
看到「Q-Table」→ Q-Learning
看到「神經網路近似 Q 值」→ DQN
看到「Replay Buffer/經驗回放」→ DQN 常見技巧
⭐ DQN 的核心不是換掉強化學習,而是「用深度神經網路取代龐大的 Q-Table」。
🎯 最後來做你提供的例題
題目:關於 Q-Learning 與 Deep Q-Learning,下列敘述何者最正確?
A. 差異在是否使用標記資料
B. Q-Learning 可處理任意維度狀態空間,因此更靈活
C. DQN 透過深度神經網路近似 Q 值,避免 Q 表在高維空間中難以擴展
D. DQN 無法搭配 Experience Replay
🎯 正確答案:C ✅
Q-Learning 使用 Q-Table 儲存狀態與行動的 Q 值;當狀態空間變得非常大或是連續時,Q-Table 會遭遇維度爆炸問題。
DQN 則改用深度神經網路近似 Q 函數,讓模型可以從複雜狀態學習 Q 值,而不必逐一建立所有 Q-Table 格子。
而且 DQN 經常搭配:
📦 Experience Replay:隨機抽取過去經驗
+
🎯 Target Network:提供較穩定的學習目標
⭐ Q-Table 太大怎麼辦?「不要一格一格存,讓神經網路幫我估!」→ DQN
📌 考前最後一張小抄
| 題目關鍵字 | 立刻想到 |
| Q-Table | 📖 Q-Learning |
| 狀態×行動全部存表 | 📖 Q-Learning |
| 高維狀態空間 | 🧠 DQN |
| 神經網路近似 Q 值 | 🧠 DQN |
| Experience Replay | 📦 DQN 經典技巧 |
| Target Network | 🎯 DQN 經典技巧 |
| Reward/環境互動 | 🎮 兩者都是強化學習 |
| 需要人工標記答案 | ❌ 不是兩者的核心差異 |
⭐ 最終口訣:
「Q-Learning 查表,DQN 用網路估;Replay 打散經驗,Target 穩住學習。」