首頁教材庫 / 強化學習 / Q-Learning vs Deep Q-Learning

iPAS AI初級 強化學習 ⏱ 約 5 分鐘讀完
iPAS AI 初級・漫畫式小白教材

Q-Learning vs Deep Q-Learning

強化學習的「Q表小抄」 vs 「神經網路大腦」

🎬 第一幕:AI 玩遊戲學習

🎮 遊戲世界
🤖🕹️
「我現在站在這裡,要往左還是往右?」

AI 不知道正確答案,要靠與環境互動學習。

🏆 獎勵
⭐🎁
往右 → +10!
撞牆 → -5!

透過 Reward 判斷行動好不好。

🧠 強化學習
🤖➡️🏆

AI 不需要人工一筆一筆告訴它標準答案。

「試 → 得到獎勵 → 更新 → 再試」

🧠 一句話先背起來

Q-Learning=用 Q-Table 記住「狀態+行動」的價值
Deep Q-Learning=用深度神經網路近似 Q 值

📖 Q-Learning

像一本「行動攻略表」。

每個 State × Action 都存一個 Q 值,代表「在這個狀態做這個行動,未來有多好」。

Q-TableTabular

🧠 Deep Q-Learning / DQN

像一個會估算的神經網路大腦。

輸入 State,神經網路輸出各 Action 的 Q 值近似。

Neural NetworkDQN

🎭 第二幕:Q-Table 就像「遊戲攻略本」

📖 Q-Table
📚

表格記錄:

S1+左 → 2.0
S1+右 → 8.5
S1+上 → 3.1
🤖 查表
🔎📖
「現在是 S1……右邊 Q=8.5!」

直接挑 Q 值較大的 Action。

⚠️ 表格變超大
📚📚📚

如果 State 有很多維度:

天氣 × 位置 × 速度 × 血量 × ……

Q-Table 可能大到難以實際儲存。

🚀 第三幕:DQN 登場——「不要把所有答案寫進表格!」

😵 Q-Table
📚💥

狀態太多:

「每個狀態都存起來,我會爆掉!」
🧠 DQN
🧠⚡
「交給神經網路,我來估 Q 值!」

輸入 State → Network → 各 Action 的 Q 值。

🎯 結果
🎮➡️🧠➡️🏆

不需要把每一種狀態都逐格存在 Q-Table。

因此更能擴展到高維狀態空間。

State → Deep Neural Network → Q(Action₁), Q(Action₂), Q(Action₃) …

🔄 第四幕:Q-Learning 怎麼更新?

👀
① State
現在在哪?
🎮
② Action
做什麼?
③ Reward
得到多少?
🔄
④ Next State
到了哪裡?
📈
⑤ 更新 Q
修正價值
Q(s,a) ← Q(s,a) + α [ r + γ max Q(s′,a′) − Q(s,a) ]

不必死背公式;考試更重要的是知道:Q 值會依據 Reward 與下一狀態的預期價值持續更新。

🎯 第五幕:DQN 的「神經網路大腦」

📥 輸入

State

例如遊戲畫面、車輛狀態、機器人位置等高維資訊。

📤 輸出

每個 Action 的 Q 值

左:2.1
右:8.7
跳:4.3

選擇 Q 值較大的行動。

⭐ 核心差異:Q-Learning「查表」;DQN「用神經網路估算」。

📦 第六幕:Experience Replay 經驗回放

① 玩遊戲
🎮🤖

每次互動產生一筆經驗:

(State, Action, Reward, Next State)
② 存進 Buffer
📦📦📦

把過去經驗存起來。

Replay Buffer

③ 隨機抽樣
🎲📦➡️🧠

不是照原本時間順序全部拿來學,而是隨機抽一批經驗訓練。

打散時間相關性,提升訓練穩定性。

Experience → Replay Buffer → Random Mini-batch → DQN Training

🎯 第七幕:Target Network 也要一起記

🧠 Online Network

目前正在學習、更新參數的主要神經網路。

🎯 Target Network

提供較穩定的目標 Q 值,通常不是每一步都更新,而是定期同步部分/全部參數。

DQN 常見穩定化技巧:Experience Replay + Target Network
🎯 考試看到「DQN+經驗回放+目標網路」通常是在考 DQN 如何改善直接用神經網路做 Q-learning 時的不穩定問題。

🥊 第八幕:Q-Learning vs DQN 一次搞懂

比較📖 Q-Learning🧠 Deep Q-Learning / DQN
Q 值怎麼表示?Q-Table深度神經網路近似 Q Function
狀態空間適合較小、離散的狀態空間較能處理高維、複雜的狀態表示
是否需要標記資料?❌ 不需要 supervised labels❌ 不需要 supervised labels
學習來源環境互動+Reward環境互動+Reward
常見技術Q-value 更新Experience Replay、Target Network
漫畫📖「翻攻略表」🧠「用大腦估答案」

⚠️ 第九幕:四個選項的陷阱

❌ A. 差異不是「有沒有標記資料」。兩者都是強化學習,主要依靠環境互動與 Reward,而不是傳統監督式學習的標記答案。

❌ B. 正好相反。Q-Table 在狀態空間很大或連續時會變得難以擴展;DQN 用神經網路近似 Q 值,因此更適合高維狀態。

✅ C. 正確答案
DQN 透過深度神經網路近似 Q 值,避免把所有狀態×行動組合逐一存進龐大的 Q-Table。

❌ D. DQN 不但可以搭配 Experience Replay,而且這是經典 DQN 的重要技巧之一。隨機抽樣正是為了打散連續樣本的時間相關性。

🧠 iPAS 考前超強口訣

Q-Learning=📖 查 Q-Table
DQN=🧠 神經網路估 Q 值
Experience Replay=📦 存經驗+🎲 隨機抽

看到「Q-Table」→ Q-Learning

看到「神經網路近似 Q 值」→ DQN

看到「Replay Buffer/經驗回放」→ DQN 常見技巧

⭐ DQN 的核心不是換掉強化學習,而是「用深度神經網路取代龐大的 Q-Table」。

🎯 最後來做你提供的例題

題目:關於 Q-Learning 與 Deep Q-Learning,下列敘述何者最正確?

A. 差異在是否使用標記資料
B. Q-Learning 可處理任意維度狀態空間,因此更靈活
C. DQN 透過深度神經網路近似 Q 值,避免 Q 表在高維空間中難以擴展
D. DQN 無法搭配 Experience Replay

🎯 正確答案:C ✅

Q-Learning 使用 Q-Table 儲存狀態與行動的 Q 值;當狀態空間變得非常大或是連續時,Q-Table 會遭遇維度爆炸問題。

DQN 則改用深度神經網路近似 Q 函數,讓模型可以從複雜狀態學習 Q 值,而不必逐一建立所有 Q-Table 格子。

而且 DQN 經常搭配:
📦 Experience Replay:隨機抽取過去經驗

🎯 Target Network:提供較穩定的學習目標
⭐ Q-Table 太大怎麼辦?「不要一格一格存,讓神經網路幫我估!」→ DQN

📌 考前最後一張小抄

題目關鍵字立刻想到
Q-Table📖 Q-Learning
狀態×行動全部存表📖 Q-Learning
高維狀態空間🧠 DQN
神經網路近似 Q 值🧠 DQN
Experience Replay📦 DQN 經典技巧
Target Network🎯 DQN 經典技巧
Reward/環境互動🎮 兩者都是強化學習
需要人工標記答案❌ 不是兩者的核心差異

⭐ 最終口訣:
Q-Learning 查表,DQN 用網路估;Replay 打散經驗,Target 穩住學習。