首頁教材庫 / 模型訓練策略 / RFT vs SFT

iPAS AI進階 模型訓練策略 ⏱ 約 4 分鐘讀完
iPAS AI 初級・進階漫畫式教材

RFT vs SFT

一個是「老師給標準答案」,一個是「用獎勵告訴 AI 哪個方向比較好」!

🎬 第一幕:AI 要學會「醫療診斷」

① SFT 老師
👨‍⚕️📋
「這個病例,標準答案是 A。」

有題目+標準答案,AI 照著學。

② RFT 老師
🤖🏆
「你這個答案比較好,得分!」

用評分/獎勵回饋引導模型優化。

③ 兩種學習法
📋 VS 🏆

SFT:「答案就是這個!」

RFT:「這個答案比較好,往這個方向學!」

🧠 一句話先分清楚

📋 SFT|監督式微調

「給 AI 題目+正確答案,讓它學著模仿。」

使用已標註的輸入-輸出資料進行微調,模型學習在特定任務中產生符合示範答案的輸出。

標註資料標準答案模仿

🏆 RFT|強化微調

「答案出來後,用獎勵/評分告訴模型哪個比較好。」

模型產生輸出後,透過獎勵訊號、評分器或回饋機制評估品質,再朝高獎勵方向優化。

獎勵評分回饋
📋 SFT=「這是正確答案,照著學」
🏆 RFT=「這個答案得分比較高,往這個方向學」

🎭 第二幕:用「考試老師」秒懂

📋 SFT:老師直接公布答案

題目
📝
標準答案
🤖
模仿
學會

例如:「病例 X → 診斷 Y」。AI 從大量「題目+答案」範例學習。

🏆 RFT:老師不一定公布唯一答案

問題
🤖
產生答案
評分
🧠
優化

模型提出答案,評分器依據目標品質給獎勵,模型逐漸學會什麼樣的回答比較好。

🥊 第三幕:RFT 跟 SFT 到底差在哪?

比較📋 SFT🏆 RFT
核心模仿標註資料中的目標輸出根據獎勵/評分訊號最佳化
主要監督訊號「正確答案/示範答案」「這個答案得幾分/是否符合目標」
適合有明確、可靠的標準答案答案品質可用規則、評分器或其他回饋衡量
資料有限時人工標註範例少會限制示範學習若能建立有效獎勵機制,可能降低對大量人工標準答案的依賴
口訣「有答案,學答案」「有評分,學高分」

🔍 第四幕:為什麼「少量標註資料」會讓 RFT 有優勢?

SFT 的困境
📋😵

每個病例最好有可靠的「輸入 → 標準輸出」標註。

醫療專家很難大量標註。

RFT 的機會
🏆⭐

如果能建立有效評分機制,就不必每個案例都人工提供唯一答案。

可用規則、評分器、專家回饋等產生 reward。

⚠️ 不是魔法
⚠️

RFT 仍需要可靠的獎勵訊號。

獎勵設計不好,模型也可能學歪。

🏥 第五幕:套進醫療診斷案例

📋 SFT

資料:

病例 → 「肺炎」
病例 → 「流感」
病例 → 「氣喘」

模型學習「病例+標準診斷」的對應關係。

🏆 RFT

模型先提出診斷與推理:

病例 → 模型回答

評分器/專家規則

獎勵 0~100

模型逐漸偏向能得到較高評分的回答。

⚠️ 醫療 AI 是高風險領域。本例僅用於理解微調方法,不代表 RFT 可以取代醫療專業驗證或臨床安全流程。

🎯 第六幕:你這題的四個選項逐一拆解

❌ A. RFT 需大量高品質標註資料——把 RFT 誤解成 SFT;RFT 核心是獎勵/評分回饋。

✅ B. RFT 透過獎懲回饋機制引導模型優化,對大量標註答案的依賴相對較低——符合題目設定。答案:B

❌ C. RFT 與 SFT 資料需求本質相同——錯,核心監督訊號不同。

❌ D. RFT 能從未標註資料自動產生正確標註並完全取代 SFT——太絕對。RFT 仍需要可靠的評分/獎勵機制。

🧠 iPAS 考前超強口訣

📋 SFT=「老師給答案」
🏆 RFT=「老師給分數」

看到「標註資料、標準答案、示範答案」→ SFT
看到「獎勵、評分、回饋、reward、grader」→ RFT

SFT 學「答案長什麼樣」;RFT 學「什麼樣的答案比較好」。

🎯 快速判斷

① 有 10,000 筆「問題+標準答案」→?

👉 SFT

② 很難取得大量人工答案,但能建立可靠自動評分規則→?

👉 RFT 可能更有優勢

③ RFT 是否完全不需要資料?

👉 不是。需要可靠的 reward/評分機制。
⚠️ 考試看到「資料少」不要直接背成「RFT 一定最好」;真正關鍵是能不能建立有效的獎勵/評分機制

📌 考前最後一張小抄

題目關鍵字答案
已標註病例📋 SFT
輸入+標準答案📋 SFT
模仿示範答案📋 SFT
獎勵/懲罰🏆 RFT
評分器/grader🏆 RFT
透過回饋最佳化🏆 RFT
標註少+可靠評分機制🏆 RFT 可能更適合

⭐「SFT 老師給答案,RFT 老師給分數。」