① SFT 老師
👨⚕️📋
「這個病例,標準答案是 A。」
有題目+標準答案,AI 照著學。
一個是「老師給標準答案」,一個是「用獎勵告訴 AI 哪個方向比較好」!
有題目+標準答案,AI 照著學。
用評分/獎勵回饋引導模型優化。
SFT:「答案就是這個!」
RFT:「這個答案比較好,往這個方向學!」
「給 AI 題目+正確答案,讓它學著模仿。」
使用已標註的輸入-輸出資料進行微調,模型學習在特定任務中產生符合示範答案的輸出。
標註資料標準答案模仿「答案出來後,用獎勵/評分告訴模型哪個比較好。」
模型產生輸出後,透過獎勵訊號、評分器或回饋機制評估品質,再朝高獎勵方向優化。
獎勵評分回饋例如:「病例 X → 診斷 Y」。AI 從大量「題目+答案」範例學習。
模型提出答案,評分器依據目標品質給獎勵,模型逐漸學會什麼樣的回答比較好。
| 比較 | 📋 SFT | 🏆 RFT |
|---|---|---|
| 核心 | 模仿標註資料中的目標輸出 | 根據獎勵/評分訊號最佳化 |
| 主要監督訊號 | 「正確答案/示範答案」 | 「這個答案得幾分/是否符合目標」 |
| 適合 | 有明確、可靠的標準答案 | 答案品質可用規則、評分器或其他回饋衡量 |
| 資料有限時 | 人工標註範例少會限制示範學習 | 若能建立有效獎勵機制,可能降低對大量人工標準答案的依賴 |
| 口訣 | 「有答案,學答案」 | 「有評分,學高分」 |
每個病例最好有可靠的「輸入 → 標準輸出」標註。
醫療專家很難大量標註。
如果能建立有效評分機制,就不必每個案例都人工提供唯一答案。
可用規則、評分器、專家回饋等產生 reward。
RFT 仍需要可靠的獎勵訊號。
獎勵設計不好,模型也可能學歪。
資料:
模型學習「病例+標準診斷」的對應關係。
模型先提出診斷與推理:
模型逐漸偏向能得到較高評分的回答。
看到「標註資料、標準答案、示範答案」→ SFT
看到「獎勵、評分、回饋、reward、grader」→ RFT
SFT 學「答案長什麼樣」;RFT 學「什麼樣的答案比較好」。
① 有 10,000 筆「問題+標準答案」→?
② 很難取得大量人工答案,但能建立可靠自動評分規則→?
③ RFT 是否完全不需要資料?
| 題目關鍵字 | 答案 |
|---|---|
| 已標註病例 | 📋 SFT |
| 輸入+標準答案 | 📋 SFT |
| 模仿示範答案 | 📋 SFT |
| 獎勵/懲罰 | 🏆 RFT |
| 評分器/grader | 🏆 RFT |
| 透過回饋最佳化 | 🏆 RFT |
| 標註少+可靠評分機制 | 🏆 RFT 可能更適合 |
⭐「SFT 老師給答案,RFT 老師給分數。」