歷史、法律、科學、人文……
→ MMLUMMLU × GSM8K × MATH × C-Eval:到底各自拿來考 AI 什麼?
歷史、法律、科學、人文……
→ MMLU小學數學 vs 競賽數學
→ GSM8K / MATH中文多學科知識
→ C-Eval| 資料集 | 白話 | 主要測什麼? | 記憶法 |
|---|---|---|---|
| MMLU | 🌍「什麼都考一點」 | 多領域、多任務的廣泛知識與理解 | 🌍 廣度 |
| GSM8K | 🧮「小學數學應用題」 | 基礎數學文字題與多步驟推理 | 🧮 基礎數學 |
| MATH | 🏆「數學競賽考題」 | 較進階、競賽等級的數學問題解題能力 | 🏆 高難數學 |
| C-Eval | 🇨🇳「中文多科目大會考」 | 中文、多學科、多難度的基礎模型評測 | 🇨🇳 中文多科 |
Massive Multitask Language Understanding
MMLU 是用多項選擇題測試大型語言模型廣泛知識與推理能力的 benchmark,涵蓋 57 個學科/任務,範圍包含 STEM、人文、社會科學與專業領域。citeturn0search4turn0search6
多領域 多任務 多選題🤖:「全部一起來?!」
👉 MMLU 的重點就是廣泛、多領域的語言理解與知識能力。
Grade School Math 8K
GSM8K 是約 8.5K 道高品質、語言多樣的小學/基礎數學文字題,主要用來測試需要多步驟計算的數學問題解答能力;典型題目約需 2~8 個步驟。citeturn0search0turn0search3
文字數學題 基礎算術 多步驟老師:「小明有 3 顆蘋果,再買 5 顆……最後有幾顆?」
👉 不是考 AI 的法律知識,也不是奧林匹克數學,而是看 AI 能不能把生活文字題轉成正確的數學步驟。
Measuring Mathematical Problem Solving
MATH 是包含 12,500 道競賽數學問題的 benchmark,涵蓋代數、幾何、數論、計數與機率、微積分前置等不同主題與難度,並提供逐步解答。citeturn1academia12turn1search1
競賽數學 高難度 數學推理老師:「這次不是 3+5。」
「來解代數、幾何、數論、機率!」
🤖:「等等……這已經是競賽題了!」
👉 MATH 比 GSM8K 更偏向進階、競賽級數學推理。
A Multi-Level Multi-Discipline Chinese Evaluation Suite
C-Eval 是針對 foundation models 的中文、多層級、多學科評測套件,共 13,948 題選擇題,涵蓋 52 個學科與 4 個難度等級。citeturn0search1turn0search8
中文 52 學科 4 難度老師:「國文、歷史、法律、醫學、工程……通通來!」
👉 C-Eval 的重點不是單純「中文聊天」,而是以中文、多學科、多難度的題目評估模型能力。
| 資料集 | 像什麼考試? | 主要領域 | 最重要關鍵字 | 不要搞錯 |
|---|---|---|---|---|
| MMLU | 🌍 綜合大考 | 人文、社科、STEM、專業等 | 多領域、多任務 | 不是專門數學題庫 |
| GSM8K | 🧮 小學數學應用題 | 基礎數學文字題 | 多步驟數學推理 | 不是競賽級數學 |
| MATH | 🏆 數學競賽 | 代數、幾何、數論、機率等 | 進階數學推理 | 不是一般多領域知識 |
| C-Eval | 🇨🇳 中文多科大會考 | 52 個中文學科 | 中文、多學科、多難度 | 不是只考中文語文 |
拿 AI 去回答能源、法律、歷史、電腦科學、經濟等不同領域問題。
👉 想測「廣泛能力」→ MMLU
給 AI 一個「大樓電費+設備數據」的基礎數學應用題,要求多步驟算出答案。
👉 想測「基礎數學推理」→ GSM8K
要求 AI 解代數、幾何、機率等競賽等級數學。
👉 想測「進階數學推理」→ MATH
用中文題目測試不同學科與不同難度的知識。
👉 想測「中文多學科能力」→ C-Eval
⭐ 一秒判斷:
「多領域」→ MMLU
「小學/基礎數學」→ GSM8K
「競賽/高難數學」→ MATH
「中文+多學科」→ C-Eval
A. MMLU
B. GSM8K
C. MATH
D. C-Eval
| 看到題目關鍵字 | 答案 |
|---|---|
| 「多領域、多任務、人文、科學、社會科學」 | 🌍 MMLU |
| 「小學數學、文字題、基本算術、多步驟」 | 🧮 GSM8K |
| 「競賽數學、代數、幾何、數論、高難度」 | 🏆 MATH |
| 「中文、多學科、52 學科、4 難度」 | 🇨🇳 C-Eval |
⭐ 最終口訣:
「MMLU 看廣度,GSM8K 看基礎數學,MATH 看競賽數學,C-Eval 看中文多科。」
資料依 MMLU、GSM8K、MATH、C-Eval 公開資料/論文整理。MMLU 為 57 個學科/任務的多選題 benchmark;GSM8K 約 8.5K 基礎數學文字題;MATH 為 12,500 道競賽數學問題;C-Eval 為 13,948 題、52 學科、4 難度的中文多學科評測。citeturn0search4turn0search0turn1academia12turn0search1