首頁教材庫 / 模型評測基準 / MMLU vs GSM8K vs MATH vs C-Eval

iPAS AI初級 模型評測基準 ⏱ 約 5 分鐘讀完
iPAS AI 初級・漫畫式小白教材

LLM 評測資料集四兄弟

MMLU × GSM8K × MATH × C-Eval:到底各自拿來考 AI 什麼?

🎬 第一幕:AI 期末考來了!

👨‍🏫 老師 ①
「我什麼都考!」
📚

歷史、法律、科學、人文……

→ MMLU
👨‍🏫 老師 ②③
「今天只考數學!」
➗🧮

小學數學 vs 競賽數學

→ GSM8K / MATH
👨‍🏫 老師 ④
「用中文、考各種學科!」
🇹🇼📖

中文多學科知識

→ C-Eval

🧠 先用一句話分清楚

資料集白話主要測什麼?記憶法
MMLU🌍「什麼都考一點」多領域、多任務的廣泛知識與理解🌍 廣度
GSM8K🧮「小學數學應用題」基礎數學文字題與多步驟推理🧮 基礎數學
MATH🏆「數學競賽考題」較進階、競賽等級的數學問題解題能力🏆 高難數學
C-Eval🇨🇳「中文多科目大會考」中文、多學科、多難度的基礎模型評測🇨🇳 中文多科

🌍 第二幕:MMLU——AI 的「綜合能力大學聯考」

📚 MMLU

Massive Multitask Language Understanding

MMLU 是用多項選擇題測試大型語言模型廣泛知識與推理能力的 benchmark,涵蓋 57 個學科/任務,範圍包含 STEM、人文、社會科學與專業領域。citeturn0search4turn0search6

多領域 多任務 多選題

🎭 漫畫情境

老師:「歷史會嗎?」
「法律呢?」
「電腦科學呢?」

🤖:「全部一起來?!」

👉 MMLU 的重點就是廣泛、多領域的語言理解與知識能力

🧮 第三幕:GSM8K——AI 的「小學數學應用題老師」

📐 GSM8K

Grade School Math 8K

GSM8K 是約 8.5K 道高品質、語言多樣的小學/基礎數學文字題,主要用來測試需要多步驟計算的數學問題解答能力;典型題目約需 2~8 個步驟。citeturn0search0turn0search3

文字數學題 基礎算術 多步驟

🍎 漫畫情境

🍎 ➕ 🍎 ➕ 🍎

老師:「小明有 3 顆蘋果,再買 5 顆……最後有幾顆?」

👉 不是考 AI 的法律知識,也不是奧林匹克數學,而是看 AI 能不能把生活文字題轉成正確的數學步驟

🏆 第四幕:MATH——AI 的「數學競賽地獄關」

📚 MATH

Measuring Mathematical Problem Solving

MATH 是包含 12,500 道競賽數學問題的 benchmark,涵蓋代數、幾何、數論、計數與機率、微積分前置等不同主題與難度,並提供逐步解答。citeturn1academia12turn1search1

競賽數學 高難度 數學推理

🎭 漫畫情境

🏆🧮🔥

老師:「這次不是 3+5。」

「來解代數、幾何、數論、機率!」

🤖:「等等……這已經是競賽題了!」

👉 MATH 比 GSM8K 更偏向進階、競賽級數學推理

🇨🇳 第五幕:C-Eval——中文世界的「多科大會考」

📖 C-Eval

A Multi-Level Multi-Discipline Chinese Evaluation Suite

C-Eval 是針對 foundation models 的中文、多層級、多學科評測套件,共 13,948 題選擇題,涵蓋 52 個學科與 4 個難度等級。citeturn0search1turn0search8

中文 52 學科 4 難度

🎭 漫畫情境

🇹🇼📚🧑‍🏫

老師:「國文、歷史、法律、醫學、工程……通通來!」

👉 C-Eval 的重點不是單純「中文聊天」,而是以中文、多學科、多難度的題目評估模型能力

🥊 第六幕:四個資料集正面對決

資料集像什麼考試?主要領域最重要關鍵字不要搞錯
MMLU🌍 綜合大考人文、社科、STEM、專業等多領域、多任務不是專門數學題庫
GSM8K🧮 小學數學應用題基礎數學文字題多步驟數學推理不是競賽級數學
MATH🏆 數學競賽代數、幾何、數論、機率等進階數學推理不是一般多領域知識
C-Eval🇨🇳 中文多科大會考52 個中文學科中文、多學科、多難度不是只考中文語文

🏢 第七幕:套進你熟悉的「能源管理 AI」

情境 ①「AI 懂不懂各領域?」

拿 AI 去回答能源、法律、歷史、電腦科學、經濟等不同領域問題。

👉 想測「廣泛能力」→ MMLU

情境 ②「AI 會不會算?」

給 AI 一個「大樓電費+設備數據」的基礎數學應用題,要求多步驟算出答案。

👉 想測「基礎數學推理」→ GSM8K

情境 ③「AI 能不能解難題?」

要求 AI 解代數、幾何、機率等競賽等級數學。

👉 想測「進階數學推理」→ MATH

情境 ④「AI 懂不懂中文專業知識?」

用中文題目測試不同學科與不同難度的知識。

👉 想測「中文多學科能力」→ C-Eval

🧠 iPAS 考前超強記憶法

🌍 MMLU=「什麼都考」
🧮 GSM8K=「基礎數學應用題」
🏆 MATH=「競賽數學」
🇨🇳 C-Eval=「中文多學科」

⭐ 一秒判斷:
「多領域」→ MMLU
「小學/基礎數學」→ GSM8K
「競賽/高難數學」→ MATH
「中文+多學科」→ C-Eval

🎯 最後來做你給的這一題!

題目:
下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專用於數學推理或中文專業知識?

A. MMLU
B. GSM8K
C. MATH
D. C-Eval

🎯 正確答案:A. MMLU

🔍 題目看到「多領域、多任務」+「人文、科學、社會科學」, 就要想到 MMLU。

❌ GSM8K → 數學文字題
❌ MATH → 競賽數學推理
❌ C-Eval → 中文、多學科評測
✅ MMLU → 廣泛、多領域、多任務的知識與理解評測。citeturn0search4turn0search6
⭐ 「MMLU=Many Many Learning?記成『什麼都考』!」
🌍 廣度 → MMLU | 🧮 數學 → GSM8K/MATH | 🇨🇳 中文多科 → C-Eval

📌 考前最後一張小抄

看到題目關鍵字答案
「多領域、多任務、人文、科學、社會科學」🌍 MMLU
「小學數學、文字題、基本算術、多步驟」🧮 GSM8K
「競賽數學、代數、幾何、數論、高難度」🏆 MATH
「中文、多學科、52 學科、4 難度」🇨🇳 C-Eval

⭐ 最終口訣:
「MMLU 看廣度,GSM8K 看基礎數學,MATH 看競賽數學,C-Eval 看中文多科。」

資料依 MMLU、GSM8K、MATH、C-Eval 公開資料/論文整理。MMLU 為 57 個學科/任務的多選題 benchmark;GSM8K 約 8.5K 基礎數學文字題;MATH 為 12,500 道競賽數學問題;C-Eval 為 13,948 題、52 學科、4 難度的中文多學科評測。citeturn0search4turn0search0turn1academia12turn0search1