← 返回知識庫刷題首頁
P1 · 應會

生成式 AI

大型語言模型評測基準 (LLM Benchmarks)

是什麼

用固定的題目集比較語言模型能力的標準測驗,例如 MMLU(數十個學科的多任務理解)、GSM8K(小學數學應用題)、MATH(競賽數學)、C-Eval(中文多學科知識)。

解決什麼問題

依想評估的能力選擇評測集,並知道成績不只受模型規模影響,也受訓練資料品質與資源配置影響。

考場 Trigger

  • 多領域、多任務語言理解 → MMLU
  • 數學推理 → GSM8K、MATH
  • 中文專業知識 → C-Eval

容易搞混

生成式 AI 原理、部署與效能AI 產品與系統評測

初級深度

能把常見評測集對應到它測的能力(MMLU 多學科、GSM8K 與 MATH 數學、C-Eval 中文)。

Official Evidence

官方題目正在怎麼考

2 官方題3 考綱節點