MMLU-Pro TIGER-Lab
MMLU-Pro Dataset MMLU-Pro dataset is a more robust and challenging massive multi-task understanding dataset tailored to more rigorously benchmark large language models' capabilities. This dataset contains 12K complex questions across various disciplines. |Github | 🏆Leaderboard | 📖Paper | 🚀 What's New [2026.03.11] Added more cutting-edge frontier models to the leaderboard, including the Claude-4.6 series, Seed2.0 series, Qwen3.5 series, and Gemini-3.1-Pro… See the full description on the dataset page: https://huggingface.co/datasets/TIGER-Lab/MMLU-Pro.
- 種別
- dataset
- ライセンス
- mit
- 言語
- en
- ダウンロード
- 173,193
- いいね
- 511
- アクセス
- public
- ファイル
- 0
タグ
- 評価データ
- 質問応答
- 多肢選択
- ベンチマーク
- モデル評価
- 大言語モデル
- 英語テキストデータ
- テキストデータセット
概要
MMLU-Proは、大規模言語モデル(LLM)の能力をより厳密に評価するための多肢選択式質問データセットです。元のMMLUと比べて選択肢を4つから10に増やし、推論重視の問題を多数収録することで、偶然の正答率を下げ評価の頑健性を高めています。数学・物理・化学・法律・経済など14分野を網羅する約1万2千問から構成され、CoT(思考連鎖)による性能差が明確に出る設計です。LLMベンチマークやモデル評価に広く利用されています。
README
--- language: - en license: mit size_categories: - 10K<n<100K task_categories: - question-answering pretty_name: MMLU-Pro tags: - evaluation configs: - config_name: default data_files: - split: test path: data/test-* - split: validation path: data/validation-* dataset_info: features: - name: questi…