MMLU-Pro TIGER-Lab
MMLU-Pro Dataset MMLU-Pro dataset is a more robust and challenging massive multi-task understanding dataset tailored to more rigorously benchmark large language models' capabilities. This dataset contains 12K complex questions across various disciplines. |Github | 🏆Leaderboard | 📖Paper | 🚀 What's New [2026.03.11] Added more cutting-edge frontier models to the leaderboard, including the Claude-4.6 series, Seed2.0 series, Qwen3.5 series, and Gemini-3.1-Pro… See the full description on the dataset page: https://huggingface.co/datasets/TIGER-Lab/MMLU-Pro.
- 类型
- dataset
- 许可
- mit
- 语言
- en
- 下载量
- 173,193
- 点赞
- 511
- 访问
- public
- 文件
- 0
标签
- 评测基准
- 问答
- 大语言模型
- 数学推理
- NLP
- 零样本学习
摘要
MMLU-Pro 是面向大语言模型的多任务理解评测数据集,包含1.2万道跨学科复杂选择题,相比原版 MMLU 将选项从4个扩展至10个并融入更多推理型题目。该数据集通过提高干扰项数量增强评测鲁棒性,降低随机猜测概率和提示词敏感性,用于严格评估 LLM 的综合理解与推理能力,支持人工评审与持续修正。
README
--- language: - en license: mit size_categories: - 10K<n<100K task_categories: - question-answering pretty_name: MMLU-Pro tags: - evaluation configs: - config_name: default data_files: - split: test path: data/test-* - split: validation path: data/validation-* dataset_info: features: - name: questi…