MMLU-Pro TIGER-Lab

MMLU-Pro Dataset MMLU-Pro dataset is a more robust and challenging massive multi-task understanding dataset tailored to more rigorously benchmark large language models' capabilities. This dataset contains 12K complex questions across various disciplines. |Github | 🏆Leaderboard | 📖Paper | 🚀 What's New [2026.03.11] Added more cutting-edge frontier models to the leaderboard, including the Claude-4.6 series, Seed2.0 series, Qwen3.5 series, and Gemini-3.1-Pro… See the full description on the dataset page: https://huggingface.co/datasets/TIGER-Lab/MMLU-Pro.

種別
dataset
ライセンス
mit
言語
en
ダウンロード
173,193
いいね
511
アクセス
public
ファイル
0

タグ

  • 評価データ
  • 質問応答
  • 多肢選択
  • ベンチマーク
  • モデル評価
  • 大言語モデル
  • 英語テキストデータ
  • テキストデータセット

概要

MMLU-Proは、大規模言語モデル(LLM)の能力をより厳密に評価するための多肢選択式質問データセットです。元のMMLUと比べて選択肢を4つから10に増やし、推論重視の問題を多数収録することで、偶然の正答率を下げ評価の頑健性を高めています。数学・物理・化学・法律・経済など14分野を網羅する約1万2千問から構成され、CoT(思考連鎖)による性能差が明確に出る設計です。LLMベンチマークやモデル評価に広く利用されています。

README

--- language: - en license: mit size_categories: - 10K<n<100K task_categories: - question-answering pretty_name: MMLU-Pro tags: - evaluation configs: - config_name: default data_files: - split: test path: data/test-* - split: validation path: data/validation-* dataset_info: features: - name: questi…

查看完整页面 · 查看原文