MMMLU openai
Multilingual Massive Multitask Language Understanding (MMMLU) The MMLU is a widely recognized benchmark of general knowledge attained by AI models. It covers a broad range of topics from 57 different categories, covering elementary-level knowledge up to advanced professional subjects like law, physics, history, and computer science. We translated the MMLU’s test set into 14 languages using professional human translators. Relying on human translators for this evaluation increases… See the full description on the dataset page: https://huggingface.co/datasets/openai/MMMLU.
- 유형
- dataset
- 라이선스
- mit
- 언어
- ar
- 다운로드
- 11,123
- 좋아요
- 523
- 접근
- public
- 파일
- 0
태그
- 벤치마크
- 다국어
- 모델 평가
- 평가 리더보드
- 질문응답
- 텍스트 분류
- 대규모 언어 모델
요약
MMMLU는 AI 모델의 일반 지식을 평가하는 널리 알려진 MMLU 벤치마크 테스트셋을 전문 번역가를 통해 14개 언어(아랍어, 벵골어, 한국어, 중국어 등)로 번역한 다국어 평가 데이터셋입니다. 57개 다양한 카테고리의 일반 상식부터 법학, 물리학, 컴퓨터 과학 같은 고급 전문 지식까지 포괄하며, 특히 저자원 언어(요루바어 등)의 번역 정확도를 높이는 데 중점을 둡니다. 다국어 모델의 성능을 언어별로 검증하고자 하는 연구자와 평가용으로 적합합니다.
README
--- task_categories: - question-answering configs: - config_name: default data_files: - split: test path: test/*.csv - config_name: AR_XY data_files: - split: test path: test/mmlu_AR-XY.csv - config_name: BN_BD data_files: - split: test path: test/mmlu_BN-BD.csv - config_name: DE_DE data_files: - s…