MNBVC liwu

MNBVC: Massive Never-ending BT Vast Chinese corpus

유형
dataset
라이선스
mit
언어
zh
다운로드
103,490
좋아요
650
접근
public
파일
0

태그

  • 사전학습 말뭉치
  • 텍스트 데이터셋
  • 코드 데이터셋
  • 다국어
  • NLP
  • 명령어 미세조정
  • 질문응답
  • 대규모 언어 모델

요약

MNBVC는 MOP 커뮤니티가 운영하는 중국 인터넷 최대 오픈소스 말뭉치 데이터셋으로, LLM 사전학습 및 마스크 언어모델 학습용으로 설계되었습니다. 학술 논문, 코드, 블로그, 서적, 게임 스크립트, 법원 판결문, 포럼 등 다양한 도메인의 중문 텍스트를 포함하며 하위 데이터셋으로 세분화되어 있어 필요에 따라 선택적으로 로딩할 수 있습니다. OpenAI 형식 질문응답 데이터도 포함해 지시 미세조정에도 활용 가능하며, 대규모 중문 LLM 사전학습 파이프라인 구축에 적합합니다.

README

--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…

查看完整页面 · 查看原文