MNBVC liwu
MNBVC: Massive Never-ending BT Vast Chinese corpus
- 유형
- dataset
- 라이선스
- mit
- 언어
- zh
- 다운로드
- 103,490
- 좋아요
- 650
- 접근
- public
- 파일
- 0
태그
- 사전학습 말뭉치
- 텍스트 데이터셋
- 코드 데이터셋
- 다국어
- NLP
- 명령어 미세조정
- 질문응답
- 대규모 언어 모델
요약
MNBVC는 MOP 커뮤니티가 운영하는 중국 인터넷 최대 오픈소스 말뭉치 데이터셋으로, LLM 사전학습 및 마스크 언어모델 학습용으로 설계되었습니다. 학술 논문, 코드, 블로그, 서적, 게임 스크립트, 법원 판결문, 포럼 등 다양한 도메인의 중문 텍스트를 포함하며 하위 데이터셋으로 세분화되어 있어 필요에 따라 선택적으로 로딩할 수 있습니다. OpenAI 형식 질문응답 데이터도 포함해 지시 미세조정에도 활용 가능하며, 대규모 중문 LLM 사전학습 파이프라인 구축에 적합합니다.
README
--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…