RedPajama-Data-1T togethercomputer
RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.
- 유형
- dataset
- 언어
- en
- 다운로드
- 1,939
- 좋아요
- 1,187
- 접근
- public
- 파일
- 0
태그
- 사전학습 말뭉치
- 대규모 언어 모델
- 텍스트 데이터셋
- 코드 데이터셋
- 딥러닝
- 생성형AI
요약
RedPajama는 LLaMA 논문의 학습 데이터 레시피를 오픈소스로 재현한 대규모 사전학습 말뭉치입니다. CommonCrawl, C4, GitHub, ArXiv, Wikipedia, StackExchange 등 다양한 소스를 포함해 총 1.2조 토큰 규모로 구성되어 있으며, 주로 영어 기반입니다. LLM 사전학습용 데이터로 대규모 언어모델을 직접 학습하려는 연구자와 기업에 적합합니다.
README
--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### 시작하기 데이터셋은 2084개의 jsonl 파일로 구성되어 있습니다. HuggingFace를 사용하여 데이터셋을 다운로드할 수 있습니다: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T") ``` 또는 다음 명령어를 사용하여 파일을 직접 다운로드할 …