RedPajama-Data-1T togethercomputer

RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.

유형
dataset
언어
en
다운로드
1,939
좋아요
1,187
접근
public
파일
0

태그

  • 사전학습 말뭉치
  • 대규모 언어 모델
  • 텍스트 데이터셋
  • 코드 데이터셋
  • 딥러닝
  • 생성형AI

요약

RedPajama는 LLaMA 논문의 학습 데이터 레시피를 오픈소스로 재현한 대규모 사전학습 말뭉치입니다. CommonCrawl, C4, GitHub, ArXiv, Wikipedia, StackExchange 등 다양한 소스를 포함해 총 1.2조 토큰 규모로 구성되어 있으며, 주로 영어 기반입니다. LLM 사전학습용 데이터로 대규모 언어모델을 직접 학습하려는 연구자와 기업에 적합합니다.

README

--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### 시작하기 데이터셋은 2084개의 jsonl 파일로 구성되어 있습니다. HuggingFace를 사용하여 데이터셋을 다운로드할 수 있습니다: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T") ``` 또는 다음 명령어를 사용하여 파일을 직접 다운로드할 …

查看完整页面 · 查看原文