RedPajama-Data-1T togethercomputer

RedPajama is a clean-room, fully open-source implementation of the LLaMa dataset.

Typ
dataset
Sprache
en
Downloads
1,939
Likes
1,187
Zugriff
public
Dateien
0

Tags

  • Vortrainingskorpus
  • Textdaten
  • Große Sprachmodelle
  • Englisch
  • Webdaten
  • Code-Daten
  • Deduplizierung
  • NLP

Zusammenfassung

RedPajama-Data-1T ist ein vollständig quelloffenes Vortrainingskorpus mit rund 1,2 Billionen Tokens, das die LLaMA-Datenrezeptur sauber nachstellt. Es kombiniert CommonCrawl, C4, GitHub, ArXiv, Wikipedia und StackExchange, wobei die englischen Text- und Code-Anteile dominiert werden. Der Datensatz …

README

--- task_categories: - text-generation language: - en pretty_name: Red Pajama 1T --- ### Erste Schritte Das Dataset besteht aus 2084 jsonl-Dateien. Sie können das Dataset mit HuggingFace herunterladen: ```python from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T…

查看完整页面 · 查看原文