wikitext Salesforce

Dataset Card for "wikitext" Dataset Summary The WikiText language modeling dataset is a collection of over 100 million tokens extracted from the set of verified Good and Featured articles on Wikipedia. The dataset is available under the Creative Commons Attribution-ShareAlike License. Compared to the preprocessed version of Penn Treebank (PTB), WikiText-2 is over 2 times larger and WikiText-103 is over 110 times larger. The WikiText dataset also features a far… See the full description on the dataset page: https://huggingface.co/datasets/Salesforce/wikitext.

Typ
dataset
Lizenz
cc-by-sa-3.0
Sprache
en
Downloads
1,498,204
Likes
758
Zugriff
public
Dateien
0

Tags

  • 预训练语料
  • 文本生成
  • 掩码语言建模
  • NLP
  • 大语言模型
  • 英语模型
  • 深度学习

Zusammenfassung

WikiText ist ein klassischer englischer Sprachmodellierungs-Datensatz, der aus verifizierten Wikipedia-Artikeln mit über 100 Millionen Tokens extrahiert wurde. Er dient als Standard-Benchmark zur Bewertung von Sprachmodellen, insbesondere für Modelle mit langen Kontextabhängigkeiten. WikiText-2 und…

README

--- annotations_creators: - no-annotation language_creators: - crowdsourced language: - en license: - cc-by-sa-3.0 - gfdl multilinguality: - monolingual size_categories: - 1M<n<10M source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-lang…

查看完整页面 · 查看原文