MNBVC liwu

MNBVC: Massive Never-ending BT Vast Chinese corpus

Tipo
dataset
Licencia
mit
Lenguaje
zh
Descargas
103,490
Me gusta
650
Acceso
public
Archivos
0

Etiquetas

  • corpus de texto
  • preentrenamiento de LLM
  • texto web
  • NLP
  • multilingüe
  • datos de código

Resumen

MNBVC es un corpus de texto chino a gran escala y de actualización continua, diseñado para el preentrenamiento de grandes modelos de lenguaje. Reúne decenas de subconjuntos provenientes de blogs, libros, código, foros, juegos, textos académicos y legal, con soporte de carga por streaming. Es ideal …

README

--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…

查看完整页面 · 查看原文