MNBVC liwu
MNBVC: Massive Never-ending BT Vast Chinese corpus
- Tipo
- dataset
- Licencia
- mit
- Lenguaje
- zh
- Descargas
- 103,490
- Me gusta
- 650
- Acceso
- public
- Archivos
- 0
Etiquetas
- corpus de texto
- preentrenamiento de LLM
- texto web
- NLP
- multilingüe
- datos de código
Resumen
MNBVC es un corpus de texto chino a gran escala y de actualización continua, diseñado para el preentrenamiento de grandes modelos de lenguaje. Reúne decenas de subconjuntos provenientes de blogs, libros, código, foros, juegos, textos académicos y legal, con soporte de carga por streaming. Es ideal …
README
--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…