blogpost-fineweb-v1 HuggingFaceFW

Tipo
space
Me gusta
1,407
Acceso
public
Archivos
0

Etiquetas

  • web
  • preentrenamiento de LLM
  • distilación de datos
  • corpus de texto
  • LLM
  • NLP
  • documentación
  • texto web

Resumen

Este Space es el blogpost oficial de HuggingFaceFW que presenta FineWeb, un dataset a gran escala de datos textuales extraídos y filtrados de la web para el preentrenamiento de LLM. Documenta el proceso de destilación, filtrado y curado de datos para obtener texto de máxima calidad. Es una referenc…

README

--- title: 'FineWeb: decantando la web para obtener los mejores datos de texto a escala' emoji: 🍷 colorFrom: rosa colorTo: rojo sdk: estático pinned: falso header: mini app_file: dist/index.html thumbnail: https://huggingface.co/spaces/HuggingFaceFW/blogpost-fineweb-v1/resolve/main/screenshot.jpeg…

查看完整页面 · 查看原文