FineVision HuggingFaceM4

Fine Vision FineVision is a massive collection of datasets with 17.3M images, 24.3M samples, 88.9M turns, and 9.5B answer tokens, designed for training state-of-the-art open Vision-Language-Models. More detail can be found in the blog post: https://huggingface.co/spaces/HuggingFaceM4/FineVision Load the data from datasets import load_dataset, get_dataset_config_names # Get all subset names and load the first one available_subsets =… See the full description on the dataset page: https://huggingface.co/datasets/HuggingFaceM4/FineVision.

Tipo
dataset
Descargas
112,161
Me gusta
512
Acceso
public
Archivos
0

Etiquetas

  • dataset multimodal
  • visión lenguaje
  • instrucciones
  • ajuste fino supervisado
  • VQA
  • dataset de imágenes
  • multimodal
  • razonamiento

Resumen

FineVision es un enorme dataset multimodal con 17,3M de imágenes, 24,3M de muestras, 88,9M de turnos y 9,5B de tokens de respuesta, diseñado para entrenar modelos de visión-lenguaje (VLM) de vanguardia. Cubre dominios diversos como gráficos, diagramas, matemáticas, documentos, tablas, química, circ…

README

--- dataset_info: - config_name: CoSyn_400k_chart features: - name: images list: image - name: texts list: - name: user dtype: string - name: assistant dtype: string - name: source dtype: string - name: relevance_ratings list: int64 - name: relevance_min dtype: int64 - name: visual_dependency_ratin…

查看完整页面 · 查看原文