monet jasperai

Dataset Card for MONET MONET (Massive, Open, Non-redundant and Enriched Text-to-image dataset) is a large-scale, curated image-text dataset designed for training text-to-image (T2I) systems. It contains 103.8 million high-quality image-text pairs distilled from 2.9 billion raw pairs across nine heterogeneous open sources (6 real and 3 synthetic) through successive stages of safety filtering, domain-based filtering, exact and near-duplicate removal, and re-captioning with… See the full description on the dataset page: https://huggingface.co/datasets/jasperai/monet.

类型
dataset
许可
apache-2.0
语言
en
下载量
184,360
点赞
149
访问
public
文件
0

标签

  • 多模态数据集
  • 文生图
  • 图像数据集
  • 图像特征提取
  • 合成数据
  • 数据处理
  • 计算机视觉
  • 零样本学习

摘要

MONET是面向文生图(T2I)训练的大规模图文数据集,包含1.038亿个高质量图文对,从29亿原始数据中经过安全过滤、去重和多重重标注蒸馏而来。每个图像附带CLIP/DINOv2/SSCD预计算嵌入、结构化标注和预编码VAE潜空间,供下游直接使用。适用于文生图预训练、图像检索和零样本图像分类等任务,可降低大规模可复现文生图研究的门槛。

README

--- license: apache-2.0 pretty_name: MONET task_categories: - text-to-image - image-feature-extraction - zero-shot-image-classification language: - en size_categories: - 100M<n<1B tags: - text-to-image - image-text - multimodal - captioning - synthetic-data configs: - config_name: parquet data_file…

查看完整页面 · 查看原文