clap-htsat-fused laion

类型
model
任务
audio-classification
框架
transformers
下载量
7,313,887
点赞
125
访问
public
文件
0

标签

  • 多模态
  • 零样本学习
  • 音频分类
  • 语义检索
  • 音频数据处理
  • transformers
  • 语音
  • 对比学习

摘要

CLAP是一个对比语言-音频预训练模型,通过将音频数据与自然语言描述对齐来学习音频表示,训练于63万条音频-文本对的LAION-Audio-630K数据集。该模型融合了音频编码器与文本编码器,并引入特征融合和关键词到描述增强机制,能处理可变长度音频输入。主要适用于文本到音频检索、零样本音频分类及有监督音频分类等任务。

README

--- license: apache-2.0 language: - en pipeline_tag: audio-classification tags: - zero-shot audio classification - zero-shot audio retrieval --- # CLAP 模型卡 CLAP 模型卡:对比式语言-音频预训练 # 数据集 LAION-CLAP 在 [LAION-audio-630k](https://github.com/LAION-AI/audio-dataset/blob/main/laion-audio-630k/README.md) 上进行训…

查看完整页面 · 查看原文