MiniMax-H3 MiniMaxAI

类型
model
许可
other
任务
image-text-to-video
框架
minimax-h3
下载量
2,212,155
点赞
3,978
参数量
33,122,992,896
访问
public
文件
280

标签

  • 文生视频
  • 图像生成
  • 多模态
  • 音视频生成
  • 视频生成
  • 视觉模型
  • 生成式AI
  • diffusers

摘要

MiniMax H3是一款通用全能多模态生成系统,支持统一理解文本、图像、视频和音频的多模态上下文,并能原生生成带32kHz立体声音频的视频,最高支持2K分辨率和15秒时长。系统包含三个模块:H3-Context-IR(多模态指令理解预处理)、H3-Base(768p分辨率生成)和H3-Regenerate-2K(高清重生成)。它支持文生视频、图生视频、首末帧生视频、参考视频/音频多模态输入等多种模式,适合内容创作、影视制作等需要高质量音视频同步生成的场景。

README

--- pipeline_tag: image-text-to-video license: other license_name: minimax-h3-community-license-agreement license_link: LICENSE library_name: minimax-h3 tags: - text-to-video - image-to-video - image-text-to-video - video-to-video - text-to-audio-video - image-to-audio-video - image-text-to-audio-v…

查看完整页面 · 查看原文