MiniMax-Music3 MiniMaxAI

種別
model
タスク
text-to-audio
フレームワーク
diffusers
ダウンロード
5,079
いいね
771
パラメータ
2,431,905,920
アクセス
public
ファイル
88

タグ

  • 音声生成
  • 音楽生成
  • 大言語モデル
  • 拡散モデル
  • diffusers
  • 生成AI
  • テキストから音声
  • SGLang

概要

MiniMax Music 3は、歌詞と詳細な音楽説明を入力として、最長5分の構造的に一貫した完全な楽曲を生成する音楽生成モデルです。8BのグローバルLLMと0.6BのローカルLLMを組み合わせたハイブリッドアーキテクチャを採用し、Flow MatchingとFlow-VAEによる連続隠れ状態合成で、32kHzのステレオWAV音声を出力します。ジャンル、テンポ、ボーカル、編曲などの細かな音楽制御が可能で、SGLang-Omni、diffusers、ComfyUIなどで推論できます。

README

--- library_name: diffusers pipeline_tag: text-to-audio tags: - music-generation - text-to-music - pytorch - sglang-omni --- <div align="center"> <img width="100%" src="figures/Music3.png" alt="MiniMax"> </div> <p align="center"> <a href="https://agent.minimax.io/" target="_blank"><img src="https:/…

查看完整页面 · 查看原文