MiniMax-Music3 MiniMaxAI

유형
model
태스크
text-to-audio
프레임워크
diffusers
다운로드
5,079
좋아요
771
파라미터 수
2,431,905,920
접근
public
파일
88

태그

  • 음악생성
  • 텍스트-투-오디오
  • 생성형AI
  • diffusers
  • SGLang
  • 하이브리드LLM
  • 오디오생성

요약

MiniMax Music 3는 가사와 상세한 음악 설명을 입력받아 최대 5분 길이의 완성된 곡을 생성하는 텍스트-투-뮤직 모델입니다. 8B 글로벌 LLM과 0.6B 로컬 LLM의 하이브리드 구조, 그리고 Flow Matching과 Flow-VAE 기반의 연속 은닉 상태 합성 시스템을 결합해 장기적인 음악 구조와 음향적 정밀도를 함께 보장합니다. 장르, BPM, 키, 보컬 특성, 악기 편성까지 세밀하게 통제할 수 있는 구조화된 캡션을 지원하며, 32kHz 스테레오 WAV 오디오를 출력합니다. SGLang-Omni, diffusers…

README

--- library_name: diffusers pipeline_tag: text-to-audio tags: - music-generation - text-to-music - pytorch - sglang-omni --- <div align="center"> <img width="100%" src="figures/Music3.png" alt="MiniMax"> </div> <p align="center"> <a href="https://agent.minimax.io/" target="_blank"><img src="https:/…

查看完整页面 · 查看原文