MiniMax veröffentlicht Music 3 auf Hugging Face für komplette Songs bis fünf Minuten

MiniMax veröffentlicht Music 3 auf Hugging Face für komplette Songs bis fünf Minuten
Illustrationen erstellt mit KI-Bildgenerierung

MiniMax hat sein Musikmodell Music 3 auf Hugging Face veröffentlicht. Das Modell zielt auf vollständige Songs mit Gesang und Arrangement und ist für längere, zusammenhängende Musikstücke ausgelegt.

Auf der Modellseite bei Hugging Face beschreibt MiniMax Music 3 als „high-performance music generation model“ für „complete songs up to five minutes long“. Verarbeitet werden Liedtexte und eine detaillierte Musikbeschreibung. Laut der dort verlinkten Beschreibung erzeugt das System „32 kHz, 16-bit stereo WAV audio“ mit „expressive vocals“ und „stable long-form audio quality“.

Zwei Sprachmodelle für globale und lokale Ebene

Laut Modellbeschreibung trennt die Architektur langfristige Songstruktur und lokale akustische Details. Ein „8B Global LLM“ modelliert die übergreifende musikalische Entwicklung, während ein „0.6B Local LLM“ „frame-level acoustic detail“ ergänzt. Der globale Teil wurde laut Modellkarte von „Qwen3-8B“ initialisiert.

Music 3 unterstützt außerdem strukturierte Songtexte mit Tags für typische Abschnitte wie „Intro“, „Verse“, „Pre-Chorus“, „Chorus“, „Bridge“ und „Outro“. Für die Steuerung empfiehlt MiniMax eine „Structured Caption“ mit drei Bereichen: „Global Metadata“, „Vocal Details“ und „Arrangement“. Darüber lassen sich unter anderem Genre, BPM, Tonart, Stimmcharakter, Instrumentierung und Produktionsstil festlegen.

Kontinuierliche Hidden-State-Synthese

Für die Audiogenerierung setzt MiniMax nach eigener Beschreibung nicht nur auf diskrete RVQ-Tokens. Stattdessen nutzt Music 3 „a continuous hidden-state synthesis system based on Flow Matching and Flow-VAE“. Damit kombiniert das Modell die finalen Hidden States der beiden Sprachmodelle zu einer kontinuierlichen Audiosynthese. Die Ausgabe erfolgt als Stereo-Audio mit 32 kHz.

Auf Hugging Face ist das Modell zudem mit Tags wie „text-to-audio“, „music-generation“, „text-to-music“, „Diffusers“, „Safetensors“ und „PyTorch“ versehen.

Dieser Artikel wurde KI-generiert erstellt. Die Themenauswahl trifft die Redaktion, die redaktionelle Verantwortung liegt bei KI-Prüfstand.