Musik
Beschreiben Sie die Musik, die Sie brauchen, und bekommen Sie ein fertiges Stück, bis zu sechs Minuten und zwanzig Sekunden lang. Das sind keine Loops oder zusammenzusetzende Fragmente: es ist ein Stück mit Anfang und Ende.
Es ist für alle gedacht, die Hintergrundmusik mit einer klaren Lizenz brauchen — ein Video, ein Podcast, eine Präsentation, ein Wartezimmer — und nicht mit einem Stock-Katalog oder den Rechten eines anderen ringen wollen.
Die Ausgabe ist 48 kHz Stereo WAV. Das Modell erzeugt mit 44,1 kHz und wir tasten vor der Auslieferung auf 48 hoch; das Hochtasten verliert nichts von dem, was das Modell gemacht hat.
Länge und Qualität
Es gibt zwei Regler, und beide verändern, was es kostet. Das ist der wichtige Unterschied zu Klänge, wo ein Clip dasselbe kostet, egal wie lange er läuft.
Länge. Von 10 Sekunden bis 6 Min. 20 s. Das Stück wird als Ganzes für die angeforderte Länge gebaut: ein dreiminütiges Stück ist kein sechsmal wiederholtes Dreißig-Sekunden-Stück.
Qualität. Das ist die Zahl der Schritte, die die Engine nimmt, von 32 bis 128. Mehr Schritte bedeuten mehr rhythmische Kohärenz und mehr Struktur, nicht mehr Audio- treue: die Bandbreite ist bei 32 dieselbe wie bei 128, gemessen.
Und ein dritter Regler, der nichts kostet: der Seed. Dieselbe Beschreibung mit demselben Seed ergibt dasselbe Stück. Wenn Ihnen eines gefällt und Sie darauf zurückkommen möchten, behalten Sie die Zahl.
Über die API
Eine Route. Erfordert einen kostenpflichtigen Tarif, ab Startup aufwärts.
POST /v1/audio/music — JSON-Body, gibt das WAV zurück.
| Feld | Typ | Was es ist |
|---|---|---|
prompt | string | Erforderlich. Welche Musik Sie möchten. Den Stil, die Instrumente und die BPM zu nennen hilft viel. |
seconds | number | Länge, 1 bis 380. Standardwert 60. |
steps | integer | Schritte, 32 bis 128. Standardwert 32. |
seed | integer | Derselbe Seed mit derselben Beschreibung ergibt dasselbe Stück. Wenn Sie keinen senden, wählt die Engine einen und gibt ihn Ihnen zurück. |
negative_prompt | string | Was Sie NICHT möchten — «vocals», «drums» —. Es zu senden schaltet Guidance ein; es wegzulassen tut das nicht. |
translate | boolean | true
übersetzt Ihre Beschreibung vor dem Erzeugen ins Englische. |
Die Antwort trägt diese Header:
| Header | Was er sagt |
|---|---|
X-Seed | Der tatsächlich verwendete Seed. Wenn Sie keinen gesendet haben, ist dies der einzige Weg, das Stück zu wiederholen. |
X-Steps | Angewandte Schritte. |
X-Audio-Seconds | Ausgelieferte Sekunden Audio. |
X-Generations | Wie viele Erzeugungen ausgeführt wurden. |
X-Watermark | Welches Wasserzeichen es trägt. |
X-Translated | 1, wenn Ihr Text
übersetzt wurde. |
Grenzen und Kosten
Die Obergrenze sind 380 Sekunden. Darüber hinaus ist es nicht so, dass es fehlschlägt: das Modell kann es nicht, und wir sagen das lieber, als still etwas Schlechteres auszuliefern.
Berechnet nach Länge und nach Qualität
Anders als bei Klänge hängen die Kosten hier von beidem ab, weil es auch die Arbeit der Engine tut:
credits = 0.333 + seconds × steps × 0.001167 + seconds × 0.02184
Der letzte Term ist das Wasserzeichen. Ab etwa zwei Minuten kostet das Wasserzeichen mehr als das Erzeugen: das ist kein Rechenfehler, es liegt daran, dass die Engine sehr schnell ist und das Wasserzeichen mit der Länge skaliert.
Ein einminütiges Stück bei 32 Schritten kostet etwa 3,9 Credits. Dasselbe bei 128 Schritten etwa 11. Die Anwendung zeigt Ihnen die Zahl bevor Sie erzeugen, gerade damit das Bewegen eines Reglers nie eine Überraschung ist.