UtteraUttera

Klänge

Beschreiben Sie einen Klang und Sie bekommen einen Clip. Beschreiben Sie eine ganze Szene und Sie bekommen sie in zeitlich angeordnete Ereignisse aufgeteilt, die Sie vor dem Erzeugen korrigieren können, und die dann gemischt werden.

Es ist für Menschen gebaut, die Video schneiden: was ihnen fehlt, ist keine Zeitleiste — die haben sie schon — sondern der konkrete Klang. Deshalb liefert dies Clips zurück, keine Projekte.

Die Ausgabe ist 48 kHz Stereo WAV, die Rate, mit der Video arbeitet. Das Modell erzeugt mit 44,1 kHz und wir tasten auf 48 hoch, bevor wir es übergeben; das Hochtasten verliert nichts von dem, was das Modell gemacht hat.

Alles Audio ist mit einem Wasserzeichen versehen. Es trägt ein unhörbares Wasserzeichen, das es als maschinell erzeugt kennzeichnet. Es ist durch Artikel 50 Absatz 2 der EU-KI-Verordnung vorgeschrieben und kann nicht abgeschaltet werden, weder über die API noch aus dem Studio. Das Zeichen übersteht Komprimierung und einen Telefonanruf.
Powered by Stability AI. Klang wird mit Stable Audio Open von Stability AI erzeugt, nur mit gemeinfreiem und frei lizenziertem Audio trainiert, außer wo ausdrücklich anders angegeben. Was Sie erzeugen, ist Ihres, in dem Umfang, der in der Nutzungslizenz Ihres Tarifs festgelegt ist.

Eine Szene

Eine Szene braucht zwei Schritte, und der mittlere ist bewusst bearbeitbar:

  1. Der Plan. Sie beschreiben die Szene in einfacher Sprache — „ein Motorrad hält nach acht Sekunden an, der Fahrer steigt ab und geht zum Meer" — und ein Sprachmodell teilt sie in Ereignisse mit Startzeit und Länge auf. Hier wird kein Audio erzeugt.
  2. Die Erzeugung. Mit dem nach Ihrem Wunsch festgelegten Plan wird jedes Ereignis erzeugt und alle werden gemischt, unter Wahrung der Zeiten.

Zwei Schritte und nicht einer, weil sechs Ereignisse sechs Erzeugungen sind: sie für einen Plan auszugeben, der nicht das war, was Sie meinten, heißt sie wegzuwerfen. Und den Plan zu sehen zeigt, wie das Werkzeug denkt, was die halbe Miete beim Erlernen der Nutzung ist.

Ereignisse können sich überlappen, und das sollten sie: eine Hintergrundatmosphäre, die die ganze Szene über läuft, mit den Treffern obendrauf, klingt wie eine Szene; Clips, Ende an Ende geklebt, klingen wie eine Liste von Clips.

Über die API

Drei Routen. Alle brauchen einen kostenpflichtigen Tarif.

Ein Klang

POST /v1/audio/sfx — JSON-Body, gibt das WAV zurück.

FeldTypWas es ist
prompttextErforderlich. Der Klang, den Sie möchten. Das Modell versteht Englisch weit besser als andere Sprachen.
secondsnumberLänge, 1 bis 30. Standardwert 10.
seedintegerDerselbe Seed mit derselben Beschreibung ergibt denselben Klang. Wenn Sie ihn weglassen, wählt die Engine einen und gibt ihn Ihnen zurück.
guidancenumberWie eng es sich an die Beschreibung hält, 1 bis 15. Standardwert 7. Niedrig (1-3) nimmt sich Freiheiten und klingt natürlicher; hoch (10-15) ist wörtlich, aber schroffer. Es wird auf dem Server begrenzt: eine 40 ergibt keinen „sehr wörtlichen" Klang, sie ergibt Rauschen.
translatebooleantrue übersetzt die Beschreibung vor dem Erzeugen ins Englische und teilt Ihnen in X-Prompt mit, welcher Text tatsächlich verwendet wurde.
curl -X POST https://api.uttera.ai/v1/audio/sfx \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"prompt":"waves breaking on a pebble beach","seconds":12}' \
  -o sound.wav

Antwort-Header: X-Seed (der tatsächlich verwendete Seed), X-Seconds, X-Generations, X-Watermark, X-Prompt und X-Translated.

Der Plan einer Szene

POST /v1/audio/sfx/plan — nimmt prompt und segundos (4 bis 120) und gibt die Liste der Ereignisse zurück. Es erzeugt kein Audio: Ihnen wird nur die Arbeit des Sprachmodells berechnet.

Die Szene

POST /v1/audio/sfx/scene — nimmt den Plan, falls gewünscht bearbeitet, und gibt JSON mit der Mischung und den einzelnen Teilen zurück, alle als base64-kodiertes WAV und alle mit Wasserzeichen.

{"seconds": 20,
 "events": [{"start": 0.0, "duration": 20.0, "prompt": "quiet kitchen ambience"},
            {"start": 4.0, "duration": 4.0,  "prompt": "fridge door opening"}]}

Grenzen und Kosten

WasWie viel
Länge eines Klangs30 s
Länge einer Szene120 s
Ereignisse pro Szene6, je 2 bis 30 s
Anfrage-Body64 kB (es ist JSON, keine Datei)
PlanKostenpflichtig. Nicht im kostenlosen Tarif.

Berechnet pro Erzeugung, nicht pro Sekunde

Und das ist keine Rundung von uns: es ist Diffusion, und die Kosten werden von den Schritten des Samplers bestimmt, nicht von der Länge, die Sie anfordern. Auf unserem Knoten gemessen, brauchen ein 5-Sekunden-Clip und einer von 30 Sekunden dieselbe Zeit. Pro Sekunde zu berechnen würde den kurzen für genau dieselbe Arbeit sechsmal weniger kosten lassen.

Ein Klang ist pauschal 11,636 Credits, plus 0,026 pro Sekunde Audio, was das Wasserzeichen kostet. Ein 10-s-Clip kommt auf 11,90. Eine Szene sind so viele Erzeugungen, wie sie Ereignisse hat, plus die Tokens des Planers, berechnet wie die der Zusammenfassung.

Eine Erzeugung auf einmal im ganzen System. Es ist Diffusion und zwei passen nicht in den Speicher der Karte. Es gibt eine kurze Warteschlange: wenn sie beschäftigt ist, warten Sie ein paar Sekunden. Wenn die Warteschlange voll ist, lautet die Antwort 503.