UtteraUttera

Was Sie mit Uttera tun können, und wo

Eine Engine, zwei Türen. Eine Webseite, auf der die Arbeit ohne eine Zeile Code erledigt wird, die auf Sie wartet, sobald Sie sich anmelden. Und eine API, damit Ihre eigene Software es von selbst tut, ohne dass jemand einen Browser öffnet. Nachfolgend alles, was sie kann, je ein Absatz, mit einem Link zu ihrem Handbuch.

Kostenloses Konto erstellen Sehen, wofür es dient

Das Studio

Eine Seite mit vier Reitern. Legen Sie eine Datei ab oder fügen Sie Text ein, drücken Sie den Knopf, laden Sie das Ergebnis herunter. Das sehen Sie beim Eintreten.

Audio transkribieren

Laden Sie eine Aufnahme hoch, erhalten Sie den Text. Sie kann die Sprecher unterscheiden, Zeitstempel hinzufügen und, wenn Sie es wünschen, die Zusammenfassung und die Analyse im selben Durchgang erstellen.

Wie man sie nutzt →

Text in Sprache verwandeln

Fügen Sie einen Text ein und hören Sie ihn. Neun Sprachen in der Standardstimme und rund dreißig in der hochwertigen, in Geschwindigkeit und Format Ihrer Wahl.

Wie man sie nutzt →

Text in eine geklonte Stimme verwandeln

Laden Sie eine kurze Stimmprobe hoch, und der Text wird mit dieser Stimme gelesen. Gedacht, um sich selbst zu synchronisieren, nicht um sich als jemand anderen auszugeben: Das ist verboten und schriftlich festgehalten.

Wie man sie nutzt →

Eine Aufnahme übersetzen oder transponieren

Eine Aufnahme geht in einer Sprache hinein und kommt in einer anderen heraus. Setzen Sie das Häkchen, das die Originalstimme bewahrt, und sie kommt von derselben Stimme gesprochen heraus statt von einer aus dem Katalog.

Wie man sie nutzt →

Was es kostet, bevor Sie drücken

Das Studio zeigt die Schätzung vorher, bevor Sie die Aufgabe starten, und die tatsächliche Zahl danach, in Credits. Keine Überraschungen am Monatsende, weil es kein Monatsende gibt: Es steht auf demselben Bildschirm.

Wie es berechnet wird →

Und wenn etwas seltsam herauskommt

Es gibt echte Grenzen —ein Satz aus drei Wörtern übersetzt sich schlechter als einer aus fünfzehn, und Stille kann die Engine erfinden lassen— und sie sind aufgeschrieben, statt durch Überraschung entdeckt zu werden.

Die Grenzen →

Aussprechen

Die zweite Anwendung, und bewusst schmal: drei Schritte, ohne Optionen im Weg. Gleiches Menü, gleiches Konto.

Sie schreiben in Ihrer Sprache

Schreiben Sie den Satz, den Sie morgen sagen müssen, in der Sprache, die Sie schon sprechen, und er kommt in der zurück, die Sie lernen, mit seiner phonetischen Umschrift darunter.

Sie hören ihn

Das Audio wird erzeugt, wenn Sie es anfordern, nicht vorher, in der Geschwindigkeit, die Sie brauchen. Und Sie können es so oft abspielen, wie Sie möchten, ohne es doppelt zu bezahlen.

Sie sagen ihn, und wir sagen Ihnen, was schiefging

Nehmen Sie Ihren Versuch auf, und er wird Laut für Laut mit dem richtigen verglichen: was Sie gemacht haben, was Sie hätten machen sollen, und in welchem Wort. Wenn Sie es auch in Klartext erklärt haben möchten, fragt ein Knopf danach — und warnt Sie, dass es mehr kostet, bevor er läuft.

Wie es darunter funktioniert, und was es NICHT tut →

Sounds

Die dritte Anwendung, und die erste, die nicht mit Stimme arbeitet: Sie beschreiben ein Geräusch mit Worten, und der Clip kommt heraus. Gleiches Menü, gleiches Konto.

Ein Geräusch

« Eine zuschlagende Holztür ». Mehr nicht: Sie wählen die Dauer, und es kommt als 48-kHz-Stereo-WAV heraus, die Rate, mit der Video arbeitet.

Oder eine ganze Szene

Sie beschreiben, was passiert —« ein Motorrad hält nach acht Sekunden an, der Fahrer steigt ab und geht zum Meer »— und es wird in Ereignisse zerlegt, die zeitlich platziert sind. Sie sehen den Plan, korrigieren ihn, und erst dann werden sie erzeugt und gemischt.

Zwei Schritte und nicht einer, weil sechs Ereignisse sechs Generierungen sind: Sie für einen Plan auszugeben, der nicht das war, was Sie meinten, heißt, sie wegzuwerfen.

Und Sie können es wiederholen

Jeder Clip kommt mit seinem Seed zurück. Dieselbe Beschreibung mit demselben Seed ergibt dasselbe Geräusch, sodass das, was gut herauskam, nicht verloren geht.

Wie es funktioniert, und was es kostet →

Musik

Die vierte: Sie beschreiben die Musik, die Sie brauchen, und es kommt ein fertiges Stück heraus, bis zu sechs Minuten und zwanzig Sekunden. Das sind keine Loops zum Zusammensetzen.

Sie beschreiben sie mit Worten

« Tribal-African-Techno mit Djembe und tiefen Toms, 128 BPM ». Stil, Instrumente und Tempo zu benennen hilft weit mehr, als « etwas Beschwingtes » zu verlangen.

Zwei Regler, und beide zählen

Die Dauer und die Qualität. Beide ändern die Kosten, deshalb zeigt Ihnen die Anwendung die Credits vor dem Erzeugen: Einen Regler zu bewegen ist nie eine Überraschung.

Und das Stück wird ganz für die gewünschte Länge gebaut — ein dreiminütiges Stück ist nicht ein dreißigsekündiges, sechsmal wiederholt.

Mit einer klaren Lizenz

Was Sie erzeugen, gehört Ihnen, mit kommerzieller Nutzung ab dem Startup-Plan. Kein Katalog zum Durchwühlen und keine Jahreslizenz dahinter.

Wie es funktioniert, und was es kostet →

Und über die API, damit Ihre Software es tut

Die Dienste, auf einer Audiodatei oder einem Text. Wir sprechen denselben Dialekt wie die API von OpenAI, sodass in vielen Fällen das Ändern der Basis-URL genügt.

Transkribieren

Audio hinein, Text heraus. Mit Sprechertrennung, Zeitstempeln und der Option, die Zusammenfassung und die Analyse in derselben Anfrage anzufordern, ohne die Datei erneut hochzuladen.

Der Endpunkt →

Text in Sprache verwandeln

Drei Arten von Stimme, nicht zwei: Standard, hohe Qualität und geklont aus einer eigenen Probe. Und Sie können anfangen, sie zu hören, während sie noch erzeugt wird, statt auf die ganze Datei zu warten.

Der Endpunkt →

Übersetzen

Text zu Text, oder eine ganze Aufnahme von einer Sprache in eine andere. Und mit Transposition: die Übersetzung von der Stimme der Originalaufnahme gesprochen.

Der Endpunkt →

Die Stimme analysieren

Wie viel jede Person gesprochen hat, in welchem Ton, in welchem Tempo.

Mit einer Grenze, die wir uns selbst setzen: Das sind akustische Schätzungen, sie liegen falsch, und sie dürfen nicht verwendet werden, um Entscheidungen über eine Person zu treffen. Sie sind da, um einen Prozess zu verbessern, nicht um jemanden zu beurteilen.

Der Endpunkt →

Eine Aufnahme zusammenfassen

Eine Stunde Audio kommt zurück als das, was vereinbart wurde, und das, was noch aussteht, strukturiert, damit Sie es auf Felder abbilden können.

Und Sie zahlen Ihr LLM dabei weniger: 15.410 Tokens Transkript gegen weniger als 700 Zusammenfassung, gemessen an einer echten Aufnahme.

Die Zahlen →

Eine Aussprache diagnostizieren

Senden Sie den Satz, den jemand sagen wollte, plus das Audio, wie er ihn gesagt hat, und es gibt zurück, welcher Laut erzeugt wurde, welcher fällig war und in welchem Wort. Es ist das, was die Anwendung oben antreibt, und es steht Ihrer eigenen Sprachlernplattform offen.

Wie es gemessen wird →

Ein Schlüssel, und das war's

Melden Sie sich an, erstellen Sie einen Schlüssel, senden Sie ihn in einem Header. Ein Schlüssel kann auf bestimmte IP-Adressen beschränkt werden, sodass ein geleakter anderswo nichts nützt.

Authentifizierung →

Und wenn Sie schon etwas betreiben

Es gibt veröffentlichten, getesteten Code für Asterisk-Telefonanlagen, für n8n und für KI-Agenten. Das sind keine Spielzeugbeispiele: Sie laufen in Produktion.

Die Konnektoren →

Was der Start kostet: nichts

Ein kostenloses Konto mit Credits zum Ausprobieren, ohne Karte. Sie zahlen für das, was Sie verbrauchen —pro Sekunde Audio, pro Zeichen Text—, nicht pro Anfrage, und jede Antwort trägt einen Header mit genau dem, was berechnet wurde.

Kostenloses Konto erstellen Die Dokumentation lesen

Vollständig in Spanien verarbeitet · Wir speichern Ihr Audio nicht · Wir trainieren nicht mit Ihren Daten · Open Source