Audio transkribieren
Laden Sie eine Aufnahme hoch, erhalten Sie den Text. Sie kann die Sprecher unterscheiden, Zeitstempel hinzufügen und, wenn Sie es wünschen, die Zusammenfassung und die Analyse im selben Durchgang erstellen.
Eine Engine, zwei Türen. Eine Webseite, auf der die Arbeit ohne eine Zeile Code erledigt wird, die auf Sie wartet, sobald Sie sich anmelden. Und eine API, damit Ihre eigene Software es von selbst tut, ohne dass jemand einen Browser öffnet. Nachfolgend alles, was sie kann, je ein Absatz, mit einem Link zu ihrem Handbuch.
Eine Seite mit vier Reitern. Legen Sie eine Datei ab oder fügen Sie Text ein, drücken Sie den Knopf, laden Sie das Ergebnis herunter. Das sehen Sie beim Eintreten.
Laden Sie eine Aufnahme hoch, erhalten Sie den Text. Sie kann die Sprecher unterscheiden, Zeitstempel hinzufügen und, wenn Sie es wünschen, die Zusammenfassung und die Analyse im selben Durchgang erstellen.
Fügen Sie einen Text ein und hören Sie ihn. Neun Sprachen in der Standardstimme und rund dreißig in der hochwertigen, in Geschwindigkeit und Format Ihrer Wahl.
Laden Sie eine kurze Stimmprobe hoch, und der Text wird mit dieser Stimme gelesen. Gedacht, um sich selbst zu synchronisieren, nicht um sich als jemand anderen auszugeben: Das ist verboten und schriftlich festgehalten.
Eine Aufnahme geht in einer Sprache hinein und kommt in einer anderen heraus. Setzen Sie das Häkchen, das die Originalstimme bewahrt, und sie kommt von derselben Stimme gesprochen heraus statt von einer aus dem Katalog.
Das Studio zeigt die Schätzung vorher, bevor Sie die Aufgabe starten, und die tatsächliche Zahl danach, in Credits. Keine Überraschungen am Monatsende, weil es kein Monatsende gibt: Es steht auf demselben Bildschirm.
Es gibt echte Grenzen —ein Satz aus drei Wörtern übersetzt sich schlechter als einer aus fünfzehn, und Stille kann die Engine erfinden lassen— und sie sind aufgeschrieben, statt durch Überraschung entdeckt zu werden.
Die zweite Anwendung, und bewusst schmal: drei Schritte, ohne Optionen im Weg. Gleiches Menü, gleiches Konto.
Schreiben Sie den Satz, den Sie morgen sagen müssen, in der Sprache, die Sie schon sprechen, und er kommt in der zurück, die Sie lernen, mit seiner phonetischen Umschrift darunter.
Das Audio wird erzeugt, wenn Sie es anfordern, nicht vorher, in der Geschwindigkeit, die Sie brauchen. Und Sie können es so oft abspielen, wie Sie möchten, ohne es doppelt zu bezahlen.
Nehmen Sie Ihren Versuch auf, und er wird Laut für Laut mit dem richtigen verglichen: was Sie gemacht haben, was Sie hätten machen sollen, und in welchem Wort. Wenn Sie es auch in Klartext erklärt haben möchten, fragt ein Knopf danach — und warnt Sie, dass es mehr kostet, bevor er läuft.
Die dritte Anwendung, und die erste, die nicht mit Stimme arbeitet: Sie beschreiben ein Geräusch mit Worten, und der Clip kommt heraus. Gleiches Menü, gleiches Konto.
« Eine zuschlagende Holztür ». Mehr nicht: Sie wählen die Dauer, und es kommt als 48-kHz-Stereo-WAV heraus, die Rate, mit der Video arbeitet.
Sie beschreiben, was passiert —« ein Motorrad hält nach acht Sekunden an, der Fahrer steigt ab und geht zum Meer »— und es wird in Ereignisse zerlegt, die zeitlich platziert sind. Sie sehen den Plan, korrigieren ihn, und erst dann werden sie erzeugt und gemischt.
Zwei Schritte und nicht einer, weil sechs Ereignisse sechs Generierungen sind: Sie für einen Plan auszugeben, der nicht das war, was Sie meinten, heißt, sie wegzuwerfen.
Jeder Clip kommt mit seinem Seed zurück. Dieselbe Beschreibung mit demselben Seed ergibt dasselbe Geräusch, sodass das, was gut herauskam, nicht verloren geht.
Die vierte: Sie beschreiben die Musik, die Sie brauchen, und es kommt ein fertiges Stück heraus, bis zu sechs Minuten und zwanzig Sekunden. Das sind keine Loops zum Zusammensetzen.
« Tribal-African-Techno mit Djembe und tiefen Toms, 128 BPM ». Stil, Instrumente und Tempo zu benennen hilft weit mehr, als « etwas Beschwingtes » zu verlangen.
Die Dauer und die Qualität. Beide ändern die Kosten, deshalb zeigt Ihnen die Anwendung die Credits vor dem Erzeugen: Einen Regler zu bewegen ist nie eine Überraschung.
Und das Stück wird ganz für die gewünschte Länge gebaut — ein dreiminütiges Stück ist nicht ein dreißigsekündiges, sechsmal wiederholt.
Was Sie erzeugen, gehört Ihnen, mit kommerzieller Nutzung ab dem Startup-Plan. Kein Katalog zum Durchwühlen und keine Jahreslizenz dahinter.
Die Dienste, auf einer Audiodatei oder einem Text. Wir sprechen denselben Dialekt wie die API von OpenAI, sodass in vielen Fällen das Ändern der Basis-URL genügt.
Audio hinein, Text heraus. Mit Sprechertrennung, Zeitstempeln und der Option, die Zusammenfassung und die Analyse in derselben Anfrage anzufordern, ohne die Datei erneut hochzuladen.
Drei Arten von Stimme, nicht zwei: Standard, hohe Qualität und geklont aus einer eigenen Probe. Und Sie können anfangen, sie zu hören, während sie noch erzeugt wird, statt auf die ganze Datei zu warten.
Text zu Text, oder eine ganze Aufnahme von einer Sprache in eine andere. Und mit Transposition: die Übersetzung von der Stimme der Originalaufnahme gesprochen.
Wie viel jede Person gesprochen hat, in welchem Ton, in welchem Tempo.
Mit einer Grenze, die wir uns selbst setzen: Das sind akustische Schätzungen, sie liegen falsch, und sie dürfen nicht verwendet werden, um Entscheidungen über eine Person zu treffen. Sie sind da, um einen Prozess zu verbessern, nicht um jemanden zu beurteilen.
Eine Stunde Audio kommt zurück als das, was vereinbart wurde, und das, was noch aussteht, strukturiert, damit Sie es auf Felder abbilden können.
Und Sie zahlen Ihr LLM dabei weniger: 15.410 Tokens Transkript gegen weniger als 700 Zusammenfassung, gemessen an einer echten Aufnahme.
Senden Sie den Satz, den jemand sagen wollte, plus das Audio, wie er ihn gesagt hat, und es gibt zurück, welcher Laut erzeugt wurde, welcher fällig war und in welchem Wort. Es ist das, was die Anwendung oben antreibt, und es steht Ihrer eigenen Sprachlernplattform offen.
Melden Sie sich an, erstellen Sie einen Schlüssel, senden Sie ihn in einem Header. Ein Schlüssel kann auf bestimmte IP-Adressen beschränkt werden, sodass ein geleakter anderswo nichts nützt.
Es gibt veröffentlichten, getesteten Code für Asterisk-Telefonanlagen, für n8n und für KI-Agenten. Das sind keine Spielzeugbeispiele: Sie laufen in Produktion.
Ein kostenloses Konto mit Credits zum Ausprobieren, ohne Karte. Sie zahlen für das, was Sie verbrauchen —pro Sekunde Audio, pro Zeichen Text—, nicht pro Anfrage, und jede Antwort trägt einen Header mit genau dem, was berechnet wurde.
Kostenloses Konto erstellen Die Dokumentation lesen
Vollständig in Spanien verarbeitet · Wir speichern Ihr Audio nicht · Wir trainieren nicht mit Ihren Daten · Open Source