UtteraUttera

Was das Studio ist

Das Studio ist Utteras Web-Anwendung: eine Seite, auf der Sie eine Datei hochladen oder Text einfügen, anhaken, was Sie möchten, und das Ergebnis herunterladen. Nichts zu installieren, kein Schlüssel anzufordern und keine Zeile Code zu schreiben.

Darunter liegt genau derselbe Dienst, den der Rest dieser Dokumentation beschreibt. Das Studio ist keine Demo mit beschnittenen Grenzen: es ruft dieselbe API auf, mit Ihrem gleichen Tarif, und verbraucht Credits aus Ihrem gleichen Kontingent. Wenn diese Dokumentation sagt, dass Transkribieren so viel pro Sekunde kostet, kostet es durch beide Türen dasselbe.

Um hineinzukommen, brauchen Sie ein Konto und eine aktive Sitzung. Wenn Sie keines haben, schickt das Studio Sie zurück auf die Startseite. Der Seitenkopf erinnert Sie daran, mit welcher E-Mail Sie angemeldet sind und in welchem Tarif Sie sind, denn was Sie tun können, hängt davon ab.

Das Audio läuft nicht über das Portal: es reist von Ihrem Browser direkt zur API, mit einer vorübergehenden Berechtigung, die die Seite beim Laden anfordert. Deshalb läuft das Hochladen einer großen Datei mit der Geschwindigkeit Ihrer Leitung und nicht der des Portals. Wenn Sie den Tab viele Stunden offen lassen, läuft diese Berechtigung ab: laden Sie die Seite neu.

Wie der Bildschirm aufgebaut ist

Es gibt vier Karten, eine pro Aufgabe:

KarteWas sie tutEntspricht
Audio transkribierenAufnahme → Text, mit optionaler Analyse und Zusammenfassung/v1/audio/transcriptions · /v1/summarize
Text zu digitaler StimmeText → Audio mit einer Stimme aus dem Katalog/v1/audio/speech
Text zu geklonter StimmeText → Audio mit einer Stimme, die Sie liefern/v1/audio/speech
Eine Aufnahme übersetzenAufnahme → Text und Sprache in einer anderen Sprache/v1/translate

Wenn Ihr Tarif etwas nicht enthält, ist die Karte trotzdem da, aber abgeschaltet, ausgegraut und ohne Knopf, und nennt den Tarif, den Sie bräuchten. Das wird bewusst gezeigt: es ist besser, zu sehen, was existiert und was es kostet, als es über einen Fehler zu entdecken. Dasselbe geschieht innerhalb von Transkribieren mit den Kontrollkästchen für Analyse und Zusammenfassung, die sich einzeln abschalten, ohne die Transkription wegzunehmen.

Alle Karten funktionieren gleich, von oben nach unten:

  1. Die Felder. Die Datei oder der Text, und die Optionen dieser Aufgabe.
  2. Die Kostenzeile. Sie erscheint, sobald Sie eine Datei wählen, und sagt, was es kosten wird, bevor etwas ausgegeben wird.
  3. Der Knopf Ausführen.
  4. Das Ergebnis. Während es arbeitet, sehen Sie das animierte Uttera-Logo und einen Sekunden- zähler, damit Sie erkennen, dass es noch lebt; langes Audio braucht Zeit. Wenn es fertig ist, wird das Logo ruhig und der Zähler verwandelt sich in die benötigte Zeit.

Audio transkribieren

Die vollständigste Karte: sie transkribiert, und dabei kann sie analysieren und zusammenfassen.

  1. Wählen Sie die Datei. Sie akzeptiert wav, mp3, flac, ogg, opus, aiff, m4a und webm. Bis zu 150 MB und 2 Stunden Audio.
  2. Haken Sie die gewünschten Extras an (jedes hat seinen Preis und wird gesondert abgerechnet):
    KontrollkästchenWas es hinzufügt
    TonDie vorherrschende Emotion der Aufnahme, mit ihrer Konfidenz und den übrigen Kandidaten.
    SprecherprofilAltersbereich und Geschlecht, aus der Stimme geschätzt.
    wer wann sprichtSprechabschnitte mit Zeitstempeln pro Sprecher.
    Zusammenfassung der AufnahmeEine strukturierte Zusammenfassung des Gesagten.
  3. Ausführen. Die Datei wird nur einmal hochgeladen, auch wenn Sie alle vier anhaken: die Analyse wird intern über das bereits hochgeladene Audio verteilt.

Das Ergebnis ist stets in dieser Reihenfolge angeordnet:

  1. Das Transkript, und darunter der Ton als Fließtextzeile, falls Sie ihn angefordert haben, mit dem Knopf Text herunterladen (transcripcion.txt), der den Block abschließt.
  2. Die Zusammenfassung, falls angefordert, mit Zusammenfassung herunterladen (resumen.txt). Sie steht bewusst nach dem Text: einer Zusammenfassung folgt man leichter mit dem Transkript vor Augen, und das Transkript ist das, was immer da ist.
  3. Das Profil und wer wann spricht, roh. Es sind strukturierte Daten und wer sie anfordert, will sie vollständig, nicht ausformuliert.
  4. Analyse herunterladen (analisis.json): eine einzige Datei mit allem, was analysiert wurde — einschließlich des vollständigen Ton-Vektors — nicht eine pro Abschnitt.
  5. Die Abrechnungszeile, die den Vorgang abschließt.
Die Zusammenfassung ist kein Extra über der Transkription. Sie anzuhaken verändert die ganze Aufgabe: sie wird von /v1/summarize bedient, das von sich aus transkribiert und außerdem analysiert. Deshalb wird das Audio nicht zweimal transkribiert, und deshalb bedeuten die drei Analyse-Kontrollkästchen dasselbe, ob die Zusammenfassung angehakt ist oder nicht.

Wenn eine bestimmte Analyse fehlschlägt, wird es gesagt: das Transkript wird trotzdem geliefert und darunter erscheint, welcher Teil nicht möglich war. Es wird weder verborgen noch erfunden.

Text zu digitaler Stimme

Schreiben oder fügen Sie einen Text ein und wählen Sie, wie Sie ihn hören möchten.

FeldWas es tut
TextWas gesagt werden soll.
StimmeDer Katalog wird beim Öffnen der Seite aus der API geladen, mit der Sprache vor jedem Namen. Die Sprache wird nicht gesondert gewählt: die Stimme trägt sie. Eine eigenständige Sprachauswahl würde wirken, als übersetze sie, und diese Karte übersetzt nicht.
GeschwindigkeitVon langsam (0,8) bis sehr schnell (1,5). Sie verändert die Dauer des Audios und, da Sprache pro erzeugter Sekunde abgerechnet wird, auch den Preis: Lesen bei 1,25 kostet rund 20 % weniger als bei 1,0.
Audioformatmp3 · wav · opus · flac · pcm

Das Ergebnis ist ein Player, die Abrechnungszeile und Audio herunterladen (voz.mp3, oder welche Erweiterung Sie gewählt haben).

Wenn Sie pcm wählen, bekommen Sie keinen normalen Player, sondern einen Knopf ▶ Abspielen. pcm ist rohes Audio ohne Header: der Browser weiß nicht, welche Abtastrate es hat, und kann es nicht von selbst abspielen, aber das Studio weiß es und dekodiert es. Bei der heruntergeladenen Datei müssen Sie diese Parameter dem Programm mitteilen, mit dem Sie sie öffnen — sie stehen in Formate.

Text zu geklonter Stimme

Wie die vorige, aber Sie liefern die Stimme: Sie laden ein Muster hoch und der Text wird darin gelesen.

FeldWas es tut
TextWas gesagt werden soll.
StimmmusterEine Audiodatei der nachzuahmenden Stimme, in einem der Eingabeformate.
Geschwindigkeit und FormatWie bei der digitalen Stimme.

Das Muster wird nicht berechnet. Berechnet wird das erzeugte Audio, das davon abhängt, wie lang der Text ist, nicht wie lang das Muster ist. Das Klonen dauert erheblich länger als die digitale Stimme: die Karte warnt Sie, während sie arbeitet. Der Download kommt als voz-clonada.mp3 heraus.

Nur Stimmen, die Sie verwenden dürfen. Eine Stimme ohne die Erlaubnis ihres Inhabers zu klonen, ist Ihr Problem, nicht unseres: in Spanien ist eine Stimme personenbezogenes Datum und sie ist geschützt. Was der Abschnitt Sicherheit darüber sagt, was in das System hineinkommt, gilt hier für das, was herauskommt.

Eine Aufnahme übersetzen

Die ganze Kette in einem Schritt: sie transkribiert das Audio, übersetzt den Text und spricht ihn erneut in der Zielsprache.

FeldWas es tut
DateiDie Quellaufnahme. Die Ausgangssprache wird von selbst erkannt.
ZielspracheEs erscheinen nur die Sprachen, die eine Stimme haben. Wir übersetzen in viele mehr, aber hier muss es laut gesagt werden.
StimmeAus dem Standardkatalog. Sie passt sich der Zielsprache an, wenn Sie sie ändern: eine spanische Stimme, die die englische Übersetzung liest, klingt wie ein Ausländer, der vorliest.
In der Originalstimme sprechenTransponiert: statt einer unserer Stimmen wird die Übersetzung in der Stimme der Person aus der Aufnahme gesprochen, aus dieser geklont. Es deaktiviert die Stimmenauswahl, weil es sie ersetzt. Erfordert einen kostenpflichtigen Tarif, und die geschätzten Kosten steigen, sobald Sie es anhaken: eine Sekunde geklonte Stimme ist etwa 19-mal so viel wert wie eine Sekunde Standardstimme.
GeschwindigkeitWie bei der digitalen Stimme, mit derselben Wirkung auf den Preis.
Text und Audio / nur TextWenn Sie es nicht hören müssen, überspringt nur Text die Synthese und kostet weniger.
AudioformatDieselben fünf wie bei der digitalen Stimme.

Das Ergebnis zeigt das transkribierte Original und die Übersetzung, und darunter den Player mit Audio herunterladen (traduccion.mp3), falls Sie Audio angefordert haben. Wenn irgendein Teil der Kette etwas zu melden hatte, erscheint es als Hinweis, statt verloren zu gehen.

Was es kostet, davor und danach

Im Studio erfahren Sie auch, was die Dinge wert sind, deshalb nennt es den Preis zweimal: eine Schätzung davor und die tatsächliche Abrechnung danach.

Davor. Sobald Sie eine Datei wählen, liest der Browser ihre Dauer und multipliziert sie mit dem Preis dessen, was Sie angehakt haben. Ein Kästchen an- oder abzuhaken rechnet es neu, ohne dass die Datei erneut gewählt werden muss. Es steht ungefähre Kosten, weil es so ist: die Dauer, die ein Browser bei einem mp3 mit variabler Bitrate misst, ist nicht immer genau, und es ist die Engine, die abrechnet.

Die beiden Stimm-Karten tragen keine Vorabschätzung, und das ist kein Versehen: sie werden nach Sekunden erzeugten Audios abgerechnet, und wie viel Audio ein Text erzeugen wird, weiß man erst, wenn es erzeugt ist.

Danach. Wenn es fertig ist, erscheint eine Zeile mit der Verarbeitungszeit und dem Verbrauchten; eine Sekunde später wird sie durch die tatsächliche Abrechnung ersetzt, genau so, wie das Abrechnungssystem sie erfasst hat:

29 s · Charged: 144 credits · for 2,424.0 s of audio ·
transcription 79 · tone 12 · profile 8 · speakers 24 · summary 21
Was Sie sehenWas es ist
29 sVerarbeitungszeit, nicht Audiodauer. Vierzig Minuten Aufnahme werden in unter einer Minute transkribiert.
Charged: 144 creditsWas Ihnen tatsächlich berechnet wurde. Falls dies aus irgendeinem Grund nicht ankam, bleibt die Schätzung an ihrer Stelle.
for 2,424.0 s of audioDie genaue Dauer, die die Engine gemessen hat und die die Grundlage der Abrechnung ist.
Die AufschlüsselungSie erscheint, wenn es mehr als eine Aufgabe gab, damit Sie sehen, wohin jeder Credit ging.
served from cache (10% of the price)Sie hatten kürzlich genau dasselbe angefordert und es musste nicht erneut erzeugt werden.

Die Preise, die dieser Bildschirm verwendet, sind die gleichen Koeffizienten, die in dieser Dokumentation veröffentlicht sind, live gelesen: ändern sie sich, ändern sie sich hier zur selben Zeit.

Wenn etwas schiefgeht

Die Meldungen des Studios sind die Fehler der API in Klartext:

Was es sagtWas passiert ist
Ihre Sitzung ist abgelaufen. Laden Sie die Seite neu.Die vorübergehende Berechtigung ist abgelaufen. Neu laden genügt; nichts geht verloren.
Ihre Credits für diesen Zeitraum sind aufgebraucht.Sie erneuern sich zu Beginn Ihres nächsten Abrechnungszyklus, oder Sie können den Tarif wechseln.
Ihr Tarif enthält diesen Dienst nicht.Wie die abgeschalteten Karten, aber vom Server aus gesehen.
Die Datei ist zu groß.Über 150 MB oder über 2 Stunden. Siehe Größe und Dauer.
Der Dienst hat die Datei abgelehnt.Das Audio lässt sich nicht dekodieren: meist eine unvollständige Datei oder eine, deren Erweiterung von Hand geändert wurde.
Zu viele Anfragen auf einmal.Sie haben mehrere Karten parallel gestartet. Warten Sie ein paar Sekunden.

Und wenn Sie möchten, dass all das von selbst geschieht, ohne dass jemand Dateien von Hand hochlädt, ist das die andere Tür: Uttera in Ihren Code integrieren.