Was das Studio ist
Das Studio ist Utteras Web-Anwendung: eine Seite, auf der Sie eine Datei hochladen oder Text einfügen, anhaken, was Sie möchten, und das Ergebnis herunterladen. Nichts zu installieren, kein Schlüssel anzufordern und keine Zeile Code zu schreiben.
Darunter liegt genau derselbe Dienst, den der Rest dieser Dokumentation beschreibt. Das Studio ist keine Demo mit beschnittenen Grenzen: es ruft dieselbe API auf, mit Ihrem gleichen Tarif, und verbraucht Credits aus Ihrem gleichen Kontingent. Wenn diese Dokumentation sagt, dass Transkribieren so viel pro Sekunde kostet, kostet es durch beide Türen dasselbe.
Um hineinzukommen, brauchen Sie ein Konto und eine aktive Sitzung. Wenn Sie keines haben, schickt das Studio Sie zurück auf die Startseite. Der Seitenkopf erinnert Sie daran, mit welcher E-Mail Sie angemeldet sind und in welchem Tarif Sie sind, denn was Sie tun können, hängt davon ab.
Wie der Bildschirm aufgebaut ist
Es gibt vier Karten, eine pro Aufgabe:
| Karte | Was sie tut | Entspricht |
|---|---|---|
| Audio transkribieren | Aufnahme → Text, mit optionaler Analyse und Zusammenfassung | /v1/audio/transcriptions · /v1/summarize |
| Text zu digitaler Stimme | Text → Audio mit einer Stimme aus dem Katalog | /v1/audio/speech |
| Text zu geklonter Stimme | Text → Audio mit einer Stimme, die Sie liefern | /v1/audio/speech |
| Eine Aufnahme übersetzen | Aufnahme → Text und Sprache in einer anderen Sprache | /v1/translate |
Wenn Ihr Tarif etwas nicht enthält, ist die Karte trotzdem da, aber abgeschaltet, ausgegraut und ohne Knopf, und nennt den Tarif, den Sie bräuchten. Das wird bewusst gezeigt: es ist besser, zu sehen, was existiert und was es kostet, als es über einen Fehler zu entdecken. Dasselbe geschieht innerhalb von Transkribieren mit den Kontrollkästchen für Analyse und Zusammenfassung, die sich einzeln abschalten, ohne die Transkription wegzunehmen.
Alle Karten funktionieren gleich, von oben nach unten:
- Die Felder. Die Datei oder der Text, und die Optionen dieser Aufgabe.
- Die Kostenzeile. Sie erscheint, sobald Sie eine Datei wählen, und sagt, was es kosten wird, bevor etwas ausgegeben wird.
- Der Knopf Ausführen.
- Das Ergebnis. Während es arbeitet, sehen Sie das animierte Uttera-Logo und einen Sekunden- zähler, damit Sie erkennen, dass es noch lebt; langes Audio braucht Zeit. Wenn es fertig ist, wird das Logo ruhig und der Zähler verwandelt sich in die benötigte Zeit.
Audio transkribieren
Die vollständigste Karte: sie transkribiert, und dabei kann sie analysieren und zusammenfassen.
- Wählen Sie die Datei. Sie akzeptiert
wav,mp3,flac,ogg,opus,aiff,m4aundwebm. Bis zu 150 MB und 2 Stunden Audio. - Haken Sie die gewünschten Extras an (jedes hat seinen Preis und wird gesondert abgerechnet):
Kontrollkästchen Was es hinzufügt Ton Die vorherrschende Emotion der Aufnahme, mit ihrer Konfidenz und den übrigen Kandidaten. Sprecherprofil Altersbereich und Geschlecht, aus der Stimme geschätzt. wer wann spricht Sprechabschnitte mit Zeitstempeln pro Sprecher. Zusammenfassung der Aufnahme Eine strukturierte Zusammenfassung des Gesagten. - Ausführen. Die Datei wird nur einmal hochgeladen, auch wenn Sie alle vier anhaken: die Analyse wird intern über das bereits hochgeladene Audio verteilt.
Das Ergebnis ist stets in dieser Reihenfolge angeordnet:
- Das Transkript, und darunter der Ton als Fließtextzeile, falls Sie ihn
angefordert haben, mit dem Knopf Text herunterladen
(
transcripcion.txt), der den Block abschließt. - Die Zusammenfassung, falls angefordert, mit Zusammenfassung herunterladen
(
resumen.txt). Sie steht bewusst nach dem Text: einer Zusammenfassung folgt man leichter mit dem Transkript vor Augen, und das Transkript ist das, was immer da ist. - Das Profil und wer wann spricht, roh. Es sind strukturierte Daten und wer sie anfordert, will sie vollständig, nicht ausformuliert.
- Analyse herunterladen (
analisis.json): eine einzige Datei mit allem, was analysiert wurde — einschließlich des vollständigen Ton-Vektors — nicht eine pro Abschnitt. - Die Abrechnungszeile, die den Vorgang abschließt.
/v1/summarize bedient, das von sich aus transkribiert
und außerdem analysiert. Deshalb wird das Audio nicht zweimal transkribiert, und deshalb bedeuten die
drei Analyse-Kontrollkästchen dasselbe, ob die Zusammenfassung angehakt ist oder nicht.Wenn eine bestimmte Analyse fehlschlägt, wird es gesagt: das Transkript wird trotzdem geliefert und darunter erscheint, welcher Teil nicht möglich war. Es wird weder verborgen noch erfunden.
Text zu digitaler Stimme
Schreiben oder fügen Sie einen Text ein und wählen Sie, wie Sie ihn hören möchten.
| Feld | Was es tut |
|---|---|
| Text | Was gesagt werden soll. |
| Stimme | Der Katalog wird beim Öffnen der Seite aus der API geladen, mit der Sprache vor jedem Namen. Die Sprache wird nicht gesondert gewählt: die Stimme trägt sie. Eine eigenständige Sprachauswahl würde wirken, als übersetze sie, und diese Karte übersetzt nicht. |
| Geschwindigkeit | Von langsam (0,8) bis sehr schnell (1,5). Sie verändert die Dauer des Audios und, da Sprache pro erzeugter Sekunde abgerechnet wird, auch den Preis: Lesen bei 1,25 kostet rund 20 % weniger als bei 1,0. |
| Audioformat | mp3 · wav · opus · flac · pcm |
Das Ergebnis ist ein Player, die Abrechnungszeile und Audio herunterladen
(voz.mp3, oder welche Erweiterung Sie gewählt haben).
pcm wählen, bekommen Sie keinen normalen Player, sondern einen
Knopf ▶ Abspielen. pcm ist rohes Audio ohne Header: der Browser weiß
nicht, welche Abtastrate es hat, und kann es nicht von selbst abspielen, aber das Studio weiß es und
dekodiert es. Bei der heruntergeladenen Datei müssen Sie diese Parameter dem Programm mitteilen, mit dem
Sie sie öffnen — sie stehen in Formate.Text zu geklonter Stimme
Wie die vorige, aber Sie liefern die Stimme: Sie laden ein Muster hoch und der Text wird darin gelesen.
| Feld | Was es tut |
|---|---|
| Text | Was gesagt werden soll. |
| Stimmmuster | Eine Audiodatei der nachzuahmenden Stimme, in einem der Eingabeformate. |
| Geschwindigkeit und Format | Wie bei der digitalen Stimme. |
Das Muster wird nicht berechnet. Berechnet wird das erzeugte Audio, das davon abhängt,
wie lang der Text ist, nicht wie lang das Muster ist. Das Klonen dauert erheblich länger
als die digitale Stimme: die Karte warnt Sie, während sie arbeitet. Der Download kommt als
voz-clonada.mp3 heraus.
Eine Aufnahme übersetzen
Die ganze Kette in einem Schritt: sie transkribiert das Audio, übersetzt den Text und spricht ihn erneut in der Zielsprache.
| Feld | Was es tut |
|---|---|
| Datei | Die Quellaufnahme. Die Ausgangssprache wird von selbst erkannt. |
| Zielsprache | Es erscheinen nur die Sprachen, die eine Stimme haben. Wir übersetzen in viele mehr, aber hier muss es laut gesagt werden. |
| Stimme | Aus dem Standardkatalog. Sie passt sich der Zielsprache an, wenn Sie sie ändern: eine spanische Stimme, die die englische Übersetzung liest, klingt wie ein Ausländer, der vorliest. |
| In der Originalstimme sprechen | Transponiert: statt einer unserer Stimmen wird die Übersetzung in der Stimme der Person aus der Aufnahme gesprochen, aus dieser geklont. Es deaktiviert die Stimmenauswahl, weil es sie ersetzt. Erfordert einen kostenpflichtigen Tarif, und die geschätzten Kosten steigen, sobald Sie es anhaken: eine Sekunde geklonte Stimme ist etwa 19-mal so viel wert wie eine Sekunde Standardstimme. |
| Geschwindigkeit | Wie bei der digitalen Stimme, mit derselben Wirkung auf den Preis. |
| Text und Audio / nur Text | Wenn Sie es nicht hören müssen, überspringt nur Text die Synthese und kostet weniger. |
| Audioformat | Dieselben fünf wie bei der digitalen Stimme. |
Das Ergebnis zeigt das transkribierte Original und die Übersetzung, und darunter
den Player mit Audio herunterladen
(traduccion.mp3), falls Sie Audio angefordert haben. Wenn irgendein Teil der Kette etwas
zu melden hatte, erscheint es als Hinweis, statt verloren zu gehen.
Was es kostet, davor und danach
Im Studio erfahren Sie auch, was die Dinge wert sind, deshalb nennt es den Preis zweimal: eine Schätzung davor und die tatsächliche Abrechnung danach.
Davor. Sobald Sie eine Datei wählen, liest der Browser ihre Dauer und
multipliziert sie mit dem Preis dessen, was Sie angehakt haben. Ein Kästchen an- oder abzuhaken rechnet es
neu, ohne dass die Datei erneut gewählt werden muss. Es steht ungefähre Kosten, weil es so ist:
die Dauer, die ein Browser bei einem mp3 mit variabler Bitrate misst, ist nicht immer genau,
und es ist die Engine, die abrechnet.
Die beiden Stimm-Karten tragen keine Vorabschätzung, und das ist kein Versehen: sie werden nach Sekunden erzeugten Audios abgerechnet, und wie viel Audio ein Text erzeugen wird, weiß man erst, wenn es erzeugt ist.
Danach. Wenn es fertig ist, erscheint eine Zeile mit der Verarbeitungszeit und dem Verbrauchten; eine Sekunde später wird sie durch die tatsächliche Abrechnung ersetzt, genau so, wie das Abrechnungssystem sie erfasst hat:
29 s · Charged: 144 credits · for 2,424.0 s of audio ·
transcription 79 · tone 12 · profile 8 · speakers 24 · summary 21
| Was Sie sehen | Was es ist |
|---|---|
29 s | Verarbeitungszeit, nicht Audiodauer. Vierzig Minuten Aufnahme werden in unter einer Minute transkribiert. |
Charged: 144 credits | Was Ihnen tatsächlich berechnet wurde. Falls dies aus irgendeinem Grund nicht ankam, bleibt die Schätzung an ihrer Stelle. |
for 2,424.0 s of audio | Die genaue Dauer, die die Engine gemessen hat und die die Grundlage der Abrechnung ist. |
| Die Aufschlüsselung | Sie erscheint, wenn es mehr als eine Aufgabe gab, damit Sie sehen, wohin jeder Credit ging. |
served from cache (10% of the price) | Sie hatten kürzlich genau dasselbe angefordert und es musste nicht erneut erzeugt werden. |
Die Preise, die dieser Bildschirm verwendet, sind die gleichen Koeffizienten, die in dieser Dokumentation veröffentlicht sind, live gelesen: ändern sie sich, ändern sie sich hier zur selben Zeit.
Wenn etwas schiefgeht
Die Meldungen des Studios sind die Fehler der API in Klartext:
| Was es sagt | Was passiert ist |
|---|---|
| Ihre Sitzung ist abgelaufen. Laden Sie die Seite neu. | Die vorübergehende Berechtigung ist abgelaufen. Neu laden genügt; nichts geht verloren. |
| Ihre Credits für diesen Zeitraum sind aufgebraucht. | Sie erneuern sich zu Beginn Ihres nächsten Abrechnungszyklus, oder Sie können den Tarif wechseln. |
| Ihr Tarif enthält diesen Dienst nicht. | Wie die abgeschalteten Karten, aber vom Server aus gesehen. |
| Die Datei ist zu groß. | Über 150 MB oder über 2 Stunden. Siehe Größe und Dauer. |
| Der Dienst hat die Datei abgelehnt. | Das Audio lässt sich nicht dekodieren: meist eine unvollständige Datei oder eine, deren Erweiterung von Hand geändert wurde. |
| Zu viele Anfragen auf einmal. | Sie haben mehrere Karten parallel gestartet. Warten Sie ein paar Sekunden. |
Und wenn Sie möchten, dass all das von selbst geschieht, ohne dass jemand Dateien von Hand hochlädt, ist das die andere Tür: Uttera in Ihren Code integrieren.