UtteraUttera

Aussprache

Eine vom Studio getrennte Seite, unter app.uttera.ai/de/pronounce, für alle, die eine Sprache lernen. Keine Formate, kein Stimmenkatalog nach Namen, kein Kostenschätzer: wer Deutsch lernt, möchte nicht zwischen opus und flac wählen.

Uttera kommt von to utter: aussprechen, laut sagen. Das ist dieser Teil des Namens.

Es löst ein Problem, das Lern-Apps nicht anfassen: sie lassen einen nur ihre eigenen Inhalte hören. Sie können ihre Lektion wiederholen, aber Sie können sie nicht fragen, wie der Satz, den Sie morgen sagen müssen, klingt. Hier schreiben Sie diesen Satz.

Die drei Schritte

SchrittWas geschieht
1. Schreiben Sie ihn in Ihrer eigenen SpracheDie Seite ist in Ihrer Sprache und Sie schreiben in Ihrer. Sie wählen, in welcher Sie ihn sagen lernen möchten. Bis zu 300 Zeichen: ein Satz, kein Text.
2. So sagen Sie esDer Satz erscheint in der Sprache, die Sie lernen, zusammen mit seiner Lautschrift. Dort halten Sie inne und lesen. Das Audio wird gesondert erzeugt, wenn Sie es möchten und in der Geschwindigkeit, die Sie wählen: den Satz zu lesen ist kostenlos, ihn zu erzeugen nicht, und für Audio von etwas zu bezahlen, das Sie noch nicht gelesen haben, ergibt keinen Sinn.
3. Jetzt sagen Sie es selbstSie nehmen sich selbst auf — Browser-Mikrofon oder Datei — und wir geben Ihnen zurück, was wir verstanden haben, und markieren Wort für Wort, was herauskam und was nicht.
Was der dritte Schritt Ihnen gibt, ist ein Spiegel, keine Note. Wenn Sie “rojo” geschrieben haben und das Transkript “rojo” sagt, haben Sie es erkennbar gesagt. Wenn es “rollo” sagt, wissen Sie nun, welcher Laut Ihnen misslingt. Es gibt keine Punktzahl, und das ist bewusst so: zum Lernen schlägt ein ehrlicher Spiegel eine Zahl.

Was es kostet

Es gibt vorab keine Schätzung, mit Absicht: wer übt, bewertet keinen Dienst, und eine Zahl vor jedem Satz wäre Lärm. Nach jedem Vorgang sagen wir, was er tatsächlich gekostet hat. Ein voller Zyklus — übersetzen, hören und sich selbst prüfen — sind rund 0,17 Credits für einen gewöhnlichen Satz.

Die Grenzen, offen gesagt

“Warum versteht es mich nicht?”: die KI-Analyse

Die drei Schritte geben Ihnen einen Spiegel: welche Wörter herauskamen und welche nicht. Wenn das nicht genügt — Sie wissen, dass etwas nicht stimmt, aber nicht was — vergleicht ein separater Knopf Laut für Laut, was Sie gesagt haben, mit dem, was es sein sollte, und erklärt es.

Es verwendet keine gewöhnliche Spracherkennung, und der Grund ist wichtig: die ist gebaut, um Sie zu verstehen, nicht um Sie zu messen. Sie korrigiert Ihre Aussprache hin zu dem Wort, das sie meint, Sie hätten gemeint, was genau der Fehler ist, den wir hier sehen wollen. Die Analyse verwendet einen Phonem- Erkenner, der schreibt, was er hört, auch wenn es kein Wort ist, und vergleicht diese Zeichenkette mit der, die hätte klingen sollen.

Was Sie zurückbekommen: den Prozentsatz der richtig herausgekommenen Laute, die Liste jener, die es nicht taten — Sie machten [s], wo [θ] sein sollte, und in welchen Wörtern —, die schriftliche Erklärung, und beide Lautschriften für alle, die sie lesen können.

Es kostet erheblich mehr als der Rest, weshalb Sie es anfordern, statt es automatisch zu bekommen. Der Wortspiegel kostet Cent-Bruchteile eines Credits; dies sind rund 3, weil Ihre Aufnahme phonemisiert und die Erklärung mit einem Sprach- modell verfasst werden muss. Es wird Ihnen vorher gesagt, und Sie können ablehnen. Die genaue Abrechnung erscheint danach, wie bei allem anderen.

Die Idee ist, dass Sie viele Male für fast nichts üben und die Analyse anfordern, wenn Sie wissen möchten, was Sie falsch machen, nicht bei jeder Wiederholung.

Wenn die Aufnahme nicht wie der Satz klingt, wird sie nicht analysiert. Das kommt häufiger vor, als man denkt: das falsche Mikrofon, das den Fernseher aufnimmt, oder die Systemmischung. In dem Fall sagen wir es Ihnen und die Analyse wird nicht berechnet, statt Laut für Laut eine Nichtübereinstimmung zu erklären, die nichts bedeutet.
Was das NICHT ist.

Es ist keine Note und keine Prüfung: es ist ein Vergleich zwischen zwei Lautketten. Und die Erklärung wird aus diesem Vergleich von einem Sprachmodell verfasst — es entscheidet nicht, was falsch ist, das wird vorher berechnet — also lesen Sie sie als das, was sie ist: Hilfe beim Verstehen der Daten, kein Urteil.

Es ersetzt auch keinen Lehrer. Für den Klang eines gewöhnlichen Satzes ist es mehr als genug; um einen Prüfungsvokal zu schleifen, ist ein Lehrer weiterhin ein Lehrer.

Was Sie hochladen, wird transkribiert und gelöscht: sich beim Üben aufzunehmen ist genau die Art von Audio, das in niemandes Archiv liegen sollte — Datenschutz.

Über die API

POST /v1/pronunciation — multipart, wie beim Transkribieren. Gibt JSON zurück.

FeldTypWas es ist
filefileErforderlich. Der Lernende, der den Satz liest. Jedes gängige Format; bis zu 1 MB, was für ein paar Sekunden Sprache reichlich ist.
texttextErforderlich. Der Satz, den er hätte sagen sollen. Er ist die Referenz, mit der das Audio verglichen wird, kein Transkript.
languagetextStandardwert es. Eines von: es, es-419, en, en-gb, fr, it, pt, pt-br, de, nl, ru, pl, el, tr, ar, ja, zh, hi, ko, sv, da, nb, fi. Alles andere gibt 422 mit der Liste zurück.
explaintext"true" als Standard. Mit "false" erhalten Sie die phonetische Diagnose ohne die schriftliche Erklärung — und es kostet weit weniger, weil die Erklärung das ist, was das Sprachmodell aufruft.
curl -X POST https://api.uttera.ai/v1/pronunciation \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -F "file=@sentence.mp3" \
  -F "text=El perro de San Roque no tiene rabo." \
  -F "language=es"

Die Antwort, genau wie sie herauskommt:

{
  "text": "El perro de San Roque no tiene rabo.",
  "language": "es",
  "duration_s": 2.625,
  "target_ipa": "e l p e r o ð e s a n r o k e n o t j e n e r a β o",
  "heard_ipa":  "e l p e r o ð e s a n r o k e n o t i n e r a b o",
  "accuracy": 0.9231,
  "errors": [
    {"type": "missing", "expected": "j", "heard": null,
     "times": 1, "words": ["tiene"]},
    {"type": "substitution", "expected": "e", "heard": "i",
     "times": 1, "words": ["tiene"]}
  ],
  "recognised": true,
  "suppressed": 1,
  "explanation": "En la palabra \"tiene\"…",
  "timing_ms": {"phonetics": 5567.0, "llm": 18069.4, "total": 23640.1}
}
FeldWas es ist
target_ipa / heard_ipaDie Laute, die hätten da sein sollen, und die, die da waren, im internationalen phonetischen Alphabet. Sie zu vergleichen ist die ganze Analyse.
accuracyÜbereinstimmende Laute geteilt durch erwartete, 0 bis 1. Es ist keine Note: es ist, wie viel von dem, was hätte klingen sollen, klang.
errorsDie Fehler nach Laut gruppiert, mit den Wörtern, in denen sie auftauchen. type ist missing, extra oder substitution.
recognisedfalse, wenn das Aufgenommene nicht der Satz ist — falsches Mikrofon, eine andere Aufnahme, eine andere Sprache. Dann kommt errors leer zurück und es gibt keine Erklärung: jemanden feiner Fehler zu bezichtigen, wenn er etwas ganz anderes gesagt hat, ist schlimmer als nichts zu sagen.
suppressedVerwechslungen, die abgezogen wurden, weil sie ein Artefakt des Analysators sind und nicht die Schuld des Lernenden. Sie werden gemessen, indem der Satz, korrekt gesprochen, mit unserer eigenen Stimme synthetisiert wird.
explanationDie Erklärung in der analysierten Sprache, oder null, wenn Sie explain=false angefordert haben oder der Satz nicht erkannt wurde.

Die Kosten folgen der tatsächlichen Arbeit, keinem Pauschaltarif: der Header X-Work-Ms sagt, wie viel Arbeit hineinging, und GET /v1/usage/last, was es kostete. Am obigen Beispiel gemessen — 2,6 s Audio, mit Erklärung — 60,9 Credits; ohne die Erklärung verschwindet das meiste davon, weil das Sprachmodell das ist, was kostet.