Was Uttera ist
Uttera arbeitet mit Audio. Sie geben ihm aufgezeichnete Stimme und es liefert Text, Analyse oder mehr Stimme zurück; Sie geben ihm Text und es liefert Sprache, Klangeffekte oder Musik zurück.
Es ist gebaut für das, was nach einem aufgezeichneten Gespräch geschieht — ein Anruf, eine Besprechung, ein Interview, eine Sprachnachricht: es zu transkribieren, zu wissen, wer sprach und in welchem Ton, es zu übersetzen oder zusammenzufassen. Es ist kein Textübersetzer und kein Dokumentenleser: am einen oder anderen Ende steht immer Audio.
Und für alle, die Video oder Podcasts schneiden, das, was fehlt, sobald die Stimme fertig ist: Klangeffekte und Musik, in Worten beschrieben und auf der Stelle erzeugt. Mit einer klaren Lizenz und ohne einen Katalog zu durchwühlen.
Wege der Nutzung
Sie müssen nicht programmieren können, um Uttera zu nutzen. Es gibt mehrere Türen, und die meisten Menschen brauchen nur die erste:
Studio
Eine Web-Anwendung für TTS/STT. Sie laden eine Datei hoch, haken an, was Sie möchten, und laden das Ergebnis herunter. Nichts zu installieren und keine Zeile Code. Wie Sie es nutzen.
Aussprache
Die zweite Web-Anwendung, und bewusst viel enger gefasst: Sie schreiben einen Satz, hören ihn in der Sprache, die Sie lernen, und sprechen ihn selbst aus, damit wir Ihnen sagen können, welcher Laut danebenging. Wie Sie es nutzen.
Klänge
Beschreiben Sie einen Klang und Sie bekommen einen Clip; beschreiben Sie eine ganze Szene und Sie bekommen sie in Ereignisse aufgeteilt, die Sie vor dem Erzeugen korrigieren können. Wie Sie es nutzen.
Musik
Beschreiben Sie die Musik, die Sie brauchen, und Sie bekommen ein fertiges Stück, bis zu sechs Minuten lang. Sie wählen, wie lange es läuft und wie viel Qualität Sie möchten. Wie Sie es nutzen.
Selbst gehostet
Die Sprach-Engines sind Open Source und liegen auf GitHub: Transkribieren und Sprechen, jeweils in zwei Varianten. Sie laden sie herunter, betreiben sie auf Ihrer eigenen Maschine und das Audio verlässt nie Ihr Netz. Es ist die Engine, nicht die Plattform: die Anwendungen und die übrigen Dienste liegen hier.
Die API
Damit Ihre eigene Software mit unserer sprechen kann: Uttera in Ihre Telefonanlage, Ihr CRM oder Ihre Anwendung einsetzen, sodass die Arbeit von selbst geschieht, ohne dass jemand Dateien von Hand hochlädt. Wie Sie es nutzen.
read https://uttera.ai/skill.md and follow the
instructions und er richtet sich selbst ein: prüft Ihren Schlüssel, lernt die Endpunkte und warnt
Sie, was die Dinge kosten. Er kann Sie nicht anmelden — das liegt bei Ihnen, bewusst so — aber er
kann alles mit einem Schlüssel bereitstellen, den Sie bereits haben.Die Anwendungen und die API tun genau dasselbe und kosten genau dasselbe: keine davon ist eine abgespeckte Version oder eine Demo, es ist dieselbe Maschine mit einem Knopf davor. Der einzige Unterschied ist, wer den Knopf drückt — ein Mensch oder ein Programm.
Wenn Sie auf einen Blick sehen möchten, was sich hinter jeder Tür verbirgt, ist es dargestellt in was Sie mit Uttera tun können.
Was ist eine API?
API steht für Application Programming Interface. Ohne Fachjargon: es ist die Tür, durch die ein Programm ein anderes Programm um etwas bittet.
Der Vergleich, der am besten passt, ist ein Restaurant. Sie gehen nicht in die Küche: Sie sagen dem Kellner, was Sie möchten, er trägt es hinein und kommt mit dem Gericht zurück. Sie müssen nicht wissen, wie die Küche aufgebaut ist, welchen Ofen sie verwenden oder wie viele Köche es gibt. Sie müssen nur wissen, was Sie bestellen können und wie Sie es bestellen. Die API ist der Kellner, und diese Dokumentation ist die Speisekarte.
In der Praxis schickt ein Programm von Ihnen eine Audiodatei über das Internet an eine Adresse von uns, zusammen mit einem Schlüssel, der sagt, wer Sie sind, und bekommt das Ergebnis zurück. Nichts wird auf Ihrem Rechner installiert: die Arbeit geschieht auf unseren Maschinen und nur die Anfrage und die Antwort reisen.
Der Name
Uttera /ˈʌt.ər.ə/ kommt vom englischen Verb to utter: aussprechen, laut sagen, etwas hörbaren Ausdruck geben.
Formal ist es außerdem ein Backronym von Universal Text Transformer Engine for Realtime Audio, das seinen Ursprung erfasst — ein Speech-to-Text- und Text-to-Speech-Server — und die Transformer-Architektur, auf der es aufbaut.
Was es kann
Transkribieren
Audio → Text, mit automatischer Spracherkennung.
Text zu Sprache
Text → Audio, aus einem Stimmenkatalog.
Übersetzen
Audio in einer Sprache → Text und Sprache in einer anderen.
Die Stimme analysieren
Ton und Sprecherprofil: geschätztes Alter, Akzent, Stimmung.
Wissen, wer spricht
Wer was sagt und in welcher Minute. Eine Besprechung mit sechs Personen kommt nach Sprecher aufgeteilt zurück.
Zusammenfassen
Eine ganze Aufnahme → strukturierte Zusammenfassung.
Klangeffekte
Text → ein Clip, oder eine ganze zeitlich angeordnete Szene.
Musik
Text → ein fertiges Stück, bis zu 6 Min. 20 Sek.
Signierter Bericht
Eine Aufnahme → ein PDF, das ein Dritter selbst verifizieren kann, ohne uns beim Wort nehmen zu müssen.
Konzepte
Credits
Alles wird in Credits abgerechnet. Ein Credit ist eine Sekunde GPU-Zeit, und jeder Dienst hat seinen Koeffizienten je nach dem, was er tatsächlich verbraucht. Es gibt keine Gebühren pro Anfrage und keine Mindestbeträge: Sie zahlen pro Sekunde verarbeiteten oder erzeugten Audios.
Ihr Tarif gibt Ihnen ein monatliches Kontingent an Credits, das sich zu Ihrem Abo-Datum erneuert, nicht am 1. des Monats. Was Sie nicht ausgeben, wird nicht übertragen.
Stimmen
Es gibt zwei Familien. Die Standardstimmen sind ein fester Katalog, schnell und günstig. Die geklonte Stimme gibt eine bestimmte Klangfarbe aus einem Muster wieder, kostet pro Sekunde etwa 19-mal mehr und ist nicht in jedem Tarif enthalten.
Dauer, nicht Größe
Die Abrechnung erfolgt nach Sekunden Audio, nicht nach Megabyte. Dieselbe Minute Sprache kostet als WAV genauso viel wie als MP3, auch wenn die Datei zwanzigmal schwerer ist.
Ihre erste Anfrage
Sie brauchen einen Schlüssel. Sie erstellen ihn in Ihrem Konto; er
beginnt mit sk-echo- und wird nur einmal angezeigt.
curl -X POST https://api.uttera.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $UTTERA_API_KEY" \
-F file=@recording.mp3 \
-F model=whisper-1 \
-F response_format=text
Antwort:
Good morning, I was calling about last week's order...