UtteraUttera

Was Uttera ist

Uttera arbeitet mit Audio. Sie geben ihm aufgezeichnete Stimme und es liefert Text, Analyse oder mehr Stimme zurück; Sie geben ihm Text und es liefert Sprache, Klangeffekte oder Musik zurück.

Es ist gebaut für das, was nach einem aufgezeichneten Gespräch geschieht — ein Anruf, eine Besprechung, ein Interview, eine Sprachnachricht: es zu transkribieren, zu wissen, wer sprach und in welchem Ton, es zu übersetzen oder zusammenzufassen. Es ist kein Textübersetzer und kein Dokumentenleser: am einen oder anderen Ende steht immer Audio.

Und für alle, die Video oder Podcasts schneiden, das, was fehlt, sobald die Stimme fertig ist: Klangeffekte und Musik, in Worten beschrieben und auf der Stelle erzeugt. Mit einer klaren Lizenz und ohne einen Katalog zu durchwühlen.

Wege der Nutzung

Sie müssen nicht programmieren können, um Uttera zu nutzen. Es gibt mehrere Türen, und die meisten Menschen brauchen nur die erste:

Studio

Eine Web-Anwendung für TTS/STT. Sie laden eine Datei hoch, haken an, was Sie möchten, und laden das Ergebnis herunter. Nichts zu installieren und keine Zeile Code. Wie Sie es nutzen.

Aussprache

Die zweite Web-Anwendung, und bewusst viel enger gefasst: Sie schreiben einen Satz, hören ihn in der Sprache, die Sie lernen, und sprechen ihn selbst aus, damit wir Ihnen sagen können, welcher Laut danebenging. Wie Sie es nutzen.

Klänge

Beschreiben Sie einen Klang und Sie bekommen einen Clip; beschreiben Sie eine ganze Szene und Sie bekommen sie in Ereignisse aufgeteilt, die Sie vor dem Erzeugen korrigieren können. Wie Sie es nutzen.

Musik

Beschreiben Sie die Musik, die Sie brauchen, und Sie bekommen ein fertiges Stück, bis zu sechs Minuten lang. Sie wählen, wie lange es läuft und wie viel Qualität Sie möchten. Wie Sie es nutzen.

Selbst gehostet

Die Sprach-Engines sind Open Source und liegen auf GitHub: Transkribieren und Sprechen, jeweils in zwei Varianten. Sie laden sie herunter, betreiben sie auf Ihrer eigenen Maschine und das Audio verlässt nie Ihr Netz. Es ist die Engine, nicht die Plattform: die Anwendungen und die übrigen Dienste liegen hier.

Die API

Damit Ihre eigene Software mit unserer sprechen kann: Uttera in Ihre Telefonanlage, Ihr CRM oder Ihre Anwendung einsetzen, sodass die Arbeit von selbst geschieht, ohne dass jemand Dateien von Hand hochlädt. Wie Sie es nutzen.

Arbeiten Sie mit einem KI-Agenten? Sie müssen dies nicht lesen und weitergeben. Sagen Sie ihm read https://uttera.ai/skill.md and follow the instructions und er richtet sich selbst ein: prüft Ihren Schlüssel, lernt die Endpunkte und warnt Sie, was die Dinge kosten. Er kann Sie nicht anmelden — das liegt bei Ihnen, bewusst so — aber er kann alles mit einem Schlüssel bereitstellen, den Sie bereits haben.

Die Anwendungen und die API tun genau dasselbe und kosten genau dasselbe: keine davon ist eine abgespeckte Version oder eine Demo, es ist dieselbe Maschine mit einem Knopf davor. Der einzige Unterschied ist, wer den Knopf drückt — ein Mensch oder ein Programm.

Wenn Sie auf einen Blick sehen möchten, was sich hinter jeder Tür verbirgt, ist es dargestellt in was Sie mit Uttera tun können.

Was ist eine API?

API steht für Application Programming Interface. Ohne Fachjargon: es ist die Tür, durch die ein Programm ein anderes Programm um etwas bittet.

Der Vergleich, der am besten passt, ist ein Restaurant. Sie gehen nicht in die Küche: Sie sagen dem Kellner, was Sie möchten, er trägt es hinein und kommt mit dem Gericht zurück. Sie müssen nicht wissen, wie die Küche aufgebaut ist, welchen Ofen sie verwenden oder wie viele Köche es gibt. Sie müssen nur wissen, was Sie bestellen können und wie Sie es bestellen. Die API ist der Kellner, und diese Dokumentation ist die Speisekarte.

In der Praxis schickt ein Programm von Ihnen eine Audiodatei über das Internet an eine Adresse von uns, zusammen mit einem Schlüssel, der sagt, wer Sie sind, und bekommt das Ergebnis zurück. Nichts wird auf Ihrem Rechner installiert: die Arbeit geschieht auf unseren Maschinen und nur die Anfrage und die Antwort reisen.

Wenn Sie nie Code schreiben werden, können Sie alles zur API überspringen und direkt zum Studio gehen. Diese Dokumentation beschreibt beide Türen, aber die erste erfordert nichts Technisches.

Der Name

Uttera /ˈʌt.ər.ə/ kommt vom englischen Verb to utter: aussprechen, laut sagen, etwas hörbaren Ausdruck geben.

Formal ist es außerdem ein Backronym von Universal Text Transformer Engine for Realtime Audio, das seinen Ursprung erfasst — ein Speech-to-Text- und Text-to-Speech-Server — und die Transformer-Architektur, auf der es aufbaut.

Was es kann

Transkribieren

Audio → Text, mit automatischer Spracherkennung.

Text zu Sprache

Text → Audio, aus einem Stimmenkatalog.

Übersetzen

Audio in einer Sprache → Text und Sprache in einer anderen.

Die Stimme analysieren

Ton und Sprecherprofil: geschätztes Alter, Akzent, Stimmung.

Wissen, wer spricht

Wer was sagt und in welcher Minute. Eine Besprechung mit sechs Personen kommt nach Sprecher aufgeteilt zurück.

Zusammenfassen

Eine ganze Aufnahme → strukturierte Zusammenfassung.

Klangeffekte

Text → ein Clip, oder eine ganze zeitlich angeordnete Szene.

Musik

Text → ein fertiges Stück, bis zu 6 Min. 20 Sek.

Signierter Bericht

Eine Aufnahme → ein PDF, das ein Dritter selbst verifizieren kann, ohne uns beim Wort nehmen zu müssen.

Konzepte

Credits

Alles wird in Credits abgerechnet. Ein Credit ist eine Sekunde GPU-Zeit, und jeder Dienst hat seinen Koeffizienten je nach dem, was er tatsächlich verbraucht. Es gibt keine Gebühren pro Anfrage und keine Mindestbeträge: Sie zahlen pro Sekunde verarbeiteten oder erzeugten Audios.

Ihr Tarif gibt Ihnen ein monatliches Kontingent an Credits, das sich zu Ihrem Abo-Datum erneuert, nicht am 1. des Monats. Was Sie nicht ausgeben, wird nicht übertragen.

Stimmen

Es gibt zwei Familien. Die Standardstimmen sind ein fester Katalog, schnell und günstig. Die geklonte Stimme gibt eine bestimmte Klangfarbe aus einem Muster wieder, kostet pro Sekunde etwa 19-mal mehr und ist nicht in jedem Tarif enthalten.

Dauer, nicht Größe

Die Abrechnung erfolgt nach Sekunden Audio, nicht nach Megabyte. Dieselbe Minute Sprache kostet als WAV genauso viel wie als MP3, auch wenn die Datei zwanzigmal schwerer ist.

Ihre erste Anfrage

Sie brauchen einen Schlüssel. Sie erstellen ihn in Ihrem Konto; er beginnt mit sk-echo- und wird nur einmal angezeigt.

curl -X POST https://api.uttera.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -F file=@recording.mp3 \
  -F model=whisper-1 \
  -F response_format=text

Antwort:

Good morning, I was calling about last week's order...
Tipp: Wenn Sie noch keinen Code schreiben möchten, führt das Studio die Dienste aus Ihrem Browser aus und zeigt Ihnen, was jeder kostet, bevor und nachdem Sie ihn starten.