UtteraUttera

Ce qu'est Uttera

Uttera travaille avec l'audio. Vous lui donnez de la voix enregistrée et il vous rend du texte, une analyse ou davantage de voix ; vous lui donnez du texte et il vous rend de la parole, des effets sonores ou de la musique.

Il est conçu pour ce qui se passe après une conversation enregistrée — un appel, une réunion, un entretien, une note vocale : la transcrire, savoir qui a parlé et sur quel ton, la traduire ou la résumer. Ce n'est pas un traducteur de texte ni un lecteur de documents : l'audio est à l'une ou l'autre extrémité, toujours.

Et pour quiconque monte de la vidéo ou des podcasts, ce qui manque une fois la voix faite : des effets sonores et de la musique, décrits avec des mots et générés sur-le-champ. Avec une licence claire et aucun catalogue à fouiller.

Façons de l'utiliser

Vous n'avez pas besoin de savoir programmer pour utiliser Uttera. Il y a plusieurs portes, et la plupart des gens n'ont besoin que de la première :

Studio

Une application web TTS/STT. Vous téléversez un fichier, cochez ce que vous voulez et téléchargez le résultat. Rien à installer et pas une ligne de code. Comment l'utiliser.

Prononcer

La deuxième application web, et volontairement bien plus étroite : vous écrivez une phrase, l'entendez dans la langue que vous apprenez, et la dites vous-même pour que nous vous disions quel son n'a pas marché. Comment l'utiliser.

Sons

Décrivez un son et obtenez un clip ; décrivez une scène entière et obtenez-la découpée en événements que vous pouvez corriger avant de les générer. Comment l'utiliser.

Musique

Décrivez la musique dont vous avez besoin et obtenez un morceau fini, jusqu'à six minutes. Vous choisissez la durée et le niveau de qualité. Comment l'utiliser.

Auto-hébergé

Les moteurs vocaux sont open source et vivent sur GitHub : transcrire et parler, chacun en deux variantes. Vous les téléchargez, les faites tourner sur votre propre machine et l'audio ne quitte jamais votre réseau. C'est le moteur, pas la plateforme : les applications et les autres services vivent ici.

L'API

Pour que votre propre logiciel parle au nôtre : mettre Uttera à l'intérieur de votre système téléphonique, de votre CRM ou de votre application, pour que le travail se fasse tout seul, sans que personne ne téléverse de fichiers à la main. Comment l'utiliser.

Vous travaillez avec un agent IA ? Vous n'avez pas besoin de lire ceci et de le lui transmettre. Dites-lui read https://uttera.ai/skill.md and follow the instructions et il se configure : il vérifie votre clé, apprend les endpoints et vous avertit de ce que coûtent les choses. Il ne peut pas vous inscrire —cela vous revient, délibérément— mais il peut tout préparer avec une clé que vous avez déjà.

Les applications et l'API font exactement la même chose et coûtent exactement le même prix : aucune d'elles n'est une version allégée ou une démo, ce sont la même machine avec un bouton devant. La seule différence est qui appuie sur le bouton — une personne ou un programme.

Si vous voulez voir d'un coup d'œil ce qui se trouve derrière chaque porte, c'est présenté dans ce que vous pouvez faire avec Uttera.

Qu'est-ce qu'une API ?

API signifie Application Programming Interface (interface de programmation d'applications). Sans le jargon : c'est la porte par laquelle un programme demande quelque chose à un autre programme.

La comparaison qui marche le mieux est un restaurant. Vous n'entrez pas dans la cuisine : vous dites au serveur ce que vous voulez, il l'apporte à l'intérieur et revient avec le plat. Vous n'avez pas besoin de savoir comment la cuisine est agencée, quel four ils utilisent, ni combien il y a de cuisiniers. Vous n'avez besoin de savoir que ce que vous pouvez commander et comment le commander. L'API est le serveur, et cette documentation est le menu.

En pratique, un de vos programmes envoie un fichier audio sur internet à une de nos adresses, avec une clé qui dit qui vous êtes, et récupère le résultat. Rien n'est installé sur votre ordinateur : le travail se fait sur nos machines et seuls la requête et la réponse voyagent.

Si vous n'allez jamais écrire de code, vous pouvez sauter tout ce qui concerne l'API et aller directement au Studio. Cette documentation décrit les deux portes, mais la première ne requiert rien de technique.

Le nom

Uttera /ˈʌt.ər.ə/ vient du verbe anglais to utter : prononcer, dire à voix haute, donner une expression audible à quelque chose.

Formellement, c'est aussi un rétroacronyme de Universal Text Transformer Engine for Realtime Audio, qui capture son origine — un serveur de reconnaissance et de synthèse vocale — et l'architecture Transformer sur laquelle il est bâti.

Ce qu'il peut faire

Transcrire

Audio → texte, avec détection automatique de la langue.

Synthèse vocale

Texte → audio, depuis un catalogue de voix.

Traduire

Audio dans une langue → texte et parole dans une autre.

Analyser la voix

Ton et profil du locuteur : âge apparent, accent, humeur.

Savoir qui parle

Qui dit quoi, et à quelle minute. Une réunion de six revient répartie par locuteur.

Résumer

Un enregistrement entier → résumé structuré.

Effets sonores

Texte → un clip, ou une scène entière disposée dans le temps.

Musique

Texte → un morceau fini, jusqu'à 6 min 20 s.

Rapport signé

Un enregistrement → un PDF qu'un tiers peut vérifier seul, sans nous croire sur parole.

Concepts

Crédits

Tout est facturé en crédits. Un crédit, c'est une seconde de temps GPU, et chaque service a son coefficient selon ce qu'il consomme réellement. Il n'y a ni frais par requête ni minimums : vous payez à la seconde d'audio traité ou généré.

Votre plan vous donne un quota mensuel de crédits qui se renouvelle à votre date d'abonnement, non le 1er du mois. Ce que vous ne dépensez pas ne se reporte pas.

Voix

Il y a deux familles. Les voix standard sont un catalogue fixe, rapide et économique. La voix clonée reproduit un timbre particulier à partir d'un échantillon, coûte environ 19 fois plus cher par seconde, et n'est pas dans tous les plans.

Durée, pas taille

La facturation se fait par secondes d'audio, non par mégaoctets. La même minute de parole coûte le même prix en WAV qu'en MP3, même si le fichier est vingt fois plus lourd.

Votre première requête

Vous avez besoin d'une clé. Vous la créez dans votre compte ; elle commence par sk-echo- et n'est affichée qu'une seule fois.

curl -X POST https://api.uttera.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $UTTERA_API_KEY" \
  -F file=@recording.mp3 \
  -F model=whisper-1 \
  -F response_format=text

Réponse :

Bonjour, j'appelais au sujet de la commande de la semaine dernière...
Astuce : si vous préférez ne pas encore écrire de code, le Studio lance les services depuis votre navigateur et vous montre ce que chacun coûte avant et après son lancement.