UtteraUttera

Ce que vous pouvez faire avec Uttera, et où

Un moteur, deux portes. Une page web où le travail se fait sans écrire une ligne de code, qui vous attend dès que vous vous inscrivez. Et une API pour que votre propre logiciel le fasse tout seul, sans que personne n'ouvre un navigateur. Vous trouverez ci-dessous tout ce qu'elle peut faire, un paragraphe chacun, avec un lien vers son manuel.

Créer un compte gratuit Voir à quoi ça sert

Le Studio

Une page avec quatre onglets. Déposez un fichier ou collez du texte, appuyez sur le bouton, téléchargez le résultat. C'est ce que vous verrez en entrant.

Transcrire de l'audio

Téléversez un enregistrement, obtenez le texte. Il peut distinguer les locuteurs, ajouter des horodatages et, si vous le demandez, produire le résumé et l'analyse dans la même passe.

Comment l'utiliser →

Transformer du texte en parole

Collez un texte et écoutez-le. Neuf langues dans la voix standard et une trentaine dans la voix haute qualité, à la vitesse et dans le format que vous choisissez.

Comment l'utiliser →

Transformer du texte en voix clonée

Téléversez un court échantillon d'une voix et le texte est lu avec cette voix. Prévu pour vous doubler vous-même, pas pour usurper l'identité d'autrui : c'est interdit, et écrit noir sur blanc.

Comment l'utiliser →

Traduire ou transposer un enregistrement

Un enregistrement entre dans une langue et ressort dans une autre. Cochez la case qui conserve la voix d'origine et il ressort dit par cette même voix au lieu d'une voix de catalogue.

Comment l'utiliser →

Ce que cela coûtera, avant d'appuyer

Le Studio affiche l'estimation avant de lancer la tâche et le chiffre réel après, en crédits. Aucune surprise en fin de mois, parce qu'il n'y a pas de fin de mois : c'est sur le même écran.

Comment c'est calculé →

Et quand quelque chose ressort bizarre

Il y a de vraies limites —une phrase de trois mots se traduit moins bien qu'une de quinze, et le silence peut faire inventer le moteur— et elles sont écrites au lieu d'être découvertes par surprise.

Les limites →

Prononcer

La deuxième application, et volontairement étroite : trois étapes, sans options en travers. Même menu, même compte.

Vous écrivez dans votre langue

Écrivez la phrase que vous devez dire demain dans la langue que vous parlez déjà, et elle revient dans celle que vous apprenez, avec sa transcription phonétique en dessous.

Vous l'entendez

L'audio est généré quand vous le demandez, pas avant, à la vitesse dont vous avez besoin. Et vous pouvez le rejouer autant de fois que vous voulez sans le payer deux fois.

Vous le dites, et nous vous disons ce qui n'a pas marché

Enregistrez votre tentative et elle est comparée son par son à la bonne : ce que vous avez fait, ce que vous auriez dû faire, et dans quel mot. Si vous voulez aussi une explication en clair, un bouton la demande — et vous prévient que cela coûte plus avant de se lancer.

Comment ça marche en dessous, et ce que ça NE fait PAS →

Sons

La troisième application, et la première qui ne fonctionne pas avec la voix : vous décrivez un son avec des mots et le clip sort. Même menu, même compte.

Un son

« Une porte en bois qui claque ». C'est tout : vous choisissez la durée et il sort en WAV stéréo 48 kHz, la fréquence à laquelle travaille la vidéo.

Ou une scène entière

Vous décrivez ce qui se passe —« une moto s'arrête après huit secondes, le motard descend et marche vers la mer »— et c'est découpé en événements placés dans le temps. Vous voyez le plan, vous le corrigez, et ce n'est qu'ensuite qu'ils sont générés et mixés.

Deux étapes et non une parce que six événements sont six générations : les dépenser sur un plan qui n'était pas ce que vous vouliez, c'est les jeter.

Et vous pouvez le répéter

Chaque clip revient avec sa graine. La même description avec la même graine donne le même son, donc celui qui est bien sorti n'est pas perdu.

Comment ça marche, et ce que ça coûte →

Musique

La quatrième : vous décrivez la musique dont vous avez besoin et il en sort un morceau fini, jusqu'à six minutes et vingt secondes. Ce ne sont pas des boucles à assembler.

Vous la décrivez avec des mots

« Techno tribale africaine avec djembé et toms profonds, 128 BPM ». Nommer le style, les instruments et le tempo aide bien plus que demander « quelque chose d'entraînant ».

Deux réglages, et les deux comptent

La durée et la qualité. Les deux changent le coût, donc l'application vous montre les crédits avant de générer : bouger un réglage n'est jamais une surprise.

Et le morceau est construit entier pour la durée demandée — un morceau de trois minutes n'est pas un de trente secondes répété six fois.

Avec une licence claire

Ce que vous générez est à vous, avec un usage commercial à partir du plan Startup. Aucun catalogue à fouiller et aucune licence annuelle derrière.

Comment ça marche, et ce que ça coûte →

Et via l'API, pour que votre logiciel le fasse

Les services, sur un fichier audio ou un texte. Nous parlons le même dialecte que l'API d'OpenAI, donc dans bien des cas changer l'URL de base suffit.

Transcrire

Audio en entrée, texte en sortie. Avec séparation des locuteurs, horodatages, et l'option de demander le résumé et l'analyse dans la même requête, sans téléverser à nouveau le fichier.

Le endpoint →

Transformer du texte en parole

Trois types de voix, pas deux : standard, haute qualité, et clonée à partir d'un échantillon à vous. Et vous pouvez commencer à l'entendre pendant qu'elle est encore générée au lieu d'attendre le fichier entier.

Le endpoint →

Traduire

Texte à texte, ou un enregistrement entier d'une langue vers une autre. Et avec transposition : la traduction dite par la voix de l'enregistrement d'origine.

Le endpoint →

Analyser la voix

Combien chaque personne a parlé, sur quel ton, à quel rythme.

Avec une limite que nous nous imposons : ce sont des estimations acoustiques, elles se trompent, et elles ne doivent pas servir à prendre des décisions sur une personne. Elles sont là pour améliorer un processus, pas pour juger qui que ce soit.

Le endpoint →

Résumer un enregistrement

Une heure d'audio revient sous forme de ce qui a été convenu et ce qui reste en suspens, structuré pour que vous puissiez le mapper sur des champs.

Et vous payez moins votre LLM au passage : 15 410 tokens de transcription contre moins de 700 de résumé, mesurés sur un enregistrement réel.

Les chiffres →

Diagnostiquer une prononciation

Envoyez la phrase que quelqu'un voulait dire plus l'audio de la façon dont il l'a dite, et il renvoie quel son a été produit, lequel était attendu, et dans quel mot. C'est ce qui anime l'application ci-dessus, et c'est ouvert pour votre propre plateforme linguistique.

Comment c'est mesuré →

Une clé, et c'est tout

Inscrivez-vous, créez une clé, envoyez-la dans un en-tête. Une clé peut être restreinte à des adresses IP précises, de sorte qu'une clé fuitée ne sert à rien ailleurs.

Authentification →

Et si vous faites déjà tourner quelque chose

Il existe du code publié et testé pour les systèmes téléphoniques Asterisk, pour n8n et pour les agents IA. Ce ne sont pas des exemples jouets : ils sont en production.

Les connecteurs →

Ce que ça coûte pour commencer : rien

Un compte gratuit avec des crédits pour l'essayer, sans carte. Vous êtes facturé pour ce que vous consommez —par seconde d'audio, par caractère de texte—, pas par requête, et chaque réponse porte un en-tête indiquant exactement ce qui a été facturé.

Créer un compte gratuit Lire la documentation

Traité entièrement en Espagne · Nous ne conservons pas votre audio · Nous n'entraînons rien sur vos données · Open source