Ce qu'est le Studio
Le Studio est l'application web d'Uttera : une page où vous téléversez un fichier ou collez du texte, cochez ce que vous voulez et téléchargez le résultat. Rien à installer, aucune clé à demander, et pas une ligne de code à écrire.
En dessous, c'est exactement le même service que décrit le reste de cette documentation. Le Studio n'est pas une démo aux limites rognées : il appelle la même API, sur votre même plan, et dépense des crédits de votre même quota. Quand cette documentation dit que transcrire coûte tant par seconde, cela coûte le même prix par les deux portes.
Pour y entrer, il vous faut un compte et une session active. Si vous n'en avez pas, le Studio vous renvoie vers la page d'accueil. L'en-tête de la page vous rappelle avec quel e-mail vous vous êtes connecté et sur quel plan vous êtes, parce que ce que vous pouvez faire en dépend.
Comment l'écran est organisé
Il y a quatre cartes, une par tâche :
| Carte | Ce qu'elle fait | Équivalent à |
|---|---|---|
| Transcrire de l'audio | Enregistrement → texte, avec analyse et résumé optionnels | /v1/audio/transcriptions · /v1/summarize |
| Texte en voix numérique | Texte → audio avec une voix du catalogue | /v1/audio/speech |
| Texte en voix clonée | Texte → audio avec une voix que vous fournissez | /v1/audio/speech |
| Traduire un enregistrement | Enregistrement → texte et parole dans une autre langue | /v1/translate |
Si votre plan n'inclut pas quelque chose, la carte est quand même là mais désactivée, grisée et sans bouton, indiquant quel plan il vous faudrait. C'est affiché à dessein : mieux vaut voir ce qui existe et ce que cela coûte que de le découvrir par une erreur. Il se passe la même chose à l'intérieur de Transcrire avec les cases d'analyse et de résumé, qui se désactivent individuellement sans retirer la transcription.
Toutes les cartes fonctionnent de la même façon, de haut en bas :
- Les champs. Le fichier ou le texte, et les options de cette tâche.
- La ligne de coût. Elle apparaît dès que vous choisissez un fichier et dit ce que cela va coûter, avant de dépenser quoi que ce soit.
- Le bouton Lancer.
- Le résultat. Pendant qu'il travaille, vous verrez le logo Uttera animé et un compteur de secondes, pour que vous sachiez qu'il est toujours en vie ; un audio long prend du temps. Quand il termine, le logo s'immobilise et le compteur devient la durée que cela a pris.
Transcrire de l'audio
La carte la plus complète : elle transcrit, et au passage elle peut analyser et résumer.
- Choisissez le fichier. Elle accepte
wav,mp3,flac,ogg,opus,aiff,m4aetwebm. Jusqu'à 150 Mo et 2 heures d'audio. - Cochez les extras que vous voulez (chacun a son prix et est facturé séparément) :
Case Ce qu'elle ajoute ton L'émotion dominante de l'enregistrement, avec sa confiance et les autres candidats. profil du locuteur Tranche d'âge et genre estimés à partir de la voix. qui parle et quand Tours de parole avec horodatages par locuteur. résumé de l'enregistrement Un résumé structuré de ce qui a été dit. - Lancer. Le fichier est téléversé une seule fois même si vous cochez les quatre : l'analyse est répartie en interne sur l'audio déjà téléversé.
Le résultat est toujours présenté dans cet ordre :
- La transcription, et en dessous le ton sous forme d'une ligne en prose si vous
l'avez demandé, avec le bouton Télécharger le texte
(
transcripcion.txt) qui clôt le bloc. - Le résumé, si vous l'avez demandé, avec Télécharger le résumé
(
resumen.txt). Il vient après le texte à dessein : un résumé est plus facile à suivre avec la transcription sous les yeux, et la transcription est ce qui est toujours là. - Le profil et qui parle et quand, bruts. Ce sont des données structurées et quiconque les demande les veut entières, non rédigées.
- Télécharger l'analyse (
analisis.json) : un seul fichier avec tout ce qui a été analysé — y compris le vecteur de ton complet — non un par section. - La ligne de facturation, qui clôt l'opération.
/v1/summarize, qui transcrit de lui-même et analyse
aussi. C'est pourquoi l'audio n'est pas transcrit deux fois, et pourquoi les trois cases d'analyse
signifient la même chose avec ou sans le résumé coché.Si une analyse particulière échoue, c'est dit : la transcription est quand même livrée et en dessous apparaît quelle partie n'a pas pu être faite. Ce n'est ni caché ni inventé.
Texte en voix numérique
Écrivez ou collez un texte et choisissez comment vous voulez l'entendre.
| Champ | Ce qu'il fait |
|---|---|
| Texte | Ce qui doit être dit. |
| Voix | Le catalogue est chargé depuis l'API à l'ouverture de la page, avec la langue devant chaque nom. La langue ne se choisit pas séparément : la voix la porte. Un sélecteur de langue autonome se lirait comme s'il traduisait, et cette carte ne traduit pas. |
| Vitesse | De lent (0,8) à très rapide (1,5). Elle change la durée de l'audio et, comme la parole est facturée à la seconde générée, le prix aussi : lire à 1,25 coûte environ 20 % de moins qu'à 1,0. |
| Format audio | mp3 · wav · opus · flac · pcm |
Le résultat est un lecteur, la ligne de facturation et Télécharger l'audio
(voz.mp3, ou l'extension que vous avez choisie).
pcm, vous n'obtiendrez pas un lecteur normal
mais un bouton ▶ Lire. pcm est de l'audio brut sans en-tête : le navigateur ne sait
pas à quelle fréquence d'échantillonnage il est et ne peut pas le lire seul, mais le Studio le sait et
le décode. Le fichier que vous téléchargez vous demandera d'indiquer ces paramètres au programme avec
lequel vous l'ouvrez — ils sont dans Formats.Texte en voix clonée
Comme la précédente, mais vous fournissez la voix : vous téléversez un échantillon et le texte est lu avec.
| Champ | Ce qu'il fait |
|---|---|
| Texte | Ce qui doit être dit. |
| Échantillon de voix | Un fichier audio de la voix à imiter, dans l'un des formats d'entrée. |
| Vitesse et Format | Comme dans la voix numérique. |
L'échantillon n'est pas facturé. Ce qui est facturé, c'est l'audio généré, qui dépend de la
longueur du texte, non de la durée de l'échantillon. Le clonage prend nettement plus de temps que la
voix numérique : la carte vous en avertit pendant qu'elle travaille. Le téléchargement sort sous
voz-clonada.mp3.
Traduire un enregistrement
Toute la chaîne en une étape : elle transcrit l'audio, traduit le texte et le redit dans la langue cible.
| Champ | Ce qu'il fait |
|---|---|
| Fichier | L'enregistrement source. La langue source est détectée d'elle-même. |
| Langue cible | Seules les langues qui ont une voix apparaissent. Nous traduisons vers bien d'autres, mais ici il faut la dire à voix haute. |
| Voix | Depuis le catalogue standard. Elle s'ajuste à la langue cible quand vous la changez : une voix espagnole lisant la traduction anglaise sonne comme un étranger lisant à voix haute. |
| Parler avec la voix d'origine | Transpose : au lieu d'une de nos voix, la traduction est dite avec la voix de la personne dans l'enregistrement, clonée à partir d'elle. Cela désactive le sélecteur de voix, parce que cela le remplace. Requiert un plan payant, et le coût estimé augmente dès que vous le cochez : une seconde de voix clonée vaut environ 19 fois une seconde de voix standard. |
| Vitesse | Comme dans la voix numérique, avec le même effet sur le prix. |
| Texte et audio / texte seul | Si vous n'avez pas besoin de l'entendre, texte seul saute la synthèse et coûte moins. |
| Format audio | Les mêmes cinq que la voix numérique. |
Le résultat montre l'original transcrit et la traduction, et en dessous le lecteur
avec Télécharger l'audio (traduccion.mp3) si vous avez demandé
l'audio. Si une partie de la chaîne avait quelque chose à signaler, cela apparaît comme un avis au lieu
de se perdre.
Ce que ça coûte, avant et après
Le Studio est aussi l'endroit où vous apprenez ce que valent les choses, il indique donc le prix deux fois : une estimation avant et la facturation réelle après.
Avant. Dès que vous choisissez un fichier, le navigateur lit sa durée et la multiplie par le
prix de ce que vous avez coché. Cocher ou décocher une case le recalcule sans avoir à choisir le
fichier à nouveau. Il dit coût approximatif parce qu'il l'est : la durée qu'un navigateur mesure
sur un mp3 à débit variable n'est pas toujours exacte, et c'est le moteur qui facture.
Les deux cartes de voix ne comportent aucune estimation préalable, et ce n'est pas un oubli : elles sont facturées à la seconde d'audio généré, et combien d'audio un texte produira n'est pas connu tant qu'il n'est pas généré.
Après. Quand cela se termine, une ligne apparaît avec le temps de traitement et ce qui a été consommé ; une seconde plus tard elle est remplacée par la facturation réelle, exactement telle que le système de facturation l'a enregistrée :
29 s · Facturé : 144 crédits · pour 2 424,0 s d'audio ·
transcription 79 · ton 12 · profil 8 · locuteurs 24 · résumé 21
| Ce que vous voyez | Ce que c'est |
|---|---|
29 s | Temps de traitement, non durée de l'audio. Quarante minutes d'enregistrement sont transcrites en moins d'une minute. |
Facturé : 144 crédits | Ce qui vous a réellement été facturé. Si cela n'est pas arrivé pour une raison quelconque, l'estimation reste à sa place. |
pour 2 424,0 s d'audio | La durée exacte que le moteur a mesurée, qui est le chiffre sur lequel la facturation se base. |
| Le détail | Il apparaît quand il y a eu plus d'une tâche, pour que vous voyiez où est allé chaque crédit. |
servi depuis le cache (10 % du prix) | Vous aviez demandé exactement la même chose récemment et il n'a pas fallu la générer à nouveau. |
Les prix qu'utilise cet écran sont les mêmes coefficients publiés dans cette documentation, lus en direct : s'ils changent, ils changent ici en même temps.
Quand quelque chose se passe mal
Les messages du Studio sont les erreurs de l'API en langage clair :
| Ce qu'il dit | Ce qui s'est passé |
|---|---|
| Votre session a expiré. Rechargez la page. | La permission temporaire s'est épuisée. Recharger suffit ; rien n'est perdu. |
| Vous n'avez plus de crédits pour cette période. | Ils se renouvellent au début de votre prochain cycle de facturation, ou vous pouvez changer de plan. |
| Votre plan n'inclut pas ce service. | Comme les cartes désactivées, mais vu depuis le serveur. |
| Le fichier est trop grand. | Plus de 150 Mo ou plus de 2 heures. Voir taille et durée. |
| Le service a rejeté le fichier. | L'audio ne peut pas être décodé : généralement un fichier incomplet ou dont l'extension a été changée à la main. |
| Trop de requêtes à la fois. | Vous avez lancé plusieurs cartes en parallèle. Attendez quelques secondes. |
Et si ce que vous voulez, c'est que tout cela se fasse tout seul, sans que personne ne téléverse de fichiers à la main, c'est l'autre porte : Intégrer Uttera dans votre code.