UtteraUttera

Ce qu'est le Studio

Le Studio est l'application web d'Uttera : une page où vous téléversez un fichier ou collez du texte, cochez ce que vous voulez et téléchargez le résultat. Rien à installer, aucune clé à demander, et pas une ligne de code à écrire.

En dessous, c'est exactement le même service que décrit le reste de cette documentation. Le Studio n'est pas une démo aux limites rognées : il appelle la même API, sur votre même plan, et dépense des crédits de votre même quota. Quand cette documentation dit que transcrire coûte tant par seconde, cela coûte le même prix par les deux portes.

Pour y entrer, il vous faut un compte et une session active. Si vous n'en avez pas, le Studio vous renvoie vers la page d'accueil. L'en-tête de la page vous rappelle avec quel e-mail vous vous êtes connecté et sur quel plan vous êtes, parce que ce que vous pouvez faire en dépend.

L'audio ne passe pas par le portail : il voyage de votre navigateur directement à l'API, avec une permission temporaire que la page demande au chargement. C'est pourquoi téléverser un gros fichier va à la vitesse de votre ligne et non à celle du portail. Si vous laissez l'onglet ouvert pendant de nombreuses heures, cette permission expire : rechargez la page.

Comment l'écran est organisé

Il y a quatre cartes, une par tâche :

CarteCe qu'elle faitÉquivalent à
Transcrire de l'audioEnregistrement → texte, avec analyse et résumé optionnels/v1/audio/transcriptions · /v1/summarize
Texte en voix numériqueTexte → audio avec une voix du catalogue/v1/audio/speech
Texte en voix clonéeTexte → audio avec une voix que vous fournissez/v1/audio/speech
Traduire un enregistrementEnregistrement → texte et parole dans une autre langue/v1/translate

Si votre plan n'inclut pas quelque chose, la carte est quand même là mais désactivée, grisée et sans bouton, indiquant quel plan il vous faudrait. C'est affiché à dessein : mieux vaut voir ce qui existe et ce que cela coûte que de le découvrir par une erreur. Il se passe la même chose à l'intérieur de Transcrire avec les cases d'analyse et de résumé, qui se désactivent individuellement sans retirer la transcription.

Toutes les cartes fonctionnent de la même façon, de haut en bas :

  1. Les champs. Le fichier ou le texte, et les options de cette tâche.
  2. La ligne de coût. Elle apparaît dès que vous choisissez un fichier et dit ce que cela va coûter, avant de dépenser quoi que ce soit.
  3. Le bouton Lancer.
  4. Le résultat. Pendant qu'il travaille, vous verrez le logo Uttera animé et un compteur de secondes, pour que vous sachiez qu'il est toujours en vie ; un audio long prend du temps. Quand il termine, le logo s'immobilise et le compteur devient la durée que cela a pris.

Transcrire de l'audio

La carte la plus complète : elle transcrit, et au passage elle peut analyser et résumer.

  1. Choisissez le fichier. Elle accepte wav, mp3, flac, ogg, opus, aiff, m4a et webm. Jusqu'à 150 Mo et 2 heures d'audio.
  2. Cochez les extras que vous voulez (chacun a son prix et est facturé séparément) :
    CaseCe qu'elle ajoute
    tonL'émotion dominante de l'enregistrement, avec sa confiance et les autres candidats.
    profil du locuteurTranche d'âge et genre estimés à partir de la voix.
    qui parle et quandTours de parole avec horodatages par locuteur.
    résumé de l'enregistrementUn résumé structuré de ce qui a été dit.
  3. Lancer. Le fichier est téléversé une seule fois même si vous cochez les quatre : l'analyse est répartie en interne sur l'audio déjà téléversé.

Le résultat est toujours présenté dans cet ordre :

  1. La transcription, et en dessous le ton sous forme d'une ligne en prose si vous l'avez demandé, avec le bouton Télécharger le texte (transcripcion.txt) qui clôt le bloc.
  2. Le résumé, si vous l'avez demandé, avec Télécharger le résumé (resumen.txt). Il vient après le texte à dessein : un résumé est plus facile à suivre avec la transcription sous les yeux, et la transcription est ce qui est toujours là.
  3. Le profil et qui parle et quand, bruts. Ce sont des données structurées et quiconque les demande les veut entières, non rédigées.
  4. Télécharger l'analyse (analisis.json) : un seul fichier avec tout ce qui a été analysé — y compris le vecteur de ton complet — non un par section.
  5. La ligne de facturation, qui clôt l'opération.
Le résumé n'est pas un extra ajouté à la transcription. Le cocher change toute la tâche : il est servi par /v1/summarize, qui transcrit de lui-même et analyse aussi. C'est pourquoi l'audio n'est pas transcrit deux fois, et pourquoi les trois cases d'analyse signifient la même chose avec ou sans le résumé coché.

Si une analyse particulière échoue, c'est dit : la transcription est quand même livrée et en dessous apparaît quelle partie n'a pas pu être faite. Ce n'est ni caché ni inventé.

Texte en voix numérique

Écrivez ou collez un texte et choisissez comment vous voulez l'entendre.

ChampCe qu'il fait
TexteCe qui doit être dit.
VoixLe catalogue est chargé depuis l'API à l'ouverture de la page, avec la langue devant chaque nom. La langue ne se choisit pas séparément : la voix la porte. Un sélecteur de langue autonome se lirait comme s'il traduisait, et cette carte ne traduit pas.
VitesseDe lent (0,8) à très rapide (1,5). Elle change la durée de l'audio et, comme la parole est facturée à la seconde générée, le prix aussi : lire à 1,25 coûte environ 20 % de moins qu'à 1,0.
Format audiomp3 · wav · opus · flac · pcm

Le résultat est un lecteur, la ligne de facturation et Télécharger l'audio (voz.mp3, ou l'extension que vous avez choisie).

Si vous choisissez pcm, vous n'obtiendrez pas un lecteur normal mais un bouton ▶ Lire. pcm est de l'audio brut sans en-tête : le navigateur ne sait pas à quelle fréquence d'échantillonnage il est et ne peut pas le lire seul, mais le Studio le sait et le décode. Le fichier que vous téléchargez vous demandera d'indiquer ces paramètres au programme avec lequel vous l'ouvrez — ils sont dans Formats.

Texte en voix clonée

Comme la précédente, mais vous fournissez la voix : vous téléversez un échantillon et le texte est lu avec.

ChampCe qu'il fait
TexteCe qui doit être dit.
Échantillon de voixUn fichier audio de la voix à imiter, dans l'un des formats d'entrée.
Vitesse et FormatComme dans la voix numérique.

L'échantillon n'est pas facturé. Ce qui est facturé, c'est l'audio généré, qui dépend de la longueur du texte, non de la durée de l'échantillon. Le clonage prend nettement plus de temps que la voix numérique : la carte vous en avertit pendant qu'elle travaille. Le téléchargement sort sous voz-clonada.mp3.

Uniquement des voix que vous avez le droit d'utiliser. Cloner une voix sans la permission de son propriétaire est votre problème, pas le nôtre : en Espagne, une voix est une donnée personnelle et elle est protégée. Ce que dit la section Sécurité sur ce qui entre dans le système s'applique ici à ce qui en sort.

Traduire un enregistrement

Toute la chaîne en une étape : elle transcrit l'audio, traduit le texte et le redit dans la langue cible.

ChampCe qu'il fait
FichierL'enregistrement source. La langue source est détectée d'elle-même.
Langue cibleSeules les langues qui ont une voix apparaissent. Nous traduisons vers bien d'autres, mais ici il faut la dire à voix haute.
VoixDepuis le catalogue standard. Elle s'ajuste à la langue cible quand vous la changez : une voix espagnole lisant la traduction anglaise sonne comme un étranger lisant à voix haute.
Parler avec la voix d'origineTranspose : au lieu d'une de nos voix, la traduction est dite avec la voix de la personne dans l'enregistrement, clonée à partir d'elle. Cela désactive le sélecteur de voix, parce que cela le remplace. Requiert un plan payant, et le coût estimé augmente dès que vous le cochez : une seconde de voix clonée vaut environ 19 fois une seconde de voix standard.
VitesseComme dans la voix numérique, avec le même effet sur le prix.
Texte et audio / texte seulSi vous n'avez pas besoin de l'entendre, texte seul saute la synthèse et coûte moins.
Format audioLes mêmes cinq que la voix numérique.

Le résultat montre l'original transcrit et la traduction, et en dessous le lecteur avec Télécharger l'audio (traduccion.mp3) si vous avez demandé l'audio. Si une partie de la chaîne avait quelque chose à signaler, cela apparaît comme un avis au lieu de se perdre.

Ce que ça coûte, avant et après

Le Studio est aussi l'endroit où vous apprenez ce que valent les choses, il indique donc le prix deux fois : une estimation avant et la facturation réelle après.

Avant. Dès que vous choisissez un fichier, le navigateur lit sa durée et la multiplie par le prix de ce que vous avez coché. Cocher ou décocher une case le recalcule sans avoir à choisir le fichier à nouveau. Il dit coût approximatif parce qu'il l'est : la durée qu'un navigateur mesure sur un mp3 à débit variable n'est pas toujours exacte, et c'est le moteur qui facture.

Les deux cartes de voix ne comportent aucune estimation préalable, et ce n'est pas un oubli : elles sont facturées à la seconde d'audio généré, et combien d'audio un texte produira n'est pas connu tant qu'il n'est pas généré.

Après. Quand cela se termine, une ligne apparaît avec le temps de traitement et ce qui a été consommé ; une seconde plus tard elle est remplacée par la facturation réelle, exactement telle que le système de facturation l'a enregistrée :

29 s · Facturé : 144 crédits · pour 2 424,0 s d'audio ·
transcription 79 · ton 12 · profil 8 · locuteurs 24 · résumé 21
Ce que vous voyezCe que c'est
29 sTemps de traitement, non durée de l'audio. Quarante minutes d'enregistrement sont transcrites en moins d'une minute.
Facturé : 144 créditsCe qui vous a réellement été facturé. Si cela n'est pas arrivé pour une raison quelconque, l'estimation reste à sa place.
pour 2 424,0 s d'audioLa durée exacte que le moteur a mesurée, qui est le chiffre sur lequel la facturation se base.
Le détailIl apparaît quand il y a eu plus d'une tâche, pour que vous voyiez où est allé chaque crédit.
servi depuis le cache (10 % du prix)Vous aviez demandé exactement la même chose récemment et il n'a pas fallu la générer à nouveau.

Les prix qu'utilise cet écran sont les mêmes coefficients publiés dans cette documentation, lus en direct : s'ils changent, ils changent ici en même temps.

Quand quelque chose se passe mal

Les messages du Studio sont les erreurs de l'API en langage clair :

Ce qu'il ditCe qui s'est passé
Votre session a expiré. Rechargez la page.La permission temporaire s'est épuisée. Recharger suffit ; rien n'est perdu.
Vous n'avez plus de crédits pour cette période.Ils se renouvellent au début de votre prochain cycle de facturation, ou vous pouvez changer de plan.
Votre plan n'inclut pas ce service.Comme les cartes désactivées, mais vu depuis le serveur.
Le fichier est trop grand.Plus de 150 Mo ou plus de 2 heures. Voir taille et durée.
Le service a rejeté le fichier.L'audio ne peut pas être décodé : généralement un fichier incomplet ou dont l'extension a été changée à la main.
Trop de requêtes à la fois.Vous avez lancé plusieurs cartes en parallèle. Attendez quelques secondes.

Et si ce que vous voulez, c'est que tout cela se fasse tout seul, sans que personne ne téléverse de fichiers à la main, c'est l'autre porte : Intégrer Uttera dans votre code.