Cadre légal
Tout ce qui régit l'utilisation d'Uttera — conditions de service, confidentialité, l'accord de sous-traitance et cookies — vit sur une seule page :
Mentions légales et confidentialité →
Seul le résumé va ici, avec un lien vers chaque section. Le texte qui compte est celui de cette page : deux copies d'un document légal finissent par diverger, et alors aucune ne vaut rien.
Ce pour quoi il ne DOIT PAS être utilisé
C'est la section la plus utile à lire avant d'intégrer, parce que presque tout ce qu'elle contient est un délit et pas seulement une rupture de contrat :
- Usurper l'identité d'une personne avec une voix clonée afin de tromper quelqu'un.
- Cloner la voix d'une personne identifiable sans son consentement, même si le matériel source est public. La voix est protégée par l'art. 7.6 de la loi organique espagnole 1/1982.
- Transcrire des enregistrements obtenus illicitement. Enregistrer une conversation à laquelle vous participez n'est pas un délit en Espagne ; en enregistrer une entre d'autres l'est (art. 197 du Code pénal).
- Identifier des personnes par leur voix, ou constituer un registre d'empreintes vocales.
- Prendre des décisions sur des personnes à partir du ton ou du profilage du locuteur.
La liste complète, avec l'article qui s'applique à chacun →
Le règlement sur l'IA et l'audio que vous générez
Depuis le 2 août 2026, l'article 50 du règlement (UE) 2024/1689 s'applique. Si vous générez un audio qui imite une personne réelle, ou qui informe le public sur des questions d'intérêt public, vous devez le divulguer. Et si votre système converse avec quelqu'un, cette personne doit savoir qu'elle parle à une machine.
Le devoir de marquer techniquement le contenu synthétique est le nôtre, et la période d'adaptation qui s'applique à nous se termine le 2 décembre 2026.
Le filigrane
Tout audio qu'Uttera génère porte un filigrane, depuis le 16 septembre 2026. Les deux voix, standard et clonée, et les cinq formats. Ce n'est pas optionnel et aucun paramètre de l'API ne le désactive.
Nous utilisons AudioSeal, de Meta, sous licence MIT. C'est une marque imperceptible intégrée dans les échantillons sonores eux-mêmes, non un champ de métadonnées du fichier. Elle est appliquée avant l'encodage, elle voyage donc dans l'audio que vous recevez quel que soit le format.
Chaque réponse audio de l'API porte l'en-tête X-Watermark avec le schéma utilisé. Si vous receviez un jour de notre part un audio sans cet en-tête, c'est une défaillance de notre côté et nous voulons en être informés.
À côté viennent X-Audio-Sha256 et Content-Digest : le SHA-256 des octets que nous vous remettons, en hexa et sous la forme RFC 9530. Ils répondent à une question différente de celle de la marque. La marque dit que l'audio a été généré par une machine ; le digest dit que le fichier que vous tenez est celui qui est parti d'ici. Aucun ne remplace l'autre, et la différence est utile : une marque peut survivre à un réencodage, tandis que le digest cessera de correspondre — donc si la marque est là et le digest non, ce que vous avez est passé par quelque chose depuis que nous l'avons envoyé.
Ce qu'elle dit, et ce qu'elle ne dit pas
La marque dit que l'audio a été généré par une machine. Et rien d'autre : ni qui l'a demandé, ni quand, ni sous quel compte, ni aucun identifiant qui pourrait le relier à une personne.
Le format AudioSeal porte 16 bits de message à l'intérieur de la marque, et depuis le 19 septembre 2026 nous les utilisons pour une signature d'origine fixe : 0x5554, les lettres UT en ASCII. Elle est la même pour chaque client et chaque requête.
Elle était nécessaire pour une raison concrète : AudioSeal est un logiciel libre et public, la simple présence d'une marque ne dit donc rien sur l'appartenance de l'audio — quiconque utilise le même outil produit des marques tout aussi valides.
À quoi sert la signature (et à quoi elle ne sert pas)
La signature ne prouve pas qu'un audio est le nôtre. Parce qu'AudioSeal est public, n'importe qui peut estamper ces mêmes 16 bits. Vous dire le contraire serait vous vendre une garantie qui n'existe pas.
Ce qu'elle prouve, c'est l'inverse, et c'est la partie que vous voulez vraiment : tout ce que nos moteurs produisent est signé — il n'y a aucun moyen de le désactiver, et un de nos serveurs qui ne pourrait pas marquer ne démarrerait pas. Donc si un audio ne porte pas la signature UT, nous ne l'avons pas généré. C'est une affirmation ferme, et vous pouvez l'utiliser :
- si quelqu'un attribue à Uttera un enregistrement que vous ne reconnaissez pas, l'absence de la signature l'écarte ;
- si quelqu'un fait passer pour vôtre une voix clonée que vous n'avez jamais demandée, en prétendant qu'elle vient de notre système, l'absence de la signature le réfute.
Vous pouvez le vérifier vous-même, sans rien nous demander, avec l'outil de Meta : lisez la marque et regardez le message de 16 bits. S'il lit 0x5554, ce sont les lettres UT.
⚠ La signature est décodée par position, et les formats compressés ajoutent un petit décalage au début de l'audio. Si vous lisez la marque sur un mp3 sans corriger ce décalage, le message revient altéré. Essayez quelques petits décalages au début et gardez la meilleure lecture.
Si vous avez besoin d'une preuve positive qui ne peut pas être falsifiée, le filigrane n'est pas la bonne pièce : utilisez le rapport PDF, que nous signons cryptographiquement et qui peut être vérifié sur /verify.
Jusqu'où elle tient
Mesuré par nous, sur de l'audio sorti de nos moteurs :
| Ce que l'audio traverse | Toujours détecté ? |
|---|---|
Compressé en mp3, opus ou flac | Oui |
| Recompressé trois fois de suite | Oui |
| Ligne fixe (G.711), RNIS (G.722) | Oui |
| Mobile 2G (GSM 06.10) | Oui |
| PBX compressant à 16 kbps (G.726) | Oui |
| Réduit à la bande téléphonique (300–3400 Hz) | Oui |
| Diffusé par un haut-parleur et capté par un microphone | Oui |
| G.723.1 à 6,3 kbps (VoIP hérité, largement obsolète) | Non |
Nous publions aussi le cas où elle échoue. Une marque présentée comme infaillible n'est pas une marque, c'est de la publicité.
Pourquoi nous n'utilisons PAS C2PA
C2PA est un manifeste signé qui voyage à l'intérieur du fichier. C'est l'autre voie courante pour marquer le contenu synthétique, et nous avons décidé de ne pas la prendre :
- Une seule commande
ffmpegle retire. C'est une métadonnée de conteneur : elle disparaît au réencodage, et elle disparaît d'elle-même dès que l'audio passe par une plateforme qui transcode. Elle ne prouve rien, parce que n'importe qui peut la retirer. - Elle n'est pas nécessaire pour la conformité. L'article 50(2) exige un marquage lisible par machine et détectable. Le filigrane est exactement cela, dans les cinq formats. C2PA est une façon de se conformer, non la façon.
- Le standard ne prend en charge ni
opusni lepcmbrut, deux des cinq formats que nous servons. Vérifié par nous contre la bibliothèque, non lu sur une page de documentation. - Elle ne survit pas au cas qui compte. La fraude à la voix synthétique n'arrive pas comme un fichier : elle arrive comme un appel téléphonique. Il n'y a là ni conteneur, ni métadonnée, ni manifeste. Il y a de l'audio, et le filigrane y est toujours.
Ce que C2PA apporte, c'est l'interopérabilité avec les plateformes qui lisent le manifeste pour étiqueter le contenu. C'est une valeur réelle, mais elle ne l'emporte pas sur ce qui précède. Si les faits changent — si le standard se met à prendre en charge opus, si les plateformes commencent à l'exiger — nous le réexaminerons et le dirons ici.
Si vous êtes une entreprise qui nous envoie les données d'autrui
Vous êtes le responsable du traitement et nous sommes le sous-traitant (art. 28 du RGPD). L'accord de sous-traitance est écrit et tient lieu de tel ; si vous avez besoin d'un contrat signé, écrivez à support@uttera.ai et nous le signerons.