UtteraUttera

Cadre légal

Tout ce qui régit l'utilisation d'Uttera — conditions de service, confidentialité, l'accord de sous-traitance et cookies — vit sur une seule page :

Mentions légales et confidentialité →

Seul le résumé va ici, avec un lien vers chaque section. Le texte qui compte est celui de cette page : deux copies d'un document légal finissent par diverger, et alors aucune ne vaut rien.

Ce pour quoi il ne DOIT PAS être utilisé

C'est la section la plus utile à lire avant d'intégrer, parce que presque tout ce qu'elle contient est un délit et pas seulement une rupture de contrat :

La liste complète, avec l'article qui s'applique à chacun →

Le règlement sur l'IA et l'audio que vous générez

Depuis le 2 août 2026, l'article 50 du règlement (UE) 2024/1689 s'applique. Si vous générez un audio qui imite une personne réelle, ou qui informe le public sur des questions d'intérêt public, vous devez le divulguer. Et si votre système converse avec quelqu'un, cette personne doit savoir qu'elle parle à une machine.

Le devoir de marquer techniquement le contenu synthétique est le nôtre, et la période d'adaptation qui s'applique à nous se termine le 2 décembre 2026.

Le calendrier et le détail →

Le filigrane

Tout audio qu'Uttera génère porte un filigrane, depuis le 16 septembre 2026. Les deux voix, standard et clonée, et les cinq formats. Ce n'est pas optionnel et aucun paramètre de l'API ne le désactive.

Nous utilisons AudioSeal, de Meta, sous licence MIT. C'est une marque imperceptible intégrée dans les échantillons sonores eux-mêmes, non un champ de métadonnées du fichier. Elle est appliquée avant l'encodage, elle voyage donc dans l'audio que vous recevez quel que soit le format.

Chaque réponse audio de l'API porte l'en-tête X-Watermark avec le schéma utilisé. Si vous receviez un jour de notre part un audio sans cet en-tête, c'est une défaillance de notre côté et nous voulons en être informés.

À côté viennent X-Audio-Sha256 et Content-Digest : le SHA-256 des octets que nous vous remettons, en hexa et sous la forme RFC 9530. Ils répondent à une question différente de celle de la marque. La marque dit que l'audio a été généré par une machine ; le digest dit que le fichier que vous tenez est celui qui est parti d'ici. Aucun ne remplace l'autre, et la différence est utile : une marque peut survivre à un réencodage, tandis que le digest cessera de correspondre — donc si la marque est là et le digest non, ce que vous avez est passé par quelque chose depuis que nous l'avons envoyé.

Ce qu'elle dit, et ce qu'elle ne dit pas

La marque dit que l'audio a été généré par une machine. Et rien d'autre : ni qui l'a demandé, ni quand, ni sous quel compte, ni aucun identifiant qui pourrait le relier à une personne.

Le format AudioSeal porte 16 bits de message à l'intérieur de la marque, et depuis le 19 septembre 2026 nous les utilisons pour une signature d'origine fixe : 0x5554, les lettres UT en ASCII. Elle est la même pour chaque client et chaque requête.

Elle était nécessaire pour une raison concrète : AudioSeal est un logiciel libre et public, la simple présence d'une marque ne dit donc rien sur l'appartenance de l'audio — quiconque utilise le même outil produit des marques tout aussi valides.

À quoi sert la signature (et à quoi elle ne sert pas)

La signature ne prouve pas qu'un audio est le nôtre. Parce qu'AudioSeal est public, n'importe qui peut estamper ces mêmes 16 bits. Vous dire le contraire serait vous vendre une garantie qui n'existe pas.

Ce qu'elle prouve, c'est l'inverse, et c'est la partie que vous voulez vraiment : tout ce que nos moteurs produisent est signé — il n'y a aucun moyen de le désactiver, et un de nos serveurs qui ne pourrait pas marquer ne démarrerait pas. Donc si un audio ne porte pas la signature UT, nous ne l'avons pas généré. C'est une affirmation ferme, et vous pouvez l'utiliser :

Vous pouvez le vérifier vous-même, sans rien nous demander, avec l'outil de Meta : lisez la marque et regardez le message de 16 bits. S'il lit 0x5554, ce sont les lettres UT.

⚠ La signature est décodée par position, et les formats compressés ajoutent un petit décalage au début de l'audio. Si vous lisez la marque sur un mp3 sans corriger ce décalage, le message revient altéré. Essayez quelques petits décalages au début et gardez la meilleure lecture.

Si vous avez besoin d'une preuve positive qui ne peut pas être falsifiée, le filigrane n'est pas la bonne pièce : utilisez le rapport PDF, que nous signons cryptographiquement et qui peut être vérifié sur /verify.

Jusqu'où elle tient

Mesuré par nous, sur de l'audio sorti de nos moteurs :

Ce que l'audio traverseToujours détecté ?
Compressé en mp3, opus ou flacOui
Recompressé trois fois de suiteOui
Ligne fixe (G.711), RNIS (G.722)Oui
Mobile 2G (GSM 06.10)Oui
PBX compressant à 16 kbps (G.726)Oui
Réduit à la bande téléphonique (300–3400 Hz)Oui
Diffusé par un haut-parleur et capté par un microphoneOui
G.723.1 à 6,3 kbps (VoIP hérité, largement obsolète)Non

Nous publions aussi le cas où elle échoue. Une marque présentée comme infaillible n'est pas une marque, c'est de la publicité.

Pourquoi nous n'utilisons PAS C2PA

C2PA est un manifeste signé qui voyage à l'intérieur du fichier. C'est l'autre voie courante pour marquer le contenu synthétique, et nous avons décidé de ne pas la prendre :

Ce que C2PA apporte, c'est l'interopérabilité avec les plateformes qui lisent le manifeste pour étiqueter le contenu. C'est une valeur réelle, mais elle ne l'emporte pas sur ce qui précède. Si les faits changent — si le standard se met à prendre en charge opus, si les plateformes commencent à l'exiger — nous le réexaminerons et le dirons ici.

Si vous êtes une entreprise qui nous envoie les données d'autrui

Vous êtes le responsable du traitement et nous sommes le sous-traitant (art. 28 du RGPD). L'accord de sous-traitance est écrit et tient lieu de tel ; si vous avez besoin d'un contrat signé, écrivez à support@uttera.ai et nous le signerons.

L'accord de sous-traitance →