UtteraUttera

Musique

Décrivez la musique dont vous avez besoin et obtenez un morceau fini, jusqu'à six minutes et vingt secondes. Ce ne sont ni des boucles ni des fragments à assembler : c'est un morceau avec un début et une fin.

C'est destiné à quiconque a besoin de musique de fond avec une licence claire —une vidéo, un podcast, une présentation, une salle d'attente— et ne veut pas se battre avec un catalogue de stock ou les droits d'un tiers.

La sortie est du WAV stéréo 48 kHz. Le modèle génère à 44,1 kHz et nous suréchantillonnons à 48 avant de livrer ; le suréchantillonnage ne perd rien de ce que le modèle a fait.

Tout audio porte un filigrane. Il porte un filigrane inaudible l'identifiant comme généré par une machine. Il est exigé par l'article 50(2) du règlement européen sur l'IA et ne peut pas être désactivé, ni via l'API ni depuis le Studio.
Propulsé par Stability AI. La musique est générée avec Stable Audio 3 de Stability AI, entraîné sur 1 278 902 enregistrements sous licence d'AudioSparx et Freesound. Ce que vous générez est à vous, dans la mesure expliquée dans la licence d'utilisation de votre plan.

Durée et qualité

Il y a deux réglages, et les deux changent le coût. C'est la différence importante avec Sons, où un clip coûte le même prix quelle que soit sa durée.

Durée. De 10 secondes à 6 min 20 s. Le morceau est construit entier pour la durée demandée : un morceau de trois minutes n'est pas un de trente secondes répété six fois.

Qualité. C'est le nombre d'étapes que fait le moteur, de 32 à 128. Plus d'étapes signifie plus de cohérence rythmique et plus de structure, non plus de fidélité audio : la bande passante est la même à 32 qu'à 128, mesurée.

En dessous de 32 étapes, vous n'économisez rien. C'est mesuré : 16 et 32 étapes prennent le même temps, parce qu'à ces chiffres le travail réel tombe sous le bruit. C'est pourquoi le réglage commence à 32 et non à 16.

Et un troisième réglage qui ne coûte rien : la graine. La même description avec la même graine donne le même morceau. Si vous en aimez un et voulez y revenir, gardez le numéro.

Via l'API

Une route. Requiert un plan payant, à partir de Startup.

POST /v1/audio/music — corps JSON, renvoie le WAV.

ChampTypeCe que c'est
promptchaîneRequis. Quelle musique vous voulez. Nommer le style, les instruments et le BPM aide beaucoup.
secondsnombreDurée, 1 à 380. Par défaut 60.
stepsentierÉtapes, 32 à 128. Par défaut 32.
seedentierLa même graine avec la même description donne le même morceau. Si vous n'en envoyez pas, le moteur en choisit une et vous la rend.
negative_promptchaîneCe que vous NE voulez PAS —« vocals », « drums »—. L'envoyer active le guidage ; l'omettre non.
translatebooléentrue traduit votre description en anglais avant de générer.

La réponse porte ces en-têtes :

En-têteCe qu'il dit
X-SeedLa graine réellement utilisée. Si vous n'en avez envoyé aucune, c'est le seul moyen de répéter le morceau.
X-StepsÉtapes appliquées.
X-Audio-SecondsSecondes d'audio livrées.
X-GenerationsCombien de générations ont été lancées.
X-WatermarkQuel filigrane il porte.
X-Translated1 si votre texte a été traduit.

Limites et coût

Le plafond est de 380 secondes. Au-delà, ce n'est pas qu'il échoue : le modèle ne sait pas faire, et nous préférons le dire plutôt que de livrer discrètement quelque chose de moins bon.

Facturé selon la durée et la qualité

Contrairement à Sons, ici le coût dépend des deux, parce que le travail du moteur aussi :

crédits = 0,333 + secondes × étapes × 0,001167 + secondes × 0,02184

Le dernier terme est le filigrane. Au-delà d'environ deux minutes, le filigrane coûte plus que la génération : ce n'est pas une erreur d'arithmétique, c'est que le moteur est très rapide et que le filigrane croît avec la durée.

Un morceau d'une minute à 32 étapes coûte environ 3,9 crédits. Le même à 128 étapes, environ 11. L'application vous montre le chiffre avant de générer, précisément pour que bouger un réglage ne soit jamais une surprise.