Morgan Dutemple
← Retour au blog
IA

TTS gratuit : les meilleurs outils (et quand passer au payant)

microphone à condensateur en gros plan avec fond en bokeh
Photo par israel palacio sur Unsplash
Morgan Dutemple
·Delivery Manager & Expert Transformation Digitale

Chaque narration audio des articles de ce blog est générée par synthèse vocale. J'ai testé plusieurs outils avant de choisir, et la question qui revient le plus souvent quand j'en parle n'est pas « lequel est gratuit », c'est « lequel clone une voix sans être payant ». Les deux questions se recoupent, mais pas complètement : un bon outil de narration n'est pas forcément un bon outil de clonage, et inversement.

Les API cloud gratuites, avec quota

Google Cloud Text-to-Speech est l'outil que j'utilise aujourd'hui pour ce blog, avec la voix fr-FR-Neural2-G. Son tier gratuit couvre 1 million de caractères par mois pour les voix Neural2 et WaveNet, en continu, pas un essai limité dans le temps, et 4 millions pour les voix Standard, moins naturelles. Un compte de facturation actif est requis dès le départ, même pour rester dans le gratuit, et une alerte de budget doit être configurée manuellement : ce n'est pas un outil « zéro risque » sans surveillance.

edge-tts, un projet communautaire qui réutilise le moteur vocal public de Microsoft Edge, reste l'option la plus simple : aucune clé API, aucun compte, plus de 300 voix dans des dizaines de langues. C'est ce que j'ai utilisé sur les premiers articles de ce blog avant de passer à Google Cloud TTS pour la qualité. La contrepartie : une API non officielle, non documentée par Microsoft, qui peut casser sans préavis.

Azure AI Speech propose un tier F0 gratuit de 500 000 caractères par mois, qui n'expire jamais, sans carte bancaire requise pour l'activer sur un abonnement Azure gratuit. Moins généreux que Google Cloud TTS en volume, mais la barrière à l'entrée est plus basse.

Amazon Polly affiche le quota le plus généreux sur le papier : 5 millions de caractères pour les voix Standard, 1 million pour les voix Neural, 500 000 pour les voix Long-Form. Le piège est dans la durée : ce tier gratuit ne dure que les 12 premiers mois suivant l'inscription, contrairement à Google Cloud TTS et Azure qui restent gratuits sans limite de temps dans leurs quotas respectifs.

Le clonage de voix gratuit, l'angle que les API cloud ne couvrent pas

Aucun des quatre outils ci-dessus ne clone une voix. Pour ça, il faut se tourner vers des modèles open source auto-hébergés.

Chatterbox, publié par Resemble AI sous licence MIT, est le candidat le plus sérieux pour un usage commercial : clonage zero-shot à partir d'un échantillon d'environ 10 secondes, multilingue (23 langues et plus, dont le français), et la licence MIT autorise explicitement l'usage commercial. Resemble AI a publié une étude d'écoute où 65,3% des auditeurs préféraient Chatterbox à ElevenLabs, un chiffre à prendre avec la réserve habituelle : c'est l'éditeur qui juge son propre outil.

Coqui XTTS-v2 reste une référence de qualité pour le clonage multilingue, à partir d'un échantillon d'à peine 6 secondes. Le problème n'est pas technique mais juridique : le modèle est sous licence CPML, non commerciale, et Coqui (l'entreprise) a fermé en janvier 2024. Il n'existe donc plus personne pour vendre une licence commerciale : XTTS-v2 reste utilisable, activement maintenu par la communauté, mais à réserver à un usage non commercial tant que cette situation ne change pas.

Kokoro, sous licence Apache-2.0 (donc utilisable commercialement), ne clone pas de voix : c'est un modèle à 82 millions de paramètres, léger, avec 54 voix prédéfinies, pensé pour tourner sur un CPU ou un GPU modeste plutôt que pour imiter une voix précise. Un fork communautaire, Kokoclone, ajoute une fonction de clonage par-dessus, sous la même licence Apache-2.0, mais avec la prudence habituelle qui s'applique à un fork communautaire plutôt qu'à un projet établi.

En résumé, si l'usage est commercial, Chatterbox est aujourd'hui le seul des trois qui coche à la fois gratuit, clonage, et licence qui autorise explicitement cet usage.

Quand passer au payant

Le gratuit atteint vite ses limites sur deux points : l'expressivité fine (intonation, émotion, respiration) et la fiabilité en production.

ElevenLabs reste la référence pour le clonage de voix professionnel. Son plan gratuit inclut jusqu'à 3 clonages instantanés et 10 000 caractères par mois, mais sans usage commercial autorisé et sans accès API : utilisable pour tester, pas pour produire. Les plans payants commencent autour de 5 dollars par mois pour un usage commercial réel, avec un accès API et un clonage vocal de meilleure qualité (professional voice cloning) sur les paliers supérieurs.

PlayHT et Murf occupent un positionnement voisin : clonage de voix et bibliothèques de voix étendues, orientés respectivement vers l'intégration développeur pour PlayHT et la production de voix off pour des vidéos côté Murf. Les deux réservent leurs fonctions de clonage les plus abouties aux paliers payants, sur le même modèle qu'ElevenLabs.

Ce que je recommande concrètement

Pour une narration de contenu sans clonage, Google Cloud TTS et son tier gratuit permanent restent le meilleur rapport qualité/contrainte, edge-tts étant l'option de repli si l'idée même d'un compte de facturation est un frein.

Pour du clonage vocal gratuit et commercial, Chatterbox est le point de départ le plus raisonnable aujourd'hui. XTTS-v2 reste préférable pour un usage strictement personnel ou de test, tant que sa situation de licence ne change pas.

Pour un usage professionnel qui dépasse ce que le gratuit couvre, que ce soit en volume ou en qualité de clonage, ElevenLabs reste la référence du marché, avec un coût d'entrée mesuré (autour de 5 dollars par mois) avant de monter en gamme.

Sources : Amazon Polly, tarification officielle ; Microsoft Learn, quotas Azure Speech ; Chatterbox, Resemble AI ; Coqui XTTS-v2 sur Hugging Face ; Kokoro-82M sur Hugging Face.

Questions fréquentes

Quel outil gratuit clone une voix pour un usage commercial ?

Chatterbox (Resemble AI), sous licence MIT, est aujourd'hui le seul outil gratuit et auto-hébergé qui combine clonage de voix et licence autorisant explicitement l'usage commercial.

Pourquoi ne pas utiliser XTTS-v2, réputé pour sa qualité ?

Sa licence CPML est non commerciale, et Coqui, l'entreprise qui pourrait vendre une licence commerciale, a fermé en janvier 2024. Le modèle reste utilisable et maintenu par la communauté, mais pas pour un usage commercial en l'état.

Le tier gratuit d'Amazon Polly n'est-il pas le plus généreux ?

En volume, oui, mais il ne dure que 12 mois après l'inscription, contrairement à Google Cloud TTS (1 million de caractères Neural2/mois en continu) ou Azure (500 000 caractères/mois, sans limite de temps).

Morgan Dutemple

À propos de l'auteur

Morgan Dutemple

Delivery Manager à Rennes. Je pilote des projets de transformation digitale, SEO/GEO et accessibilité RGAA pour des clients grands comptes. Ce blog est le reflet de ce que je rencontre sur le terrain.