Morgan Dutemple
← Toute l'Agenthèque
ApplicationContenu & rédactionAgnostiqueUtilisé pour ce site

Google Cloud Text-to-Speech

Ce site a comparé à l'oreille, sur le même paragraphe, edge-tts, un modèle open source auto-hébergé (Kokoro-82M) et Google Cloud Text-to-Speech avant de choisir : la voix masculine fr-FR-Neural2-G a été retenue pour les prochains articles de blog, edge-tts restant en place sur les narrations déjà publiées (pas de backfill). Contrairement à edge-tts, c'est une API officielle facturée à l'usage, avec un tier gratuit mensuel (1 million de caractères en Neural2/WaveNet) largement suffisant pour un blog de quelques articles par semaine.

Page officielle de Google Cloud Text-to-Speech

Avantages clés

  • Qualité de voix nettement supérieure à edge-tts, en particulier sur les voix Neural2 et Studio
  • Tier gratuit permanent (pas un essai limité dans le temps) largement suffisant pour un usage éditorial courant
  • API REST officielle et documentée, facile à automatiser dans un script existant

Pour qui, pour quoi

Créateurs de contenu qui veulent une qualité de voix nettement supérieure à un moteur gratuit type edge-tts, et qui acceptent en échange de créer un projet Google Cloud avec facturation active.

  • Narration audio d'articles de blog avec une voix Neural2 ou Studio
  • Génération vocale pour des interfaces vocales ou des assistants
  • Prototypage rapide de voix off avant un choix d'outil plus haut de gamme (Studio, ElevenLabs)

Comment démarrer

  1. 1Créer ou choisir un projet sur console.cloud.google.com et activer la facturation (carte bancaire requise même pour rester dans le tier gratuit).
  2. 2Activer « Cloud Text-to-Speech API » dans API et services → Bibliothèque.
  3. 3Créer une clé API dans API et services → Identifiants, et la restreindre à cette seule API par sécurité.
  4. 4Appeler l'API en REST : `POST https://texttospeech.googleapis.com/v1/text:synthesize?key=VOTRE_CLE` avec un corps JSON `{"input":{"text":"..."},"voice":{"languageCode":"fr-FR","name":"fr-FR-Neural2-G"},"audioConfig":{"audioEncoding":"MP3"}}` (audio renvoyé en base64 dans la réponse).

Points de vigilance

  • Nécessite un compte de facturation Google Cloud actif (carte bancaire), même pour rester dans le tier gratuit : contrairement à edge-tts, ce n'est plus « zéro risque » sans surveillance du budget.
  • Le tier gratuit est limité à 1 million de caractères/mois pour les voix Neural2 et WaveNet (4 millions pour les voix Standard, moins naturelles) : au-delà, facturation au caractère.
  • Une alerte de budget Google Cloud doit être configurée manuellement (Facturation → Budgets et alertes) ; elle n'est pas activée par défaut à la création du projet.
  • La requête `text:synthesize` est limitée à environ 5 000 octets de texte : un article complet doit être découpé en plusieurs appels puis les audios concaténés.

Questions fréquentes

Google Cloud TTS est-il gratuit ?

Le tier gratuit couvre 1 million de caractères par mois pour les voix Neural2/WaveNet (4 millions pour les voix Standard), en continu, pas seulement un essai limité dans le temps. Au-delà, l'usage est facturé au caractère. Un compte de facturation actif est requis dès le départ, même pour rester dans le gratuit.

Faut-il un compte de service (fichier JSON) pour authentifier les appels ?

Non, contrairement à ce qu'indiquent plusieurs sources tierces : une simple clé API restreinte à l'API Cloud Text-to-Speech suffit, passée en paramètre `?key=` de la requête REST. Vérifié par appel direct à l'API.

Quelle différence avec edge-tts ?

Google Cloud TTS a une meilleure qualité de voix (Neural2, Studio) mais nécessite une facturation active et un budget à surveiller. edge-tts reste gratuit et sans compte, avec une qualité correcte mais inférieure sur l'expressivité.

Peut-on générer un article de blog complet en un seul appel ?

Non si le texte dépasse environ 5 000 octets : il faut découper le texte en plusieurs morceaux (par paragraphe par exemple), appeler l'API pour chacun, puis concaténer les fichiers audio résultants.