WhisperLiveKit
WhisperLiveKit répond à une limite connue de Whisper : le modèle est pensé pour transcrire un énoncé complet, pas des fragments audio envoyés en continu. Découper l'audio en tranches naïves coupe des mots et dégrade fortement la qualité. Le projet s'appuie sur des méthodes de recherche récentes (SimulWhisper/Streaming, politique AlignAtt, diarisation Streaming Sortformer, encodeur causal Qwen3-ASR) pour bufferiser et traiter l'audio de façon incrémentale. C'est une brique logicielle à intégrer, pas une application avec interface de prise de notes : il expose un serveur local avec une API WebSocket native et des façades compatibles OpenAI (`/v1/audio/transcriptions`) et Deepgram, pensées pour être branchées à un outil existant plutôt qu'utilisées telles quelles par un utilisateur final.

Avantages clés
- Licence Apache 2.0, plus de 10 800 étoiles GitHub, actif (dernier commit à quelques jours de la vérification)
- 100 % auto-hébergé : aucune donnée audio n'est envoyée à un tiers, contrairement aux API de transcription cloud
- Compatibilité API OpenAI et Deepgram : un projet déjà câblé sur l'une de ces API peut basculer vers un hébergement local sans réécrire son intégration
Pour qui, pour quoi
Développeurs qui construisent un produit ou un script nécessitant de la transcription vocale en direct (assistant de réunion maison, sous-titrage, accessibilité), et qui veulent héberger ce composant eux-mêmes plutôt que payer une API cloud à l'usage.
- Brancher un flux audio (micro, appel) sur le WebSocket natif pour obtenir une transcription incrémentale en direct, avec diarisation des locuteurs
- Remplacer un appel à l'API de transcription OpenAI ou Deepgram par un point de terminaison local compatible, sans changer le code client
- Transcrire ou sous-titrer un fichier audio ou vidéo déjà enregistré en ligne de commande (`wlk transcribe`), y compris en générant un fichier .srt
Comment démarrer
- 1Installer : `pip install whisperlivekit`.
- 2Lancer un serveur local : `wlk --model base --language fr`, puis ouvrir `http://localhost:8000` pour tester au micro.
- 3Ou transcrire un fichier existant sans serveur : `wlk transcribe reunion.wav`.
Points de vigilance
- C'est un composant technique sans interface de prise de notes ou de résumé : il ne remplace pas un outil comme Meetily pour un usage réunion clé en main, il sert à en construire un
- Les fonctionnalités avancées (backends GPU CUDA, Qwen3-ASR vLLM, diarisation Sortformer) demandent une installation et des dépendances Python distinctes selon le profil matériel choisi
- La qualité de la transcription en direct dépend du modèle Whisper ou du backend choisi, comme pour tout outil basé sur ces modèles : les petits modèles vont plus vite mais transcrivent moins bien
Questions fréquentes
WhisperLiveKit est-il adapté à un chef de projet qui veut juste des comptes-rendus de réunion ?
Pas directement : c'est un serveur de transcription sans interface de prise de notes, pensé pour les développeurs qui construisent un outil. Pour un usage réunion prêt à l'emploi avec résumés automatiques, voir plutôt Meetily dans cette même Agenthèque.
Les données audio quittent-elles la machine ?
Non, le traitement est entièrement local une fois le serveur installé, ce qui distingue ce projet des API de transcription cloud facturées à l'usage.
Peut-on l'utiliser sans carte graphique dédiée ?
Oui, un profil CPU est disponible, avec des modèles plus légers. Les profils GPU (CUDA) accélèrent le traitement mais demandent une installation séparée des dépendances correspondantes.
Outils similaires
À explorer aussi
Claude Code
L'agent en ligne de commande d'Anthropic, capable de lire, écrire et exécuter du code directement dans un projet réel.
Vercel MCP
Le serveur MCP de Vercel : consulter déploiements, logs et projets directement depuis un agent IA.
Playwright
Le framework de test et d'automatisation navigateur de Microsoft, utilisé ici pour capturer des captures d'écran réelles.