Morgan Dutemple
← Toute l'Agenthèque
ApplicationData & analyseClaudeAgnostique

Data Formulator

Data Formulator est un projet Microsoft Research qui combine interactions graphiques (glisser-déposer de champs sur un graphique) et langage naturel pour explorer des données. L'agent d'analyse (`DataAgent`) propose un plan de chargement à partir de fichiers (CSV, TSV, Excel, JSON), de captures d'écran, de texte ou de connecteurs (PostgreSQL, MySQL, MSSQL, Azure Data Explorer, S3, Azure Blob, Databricks, URLs live avec actualisation automatique), puis écrit lui-même le SQL et les transformations sous-jacentes. Chaque question ouvre un "Data Thread" : on peut ancrer un résultat nettoyé, brancher une variante à partir de n'importe quelle étape antérieure pour comparer deux pistes, et composer le tout en rapport partageable. Les graphiques (plus de 30 types) sont rendus par Flint, un moteur de visualisation également open source publié par Microsoft.

Dépôt GitHub de Data Formulator, projet Microsoft Research de visualisation de données par agent IA

Avantages clés

  • Licence MIT, projet Microsoft Research actif depuis juin 2024, plus de 16 000 étoiles GitHub, dernière version bêta publiée le 15 août 2026
  • Fonctionne en local (uv, pip ou Docker) avec votre propre clé pour le fournisseur LLM de votre choix (OpenAI, Azure, Anthropic, Ollama, via LiteLLM)
  • Moteur de graphiques Flint, également open source : plus de 30 types de graphiques compilés à partir de spécifications compactes

Pour qui, pour quoi

Analystes de données et équipes qui veulent explorer des données par visualisation sans écrire le SQL à la main, en gardant un historique de branches d'analyse plutôt qu'un chat qui s'accumule sans structure.

  • Connecter une source de données (fichier, base SQL, entrepôt, URL live) et laisser l'agent proposer un plan de chargement avant de l'ajouter à l'espace de travail
  • Explorer une question par glisser-déposer de champs sur un graphique, puis affiner en langage naturel sans perdre l'historique de la conversation
  • Brancher une analyse à partir d'une étape antérieure pour comparer deux pistes côte à côte, plutôt que de repartir d'un unique fil de chat linéaire

Comment démarrer

  1. 1Avec uv (recommandé) : `uvx data_formulator`, qui ouvre l'interface dans le navigateur à l'adresse http://localhost:5567.
  2. 2Avec pip : `pip install data_formulator` puis `python -m data_formulator`.
  3. 3Avec Docker : `docker compose up --build`, puis ouvrir http://localhost:5567 dans le navigateur.

Points de vigilance

  • Les builds d'application desktop (Windows/macOS) publiées en artefacts CI ne sont à ce jour ni signées ni notariées, ce qui déclenche un avertissement du système d'exploitation à l'ouverture
  • La version 0.8, qui unifie le chargement des données et le Data Thread, est encore en bêta (`0.8.0b1`) au 18/08/2026 ; la version stable installée par défaut via pip reste la 0.7
  • Aucune capacité d'IA embarquée gratuite : la génération de SQL et l'agent d'analyse dépendent d'une clé de fournisseur LLM externe que vous configurez et payez vous-même

Questions fréquentes

Data Formulator nécessite-t-il un abonnement ?

Non, l'outil lui-même est gratuit et open source (licence MIT). Le seul coût est celui des appels au fournisseur LLM que vous choisissez (OpenAI, Azure, Anthropic), facturés directement par ce fournisseur, ou aucun coût avec un modèle local via Ollama.

Peut-on l'essayer sans rien installer ?

Oui, une démo en ligne est disponible sur data-formulator.ai. Pour un usage régulier avec ses propres données, l'installation locale via `uvx data_formulator`, pip ou Docker reste recommandée.

Quelles sources de données sont supportées ?

CSV, TSV, Excel, JSON, captures d'écran et texte en import direct, plus des connecteurs vers PostgreSQL, MySQL, MSSQL, Azure Data Explorer, S3, Azure Blob, Databricks, et des URLs live avec actualisation automatique.