LlamaIndex
LlamaIndex fournit les briques pour indexer des documents (PDF, bases de données, API) et les rendre interrogeables par un agent IA, avec des capacités d'OCR et d'extraction de documents structurés.

Avantages clés
- Large écosystème de connecteurs de données
- Capacités d'OCR et d'extraction de documents intégrées
- Un des standards de facto pour le RAG
Pour qui, pour quoi
Équipes data qui construisent des systèmes de question-réponse sur leurs propres documents ou bases de données.
- Construction de pipelines RAG sur documents internes
- Extraction structurée de données depuis des PDF
- Indexation de bases de connaissances pour un agent IA
Comment démarrer
- 1Installer le cœur : `pip install llama-index-core`.
- 2Ajouter les intégrations nécessaires à la carte, par exemple `pip install llama-index-llms-openai` ou `pip install llama-index-embeddings-huggingface`.
- 3Construire un index vectoriel simple à partir de documents locaux, en suivant les exemples du dossier `docs/examples` du dépôt.
Points de vigilance
- Architecture modulaire (cœur + dizaines de paquets d'intégration séparés) : demande de bien identifier les bons paquets à installer selon le fournisseur de modèle et de stockage vectoriel choisi.
- Un pipeline RAG bien réglé (chunking, choix d'embeddings, retrieval) demande un travail d'optimisation ; l'installation seule ne garantit pas des résultats pertinents par défaut.
Questions fréquentes
LlamaIndex est-il limité à un seul fournisseur de modèle ou de stockage vectoriel ?
Non, c'est justement son architecture modulaire : des dizaines de paquets d'intégration permettent de brancher différents LLM, embeddings et bases vectorielles selon les besoins.
Faut-il connaître le RAG (retrieval-augmented generation) pour s'en servir ?
Des notions de base aident, mais le projet fournit des exemples prêts à l'emploi pour démarrer avant d'optimiser plus finement chunking et retrieval.
Est-ce gratuit ?
La bibliothèque est open source et gratuite ; les coûts proviennent des services tiers connectés (API de modèle, base vectorielle hébergée).
Outils similaires
À explorer aussi
Google Search Console MCP
Un serveur MCP qui expose les données de performance de recherche Google Search Console à un agent IA.
Stripe Agent Toolkit
La boîte à outils officielle de Stripe pour construire des produits et automatisations financières pilotées par IA.
MarkItDown
Un outil Python de Microsoft qui convertit fichiers et documents bureautiques en Markdown, prêt pour un agent IA.