Morgan Dutemple
← Toute l'Agenthèque
SkillRecherche & veilleClaude

PixelRAG

PixelRAG (Berkeley SkyLab, BAIR, Berkeley NLP) part d'un constat simple : parser une page en texte fait perdre les tableaux, graphiques et mises en page qui portent souvent la réponse. L'outil rend les documents en captures d'écran et retrouve l'information directement sur l'image, via un modèle Qwen3-VL-Embedding fine-tuné pour ça. Il expose aussi une skill Claude Code, pixelbrowse, qui capture une page avec la commande `pixelshot` et donne l'image à lire à Claude plutôt que du HTML, sans MCP ni backend. Une API hébergée gratuite sert un index déjà construit de 8,28 millions de pages Wikipedia.

Interface de recherche visuelle PixelRAG sur l'index Wikipedia

Avantages clés

  • Conserve la structure visuelle (tableaux, graphiques, mise en page) que le parsing HTML/texte classique perd
  • Skill Claude Code installable sans serveur MCP ni backend : appelle simplement `pixelshot` (Playwright/CDP) en local
  • API hébergée gratuite avec un index pré-construit de 8,28M pages Wikipedia, sans clé API
  • Recherche multimodale : la requête peut être du texte ou une image
  • Fonctionne sur Linux (CUDA) et macOS (Apple Silicon/MPS) pour construire un index local

Pour qui, pour quoi

Développeurs et chercheurs qui veulent qu'un agent lise une page comme un humain (tableaux, graphiques, mise en page), ou qui construisent un pipeline de recherche visuelle sur leurs propres documents.

  • Donner à Claude Code la capacité de lire visuellement une page plutôt que son HTML brut, via la skill pixelbrowse
  • Recherche visuelle sur un corpus de documents (PDF, pages web) sans perdre la mise en page au moment du parsing
  • Interroger l'index hébergé de 8,28 millions de pages Wikipedia, par texte ou par image, sans installation

Comment démarrer

  1. 1Installer l'outil pour que `pixelshot` soit sur le PATH : `uv tool install pixelrag` (ou `pipx install pixelrag`).
  2. 2Ajouter le marketplace de plugins Claude Code : `claude plugin marketplace add StarTrail-org/PixelRAG`.
  3. 3Installer la skill : `claude plugin install pixelbrowse@pixelrag-plugins`.
  4. 4Utiliser : `claude -p "screenshot https://example.com et résume les points clés"`, ou la commande `/screenshot` en session interactive.

Points de vigilance

  • Construire son propre index (`pixelrag index build`) nécessite le modèle Qwen3-VL-Embedding ; sur de gros volumes, un GPU CUDA accélère nettement le traitement par rapport à Apple Silicon (MPS).
  • Le module d'entraînement (`train/`) est un projet uv séparé avec un environnement figé (torch, transformers, cuDNN) : à installer depuis son propre dossier, pas depuis la racine du dépôt.
  • Projet de recherche universitaire (Berkeley) plutôt qu'un produit commercial : le support passe par GitHub et Slack communautaires, pas par un SLA.

Questions fréquentes

Faut-il un serveur MCP pour utiliser la skill pixelbrowse ?

Non. La skill appelle directement la commande pixelshot en local (Playwright/CDP), sans MCP ni backend distant.

Faut-il un GPU pour l'utiliser ?

Non pour l'API hébergée (index Wikipedia pré-construit) ni pour indexer un petit corpus local, qui tourne aussi sur Apple Silicon (MPS). Un GPU CUDA accélère la construction d'index sur de gros volumes.

PixelRAG est-il limité à Wikipedia ?

Non : l'index de 8,28 millions de pages Wikipedia est un exemple pré-construit accessible via l'API hébergée. Le pipeline pixelrag index build fonctionne sur n'importe quel corpus de documents locaux (PDF, pages web).