|

PIXELRAG : le web scraping enfin lisible par les machines, pixel par pixel

https://github.com/StarTrail-org/PixelRAG

📌 PIXELRAG est un système de recherche RAG (Retrieval-Augmented Generation) qui indexe des captures d’écran plutôt que du texte brut. Conçu par Berkeley SkyLab, il lit les pages web comme un humain : en regardant les pixels, pas le code HTML.

L’idée est simple et profonde. Les parsers HTML cassent silencieusement l’information : un tableau devient du texte incohérent, un graphique disparaît, une mise en page complexe se réduit à une suite de paragraphes. Changez de parser et votre RAG perd 10 % de précision, sans que personne ne s’en aperçoive. PIXELRAG contourne le problème en rendant chaque page en tuiles d’images, puis en vectorisant ces images avec Qwen3-VL-Embedding, un modèle de vision fine-tuné par LoRA sur des captures d’écran web.

Le résultat est éloquent : sur un index de 30 millions de pages Wikipédia, PIXELRAG surpasse de 18,1 % le meilleur système RAG textuel sur des tâches de questions-réponses. Et parce que l’index stocke des pixels et non du texte parsé, vous pouvez changer de modèle de vision sans reconstruire l’index — l’information visuelle reste stable.

Le pipeline se décompose en quatre étapes. D’abord, pixelshot rend les pages en tuiles d’images via Playwright/CDP, que ce soit pour des pages web, des PDFs ou des fichiers locaux. Ensuite, pixelrag chunk découpe ces tuiles. Puis pixelrag embed les vectorise avec le modèle Qwen3-VL-Embedding-2B. Enfin, pixelrag build-index construit un index FAISS — ou Qdrant pour les déploiements à grande échelle.

L’intégration avec Claude Code est particulièrement intéressante. Le plugin pixelbrowse remplace la lecture du DOM par des captures d’écran : au lieu d’analyser le HTML, Claude prend une capture de la page et lit l’image directement. Il voit les tableaux, les diagrammes, les formulaires exactement comme vous les voyez. L’installation se fait en deux commandes, et le skill fonctionne sans serveur MCP — il appelle pixelshot en local.

PIXELRAG fonctionne sur Linux (CUDA) et macOS (Apple Silicon/MPS). L’installation via pip install pixelrag donne accès au CLI complet. Un index pré-construit de 8,28 millions de pages Wikipédia est disponible via une API publique, sans clé API. Pour vos propres documents, la construction d’un index prend environ trois minutes sur un Mac M-series.

Points clés :

  • 📸 Indexe des captures d’écran au lieu de texte parsé
  • 🧠 Qwen3-VL-Embedding fine-tuné par LoRA sur des screenshots web
  • 📊 +18,1 % de précision vs meilleurs RAG textuels (30M pages Wikipédia)
  • 🔌 Plugin Claude Code pour la navigation visuelle
  • ⚡ Pipeline : pixelshot → chunk → embed → FAISS/Qdrant
  • 🐧 Fonctionne sur Linux CUDA et macOS Apple Silicon
  • 📦 Index Wikipédia pré-construit (8,28M pages) via API publique
  • 📄 Apache 2.0, 8,8k stars, Berkeley SkyLab/BAIR/NLP

J’ai trouvé l’approche convaincante parce qu’elle résout un vrai problème silencieux. Les parsers HTML ne cassent pas bruyamment — ils perdent de l’information sans signal d’erreur. En indexant ce que l’utilisateur voit réellement, PIXELRAG élimine toute une classe d’erreurs de transformation. Le plugin Claude Code est un bonus élégant : votre agent peut enfin lire une page comme vous la lisez.

Sources :

Publications similaires

Laisser un commentaire