UNLIMITED-OCR : analyser des dizaines de pages de PDF en une seule passe, sans faire exploser la mémoire

https://huggingface.co/baidu/Unlimited-OCR

📌 Unlimited-OCR est un modèle open source de Baidu qui traite des documents multi-pages en une seule génération, avec une mémoire qui ne grossit pas au fil des pages. 3 milliards de paramètres, 1,9 million de téléchargements sur Hugging Face, et une idée claire : faire mieux que DeepSeek-OCR en restant compact.

Le nom « Unlimited » fait rêver, mais il ne faut pas se méprendre. Ce n’est pas un OCR illimité au sens littéral. Le contexte reste borné à environ 32 768 tokens. Ce que le modèle fait réellement, c’est analyser plusieurs dizaines de pages en une seule passe sans que la mémoire et le temps de calcul n’explosent. C’est différent, et c’est justement l’intérêt.

Le mécanisme s’appelle Reference Sliding Window Attention — R-SWA. En clair, le modèle conserve un KV cache de taille constante. Il ne traîne pas derrière lui une valise qui grossit à chaque page. Pour des rapports, des livres scannés, des contrats ou des PDF longs, c’est exactement le problème qu’on veut résoudre. Les benchmarks annoncent 93 % sur le standard de parsing — 6 points au-dessus du baseline — et un taux d’erreur inférieur à 0,11 % au-delà de 40 pages.

Unlimited-OCR ne se contente pas d’extraire du texte. C’est plutôt un parseur de documents : reconnaissance de caractères, restitution de la structure, production de Markdown, traitement des tableaux, des titres, des paragraphes et des documents multi-pages. La cohérence entre plusieurs pages est potentiellement meilleure qu’avec des outils qui traitent chaque page isolément. Le modèle est multilingue nativement.

Le modèle ne fait que 3 milliards de paramètres, avec environ 8 Go de poids en BF16. C’est relativement compact par rapport aux gros modèles multimodaux. Côté déploiement, il fonctionne avec Transformers, vLLM, SGLang, Docker, Ollama et llama.cpp. Les OCR cloud — Textract, Google Vision, Azure Doc Intelligence — coûtent entre 1,50 $ et 15 $ pour 1 000 pages. Celui-ci tourne sur votre propre machine, gratuitement.

  • 🧠 R-SWA : mémoire constante quelle que soit la longueur du document
  • 📄 Traitement multi-pages en une seule passe, sans perte de contexte
  • 📊 93 % sur le benchmark standard de parsing
  • 📝 Sortie Markdown structurée avec tableaux et titres
  • 💻 Compatible Transformers, vLLM, SGLang, Docker, Ollama, llama.cpp

Le problème pour un usage local sur Mac : la documentation est pensée pour CUDA, les cartes NVIDIA, vLLM ou SGLang, Linux et BF16. Le code Transformers contient directement model.eval().cuda(). Pas de port MLX ou Metal officiel. Théoriquement, un portage Apple Silicon serait envisageable avec PyTorch MPS ou MLX, mais il faudrait adapter le code personnalisé du modèle, vérifier les opérateurs utilisés par R-SWA et créer une quantification compatible. Mac avec 32 Go aurait assez de mémoire si un port MLX propre existait — mais ce port est précisément la pièce manquante.

Les performances restent à confronter au terrain. Le modèle est sorti le 22 juin 2026, il manque encore de comparatifs indépendants. Une discussion Hugging Face signale déjà de mauvais résultats avec la démo officielle, ce qui ne prouve pas que le modèle est mauvais, mais invite à ne pas prendre la vitrine pour la cuisine entière.

Il faut aussi noter que le modèle nécessite trust_remote_code=True — l’exécution de code personnalisé téléchargé avec le dépôt. Le dépôt est publié par Baidu sous licence MIT, mais sur une machine contenant des documents sensibles, il vaut mieux inspecter et épingler une révision précise.

Unlimited-OCR est techniquement élégant — l’idée de traiter un document multi-page dans une seule passe avec une mémoire stable est réellement innovante. Pour un serveur Linux avec NVIDIA, c’est à tester sérieusement face à DeepSeek-OCR et PaddleOCR. Pour un usage Mac, il faudra attendre un port MLX propre.

Sources :

Publications similaires

Laisser un commentaire