Mistral a publié OCR 4, un modèle d'intelligence documentaire avec une nuance simple : au lieu de se contenter d'extraire le texte d'un fichier, il restitue la structure. OCR 4 renvoie des boîtes englobantes, une classification en blocs types qui étiquette les titres, les tableaux, les équations et les signatures, ainsi que des scores de confiance en ligne pour ce qu'il a lu. Le texte n'est qu'une partie de la sortie, et sans doute la moins intéressante.

La structure et la confiance sont l'essentiel, car c'est précisément ce qui manquait aux systèmes de recherche documentaire. L'OCR ordinaire vous donne un mur de caractères mais perd la provenance de chaque élément et son degré de fiabilité. Avec des boîtes englobantes, des types de blocs et une confiance par passage, un système en aval peut construire des citations ancrées dans la source qui pointent vers la zone exacte d'une page, masquer les blocs sensibles et acheminer les passages à faible confiance vers un humain pour révision. C'est la couche entre la numérisation d'un PDF et la confiance que l'on peut accorder à ce qui en sort.

Côté couverture et déploiement, OCR 4 prend en charge 170 langues réparties en 10 groupes linguistiques, avec des gains mesurables sur les langues spécialisées et peu dotées où de nombreux systèmes concurrents se dégradent. Il accepte les formats que les entreprises utilisent réellement, dont PDF, DOC, PPT et OpenDocument. Tout aussi important, le modèle est assez compact pour tourner dans un seul conteneur, ce qui signifie qu'il peut être auto-hébergé, une considération concrète pour les organisations dont les documents ne peuvent pas quitter leurs propres murs.

Mistral appuie son annonce par des chiffres. L'entreprise affirme que des annotateurs indépendants ont préféré OCR 4 à tous les systèmes testés, avec un taux de victoire moyen de 72 %, et que le modèle domine le classement public OlmOCRBench avec un score de 85.20. La prudence habituelle s'impose : le cadrage du taux de victoire vient de Mistral elle-même, et les benchmarks d'OCR mesurent des tranches étroites d'un problème désordonné. Le vrai test, ce sont les documents réels et difficiles, l'écriture manuscrite, les mauvaises numérisations et les tableaux denses, où les scores ont tendance à chuter.

Le changement qui mérite l'attention, c'est ce que l'OCR est en train de devenir. Ce n'est plus une étape de vidage de texte en amont d'un pipeline, mais la couche d'ingestion pour la recherche documentaire, qui émet la structure et l'incertitude dont une IA ancrée a vraiment besoin. À mesure qu'une part croissante des données utiles au sein des entreprises réside dans des PDF et des présentations, un modèle documentaire qui restitue des citations et une confiance, et qui tourne dans votre propre conteneur, devient une pièce discrètement porteuse de la pile RAG. Moins tape-à-l'oeil qu'un nouveau robot conversationnel, et plus susceptible d'être ce qui rend ce robot digne de confiance.