A Mistral lançou o OCR 4, um modelo de inteligência documental com uma reviravolta simples: em vez de apenas extrair texto de um arquivo, ele devolve a estrutura. O OCR 4 retorna caixas delimitadoras, classificação de blocos tipados que rotula títulos, tabelas, equacoes e assinaturas, e pontuações de confiança inline para o que ele leu. O texto e apenas parte da saida, e indiscutivelmente a parte menos interessante.

A estrutura e a confiança são o ponto central, porque são o que os sistemas de recuperação vinham deixando de lado. O OCR simples lhe da uma parede de caracteres, mas perde de onde cada pedaco veio e quao confiavel ele e. Com caixas delimitadoras, tipos de bloco e confiança por trecho, um sistema posterior pode construir citações ancoradas na fonte que apontam para a região exata de uma pagina, ocultar blocos sensíveis e encaminhar trechos de baixa confiança para um humano revisar. Essa e a camada entre escanear um PDF e confiar no que sai dele.

Em cobertura e implantação, o OCR 4 suporta 170 idiomas em 10 grupos linguisticos, com ganhos mensuraveis em idiomas especializados e de poucos recursos, onde muitos sistemas concorrentes degradam. Ele aceita os formatos que as empresas realmente usam, incluindo PDF, DOC, PPT e OpenDocument. Igualmente importante, o modelo e compacto o suficiente para rodar em um único container, o que significa que pode ser auto-hospedado, uma consideração real para organizações cujos documentos não podem deixar suas próprias paredes.

A Mistral respalda o lançamento com números. Ela afirma que anotadores independentes preferiram o OCR 4 a todos os sistemas testados, com uma media de 72% de taxa de vitória, e que o modelo lidera o ranking público OlmOCRBench com uma pontuação de 85.20. A cautela de sempre se aplica: o enquadramento da taxa de vitória e da própria Mistral, e os benchmarks de OCR medem fatias estreitas de um problema confuso. O teste de verdade são documentos desajeitados do mundo real, escrita a mão, digitalizacoes ruins e tabelas densas, onde as pontuações tendem a cair.

A mudança que vale notar e no que o OCR esta se tornando. Ele não e mais uma etapa de despejo de texto no inicio de um pipeline, mas a camada de ingestão para a recuperação, emitindo a estrutura e a incerteza que a IA ancorada realmente precisa. A medida que mais dos dados uteis dentro das empresas residem em PDFs e apresentações de slides, um modelo documental que retorna citações e confiança, e roda dentro do seu próprio container, e uma peça discretamente estrutural da pilha de RAG. Menos chamativo do que mais um chatbot, e mais provável de ser a coisa que torna o chatbot confiavel.