Descrição: Um novo software de inteligência artificial da China, conhecido como PaddleOCR, lançou uma atualização que permite a leitura de texto em imagens em 50 idiomas distintos. O OCR (Reconhecimento Óptico de Caracteres) é uma tecnologia que converte fotos de documentos, placas ou telas em texto editável no computador. A atualização recebe o nome de PP-OCRv6 e está disponível em três tamanhos, adequados para uso em dispositivos móveis e grandes servidores.
A introdução do PP-OCRv6 eleva o nível do ecossistema de reconhecimento óptico de caracteres, sendo a mais nova versão da linha de modelos universais do PaddleOCR. Este modelo foi desenvolvido para funcionar em situações práticas — que incluem documentos, capturas de tela, imagens multilíngues, displays digitais, rótulos industriais e textos em ambientes variados — surpreendendo pela sua combinação de alta precisão e leveza computacional. Ele disponibiliza três escalas diferentes com parâmetros que variam entre 1,5 milhão a 34,5 milhões.
De acordo com um artigo técnico publicado no blog da Hugging Face, essa nova arquitetura representa um avanço significativo se comparada à geração anterior. Nos testes internos realizados pelo PaddleOCR, a versão média do PP-OCRv6 atingiu uma taxa de precisão de 86,2% na detecção de texto e 83,2% na acurácia de reconhecimento. Esses números representam um aumento de 4,6 pontos percentuais na detecção e 5,1 pontos percentuais no reconhecimento em relação ao seu antecessor, o PP-OCRv5_server.
Um dos aspectos mais notáveis do PP-OCRv6 é sua abordagem unificada para múltiplos idiomas. As versões menores e médias suportam 50 idiomas diferentes, que incluem chinês simplificado e tradicional, inglês, japonês e outras 46 línguas com escrita latina. Essa funcionalidade elimina a necessidade de manter modelos distintos para cada idioma em aplicações que requerem processamento internacional de texto.
A base da arquitetura é sustentada pelo PPLCNetV4, utilizado como um backbone para ambas as funções: detecção e reconhecimento de texto. Para a fase de detecção, os desenvolvedores do PaddleOCR implementaram o RepLKFPN, uma rede piramidal leve com grandes kernels projetada para lidar com textos em diversas escalas — incluindo caracteres pequenos e densos ou aqueles rotacionados em fundos complexos — sem comprometer a eficiência na inferência.
No módulo dedicado ao reconhecimento, o EncoderWithLightSVTR integra modelagem de contexto local com atenção global. Essa combinação melhora a qualidade do reconhecimento em trechos desafiadores de texto. Isso resulta em benefícios tangíveis para textos multilíngues e também para caracteres industriais e símbolos especiais presentes em regiões ruidosas da imagem — cenários frequentes nos sistemas corporativos voltados à digitalização documental e à automação dos processos.
A versatilidade na implantação é outro aspecto importante desta novidade. O PP-OCRv6 pode ser operado com diversos backends por meio da interface unificada do PaddleOCR 3.7. Isso inclui o motor nativo Paddle Inference, o ONNX Runtime e um backend baseado em Transformers para os usuários da plataforma Hugging Face. Para utilizá-lo, basta instalar o pacote usando pip install paddleocr e alternar o parâmetro engine entre paddle, onnxruntime ou transformers, conforme as exigências do ambiente produtivo.
Os resultados obtidos pelo OCR podem ser salvos não apenas como imagens visualizáveis mas também como saídas JSON estruturadas. Isso facilita a integração com sistemas downstream como análise documental, motores de busca, pipelines RAG (Recuperação Aumentada Generativa), plataformas analíticas e fluxos de trabalho baseados em agentes. Essa padronização reduz o tempo necessário para desenvolvimento por parte das equipes que buscam transformar documentos digitalizados em dados prontos para uso.
A comunidade de código aberto recebe entusiasticamente o PP-OCRv6 com diversos formatos de modelo disponíveis no Hugging Face Hub — incluindo safetensors, modelos Paddle para inferência e modelos ONNX. O pacote também fornece uma demonstração interativa online além de documentação abrangente para facilitar avaliação rápida e integração — se configurando como uma ferramenta madura, leve e ideal para produção em projetos relacionados à digitalização de acervos ou automação administrativa.
Informações adicionais foram extraídas da HUGGINGFACE.
