Um fornecedor envia uma nota em PDF. A IA reconhece CNPJ, itens, quantidades, vencimento e total; o resultado chega organizado em JSON. Parece pronto para o ERP. Só que a quantidade de uma linha veio da coluna “embalagem”, o desconto foi interpretado como acréscimo e o CNPJ pertence à filial errada.
O arquivo foi lido, a resposta obedeceu ao formato e nenhum campo ficou vazio. Mesmo assim, o lançamento estaria errado. Esse é o salto que muitos projetos ignoram: extrair texto não é validar um fato; preencher campos não é autorizar uma ação.
Este artigo apresenta o método CONFERE para transformar PDFs, fotos, e-mails, planilhas e formulários em dados operacionais com classificação, evidência por campo, reconciliação e rota de exceção. A meta não é revisar tudo para sempre. É descobrir quais campos podem fluir, quais exigem comparação e quais nunca devem virar decisão automática.
Por que documentos voltaram ao centro da agenda de IA
Documentos concentram contexto que ainda não cabe em linhas limpas de um sistema: pedido enviado por WhatsApp, boletim de medição, proposta de compra, contrato, encaminhamento, laudo, romaneio ou relatório de visita. A IA multimodal tornou a leitura mais flexível, mas não eliminou a desordem anterior à automação.
Em uma pesquisa da Adobe publicada em abril de 2026, baseada em dados agregados do Acrobat e em aproximadamente 800 profissionais nos Estados Unidos, 51% disseram usar IA para resumir documentos, 43% para localizar informação e 30% para interpretar conteúdo. Ao mesmo tempo, 72% queriam que a IA apontasse inconsistências entre versões, e apenas 36% afirmaram conseguir medir formalmente economia ou retorno.
O recorte é de um fornecedor e não representa automaticamente empresas brasileiras. Ainda assim, ele mostra uma transição importante: a leitura inicial ficou mais fácil, enquanto comparação, aprovação e coordenação continuam depois dela. O ganho aparece no começo do fluxo; o risco e o retrabalho reaparecem no final.
Outro estudo de 2026, da BARC, com cerca de 220 respostas internacionais, encontrou que somente 29% sabiam plenamente onde estavam os dados não estruturados relevantes para IA e que 35% não conseguiam rastrear como esses dados eram usados entre sistemas. Antes de perguntar qual modelo lê melhor um PDF, a empresa precisa saber qual documento é válido, de onde veio, quem pode vê-lo e o que sua leitura poderá alterar.
JSON válido não significa dado correto
Uma saída estruturada é essencial para integrar IA a sistemas. Ela impede, por exemplo, que cada resposta use nomes de campos diferentes ou misture explicação com valor. Mas estrutura e verdade são controles distintos.
A própria documentação de Structured Outputs da OpenAI explica que aderir ao esquema não evita todos os erros dentro dos valores. Um campo total pode ser sempre numérico e ainda trazer o número errado. Um campo data_vencimento pode respeitar o formato e ter capturado a data de emissão.
Pesquisas recentes tratam entendimento documental como um problema composto. O DocBench, publicado nos anais da ACL em 2025, avalia sistemas sobre arquivos reais com layouts complexos, conteúdo longo e informação multimodal. Já o ReceiptBench, preprint de 2026 com 10 mil recibos anotados, separa percepção do texto, normalização de formato, raciocínio semântico e reconstrução de itens aninhados. A lição para o gestor é simples: “ler documento” esconde tarefas diferentes e erros diferentes.
Cinco camadas que não devem ser confundidas
- Capturar: receber o arquivo, preservar o original e registrar canal, remetente, horário e identificador.
- Ler: reconhecer texto, tabelas, marcações, posição e elementos visuais relevantes.
- Extrair: mapear trechos para campos definidos, sem completar ausências por plausibilidade.
- Validar: checar tipo, unidade, regra de negócio e consistência com outras fontes.
- Agir: criar, atualizar, aprovar, pagar, agendar ou comunicar dentro de uma alçada explícita.
A automação pode ter ótimo desempenho nas três primeiras camadas e continuar imprópria para a quinta. A fronteira deve ser definida por campo e por consequência, não por uma nota média do documento inteiro.
Método CONFERE: sete controles antes do lançamento
C — Classe e versão do documento
Identifique primeiro o tipo documental: pedido, nota, contrato, proposta, relatório, laudo ou anexo. Registre versão, páginas, idioma, legibilidade e sinais de documento incompleto. Um aditivo não pode ser tratado como contrato integral; uma cotação não deve entrar como pedido confirmado.
O — Origem, identidade e permissão
Preserve o arquivo original e seu hash ou identificador, além de canal, remetente e horário. Confirme a entidade: cliente, fornecedor, obra, imóvel ou paciente correto. A origem define confiança, retenção, acesso e possibilidade de ação. Anexo recebido de fora nunca deve carregar instruções capazes de mudar as regras do agente.
N — Normalização sem adivinhação
Defina um esquema por classe, com campos obrigatórios e opcionais, tipos, unidades e listas permitidas. Quando a informação não estiver presente ou legível, o valor correto é null e uma exceção — não uma estimativa. Separe valor observado, valor normalizado e valor inferido; em rotinas críticas, inferência não deve se disfarçar de extração.
F — Fonte e evidência por campo
Cada campo crítico precisa apontar para página, região ou trecho de onde veio. Guarde também o texto bruto quando aplicável. Isso permite ao revisor ir direto à evidência, em vez de reler o arquivo inteiro. Confiança calculada pelo modelo pode ajudar na triagem, mas não substitui prova localizável.
E — Exatidão semântica e regras
Teste datas impossíveis, casas decimais, moeda, unidade de medida, subtotal, imposto, desconto, sinal negativo, códigos e dígitos verificadores. Depois aplique regra operacional: item existe? fornecedor está ativo? preço está vigente? a soma das linhas fecha com o total? o lote pertence à unidade certa?
R — Reconciliação com sistemas oficiais
Compare o documento com cadastro, contrato, pedido, agenda ou estoque. Trate divergência como um estado do processo, não como erro a ser escondido. O documento pode estar correto e o cadastro, desatualizado; por isso, a reconciliação precisa indicar qual fonte é oficial por atributo e quem decide o conflito.
E — Exceção, execução e evidência final
Defina quando aceitar automaticamente, quando pedir revisão e quando bloquear. Se houver escrita, use idempotência, alçada e recibo do sistema. O registro final deve ligar documento original, campos extraídos, regras aplicadas, correções humanas, aprovador e identificador da ação executada.
Matriz: verificabilidade × consequência
- Fácil de verificar + baixa consequência: automatize após testes; faça amostragem periódica e monitore mudança de layout.
- Fácil de verificar + alta consequência: valide deterministicamente e preserve aprovação proporcional antes da ação.
- Difícil de verificar + baixa consequência: use como sugestão, classificação ou rascunho; não trate ausência de reclamação como acerto.
- Difícil de verificar + alta consequência: organize evidências para um especialista; não automatize a decisão final.
“Confiança de 95%” não resolve a matriz. O mesmo erro tem efeitos diferentes: trocar uma categoria interna pode ser corrigível; trocar quantidade, paciente, preço ou conta bancária pode gerar perda material. O controle segue a consequência.
Contrato de campo: 14 itens para sair do prompt genérico
- nome e significado do campo;
- classe documental em que se aplica;
- tipo e formato esperado;
- obrigatório, opcional ou condicional;
- unidade, moeda e escala;
- exemplo válido e contraexemplo;
- localizações ou rótulos prováveis;
- regra para ausente, ilegível e ambíguo;
- evidência mínima a preservar;
- normalização permitida;
- fonte oficial para reconciliação;
- regra de validação e tolerância;
- consequência de erro e rota de revisão;
- destino, alçada e recibo da escrita.
Esse contrato transforma “extraia os dados importantes” em uma especificação testável. Também permite trocar modelo ou fornecedor sem perder a definição do resultado.
Como aplicar nas verticais da V7
- v7 Obras: extraia período, serviço, quantidade e local de boletins ou medições; reconcilie com contrato e etapa; preserve aprovação técnica e financeira fora da IA.
- v7 Carteira: leia pedidos, notas e comprovantes; compare cliente, SKU, embalagem, preço, condição e total com ERP antes de criar pedido ou baixar pendência.
- v7 Agro: organize romaneios, pedidos e relatórios de visita por cliente, propriedade, produto, lote, unidade e data; encaminhe divergências e decisões agronômicas ao responsável habilitado.
- v7 Imob: extraia dados de propostas e documentos cadastrais para checklist; separe pendência documental de conclusão jurídica e preserve conferência especializada.
- v7 Clínicas Retorno: identifique paciente, data, solicitante e tipo documental em pedidos e encaminhamentos; nunca converta extração administrativa em interpretação clínica.
- v7 Custom: contas a pagar, compras, contratos e backoffice podem usar o mesmo trilho: documento, campos, evidência, regra, reconciliação, alçada e recibo.
Placar de uma operação documental confiável
- cobertura por campo: quantos valores esperados foram localizados sem inventar ausências;
- exatidão de campos críticos: percentual exatamente correto em quantidade, identidade, valor, data e unidade;
- aceite indevido: erro que passou pelas regras e alcançou revisão tardia ou sistema oficial;
- exceção correta: caso ambíguo, ilegível ou divergente encaminhado ao destino certo;
- correção humana por motivo: layout, OCR, semântica, cadastro, regra ou documento de origem;
- tempo por documento aceito: captura até conclusão, incluindo fila e retrabalho;
- reconciliação: ações confirmadas no sistema oficial sem duplicidade ou diferença residual.
Meça por classe, origem e campo. Uma média global pode esconder que cabeçalho funciona muito bem enquanto itens de tabela falham justamente onde está o impacto econômico.
Piloto assistido de 20 dias úteis
- Dias 1 a 3: escolha uma única classe documental, um resultado e um owner. Levante variações reais de origem, qualidade e layout.
- Dias 4 a 6: crie o contrato dos campos, a matriz de consequência e um conjunto de referência revisado por humanos. O NIST destaca dados de avaliação criados por humanos ao medir extração de entidades, eventos e relações.
- Dias 7 a 10: rode em modo sombra. Compare cada campo, classifique erros e verifique se a evidência realmente acelera a revisão.
- Dias 11 a 14: implemente regras determinísticas, reconciliação e filas distintas para ausente, ilegível, ambíguo e divergente.
- Dias 15 a 18: permita somente ações de baixa consequência ou preparação de lançamento, com revisão e recibo.
- Dias 19 e 20: compare tempo, exatidão crítica, escapes e custo por documento aceito. Decida campo a campo: automatizar, assistir, bloquear ou retirar.
Inclua documentos fáceis e ruins, versões antigas, tabelas longas, fotos tortas, campos ausentes e entidades parecidas. Um piloto feito apenas com PDFs perfeitos mede demonstração, não operação.
Sinais de alerta
- a equipe avalia o documento pela aparência da resposta, sem gabarito por campo;
- campos ausentes são completados com valores prováveis;
- o JSON está correto e isso é apresentado como prova de exatidão;
- não há ligação entre valor extraído e página ou trecho de origem;
- uma nota média mistura campos cosméticos e campos que movimentam dinheiro;
- o modelo resolve divergências entre documento e ERP sem regra de precedência;
- a revisão humana relê tudo porque a evidência não foi preservada;
- mudança de layout só é descoberta depois de lançamentos errados;
- o sistema recebe escrita sem chave contra duplicidade, alçada ou recibo;
- não existe responsável pela qualidade após a implantação.
O ponto de vista da V7 Agents
IA só gera ROI quando existe processo, dados, responsável, rotina de revisão e implantação operacional. Em documentos, isso significa ir além do “modelo consegue ler”: definir o que será extraído, como cada campo será provado, contra qual fonte será reconciliado e quem responde quando houver divergência.
O V7 IA Ready mapeia classes documentais, volume, retrabalho, sistemas, campos críticos e riscos antes da integração. Os Agentes Verticais aplicam contratos e regras ligados ao setor. A Operação Contínua acompanha layouts, erros, exceções e resultado. O objetivo não é digitar menos a qualquer custo; é produzir dados aceitos que a operação possa usar e explicar.
Fontes consultadas
- Adobe — State of AI in Documents, abril de 2026.
- BARC — Harnessing Unstructured Data for AI Innovation, junho de 2026.
- OCDE — Empowering SMEs in the Age of AI, abril de 2026.
- ACL Anthology — DocBench, maio de 2025.
- ReceiptBench — preprint e conjunto de avaliação, maio de 2026.
- OpenAI — Structured Outputs e suas limitações, agosto de 2024.
- NIST — RUFEERS Annotation Guidelines, 2026.
Seus documentos já viram dados confiáveis ou apenas respostas convincentes?
O V7 IA Ready identifica documentos, campos críticos, regras, integrações e controles para escolher um piloto com valor operacional e risco delimitado.