ExtractBench mede extração além da resposta certa
O ExtractBench é um benchmark de extração de documentos guiada por schema, com 4.869 páginas e 370 documentos empresariais; ele mede precisão de valores, completude de registros, grounding e custo em conjunto. Por que importa: Uma extração pode devolver campos com aparência correta e ainda perder uma lista longa ou a página que sustenta o dado. Essas verificações ausentes aparecem depois, quando alguém precisa confiar no registro.
Para testar: Rode dez documentos de um fluxo pelo extrator e meça a precisão dos campos, a completude, o grounding por página-fonte e o custo antes de comparar modelos.