OCR inteligente vs OCR genérico: benchmark en documentos legales mexicanos

¿Qué tan bien lee un OCR los documentos legales mexicanos? Depende enormemente de qué OCR uses.

Hicimos una prueba con 196 documentos legales reales: actas constitutivas, poderes notariales, escrituras públicas y contratos mercantiles. Comparamos un OCR genérico de API en la nube contra un modelo de OCR fine-tuned (entrenado específicamente con documentos legales mexicanos).

El problema con el OCR genérico

Los documentos legales mexicanos tienen características que los hacen particularmente difíciles para un OCR estándar.

La tipografía notarial varía entre notarías: algunas usan fuentes serifadas clásicas, otras fuentes comprimidas para ahorrar espacio. Los sellos y firmas se superponen al texto, creando ruido visual. Las tablas de capital y participación accionaria tienen formatos no estandarizados. Y algunos documentos son copias de copias, con degradación progresiva de calidad.

Un OCR genérico — entrenado con documentos en inglés, formularios estandarizados y texto limpio — simplemente no está preparado para esto.

Los resultados

Procesamos los 196 documentos con ambos sistemas y medimos la cobertura de extracción: qué porcentaje de los campos relevantes (razón social, capital, socios, poderes, objeto social) se extrajeron correctamente.

OCR genérico (API cloud): 63% de cobertura. De cada 10 campos, 4 salieron mal o no se extrajeron.

OCR fine-tuned (modelo local): 94% de cobertura. De cada 10 campos, menos de 1 falló.

La diferencia no es marginal. Es la diferencia entre un sistema que requiere revisión manual de todo y uno donde solo revisas las excepciones.

Por qué funciona el fine-tuning

El OCR fine-tuned fue entrenado con un corpus de documentos legales mexicanos reales. Aprendió a reconocer tipografía notarial, a ignorar sellos y firmas superpuestas, a interpretar tablas de capital en distintos formatos, y a manejar la degradación de calidad de copias certificadas.

No es magia — es entrenamiento con los datos correctos. El mismo principio por el que un abogado con 10 años de experiencia lee un acta constitutiva más rápido que un pasante.

Implicaciones de costo

Más allá de la precisión, hay una implicación de costo que pocas empresas consideran. Un OCR con 63% de cobertura requiere que un humano revise y corrija el 37% restante. Ese costo de corrección, multiplicado por cientos o miles de documentos, frecuentemente supera el costo del procesamiento automático.

Este benchmark fue realizado con Fullkro de Leeuwwolk. Metodología y datos disponibles en theprivatestack.com.