Due Diligence Automatizado: De Días a Minutos con Procesamiento Local de IA

El due diligence corporativo es un ejercicio de paciencia. Un analista recibe un paquete de 30 a 50 documentos por entidad: actas constitutivas, poderes notariales, identificaciones de accionistas, comprobantes de domicilio, estados financieros, registros mercantiles, opiniones de cumplimiento fiscal. Tiene que abrir cada uno, leer, extraer datos clave, cruzar información entre documentos, detectar inconsistencias y generar un reporte.

Con un paquete, toma un día. Con 10 paquetes en cola, toma dos semanas. Y cuando el deal tiene deadline, el due diligence se convierte en el cuello de botella que retrasa todo.

Qué se extrae en un due diligence típico

Los datos que un analista busca en cada paquete son predecibles:

De las actas constitutivas: razón social, tipo de entidad, fecha de constitución, objeto social, capital social, domicilio, datos del notario, número de escritura.

De los registros de accionistas: nombres de los socios o accionistas, porcentajes de participación, nacionalidad, identificación del beneficiario final (UBO) — quien controla directa o indirectamente más del 25% de la entidad.

De las identificaciones: nombre completo, fecha de nacimiento, número de documento, fecha de vencimiento. Cruce contra la lista de accionistas para verificar que las personas que aparecen como socios son las mismas que presentan identificación.

De los comprobantes fiscales: RFC o equivalente, domicilio fiscal, régimen fiscal, estatus de cumplimiento.

De los estados financieros: activos totales, ingresos, utilidad neta, deuda, razones financieras clave.

Cada uno de estos datos se busca manualmente en documentos que pueden tener cualquier formato, en cualquier idioma, con cualquier calidad de escaneo.

Por qué la automatización tradicional no funciona

La primera reacción de muchos equipos es "compremos un software de OCR". El problema, como explicamos en otro artículo, es que el OCR con plantillas fijas no funciona para documentos con formato variable.

Un acta constitutiva de 1998 en Nuevo León no se parece a una de 2024 en CDMX. Un pasaporte mexicano no se parece a uno americano. Una constancia de situación fiscal del SAT no se parece a un EIN confirmation letter del IRS.

El OCR con plantillas requiere una plantilla por cada variación de formato. En due diligence, donde recibes documentos de múltiples jurisdicciones, notarías y periodos, el número de variaciones es inmanejable.

IA contextual para due diligence

La solución es usar modelos de lenguaje que entienden el contenido del documento independientemente de su formato. El modelo lee un acta constitutiva y entiende que está leyendo un acta constitutiva — identifica las secciones relevantes, extrae los datos estructurados y los devuelve en un formato consistente.

El flujo completo para un paquete de due diligence:

Carga masiva. El analista sube todos los documentos del paquete de una vez. No necesita clasificarlos ni nombrarlos de forma específica.

Clasificación automática. El sistema identifica qué tipo de documento es cada archivo: acta constitutiva, identificación, comprobante de domicilio, poder notarial, estado financiero.

OCR y extracción. Los documentos escaneados pasan por OCR especializado. Los digitales se procesan directamente. Cada documento se analiza con un prompt especializado para su tipo.

Validación cruzada. Los datos de diferentes documentos se cruzan automáticamente. Los nombres de los accionistas en el acta se comparan contra las identificaciones presentadas usando matching difuso (para manejar variaciones como "Juan Pérez" vs "Juan Manuel Pérez García"). Los porcentajes de participación se suman para verificar que dan 100%. Los beneficiarios finales que superan el umbral regulatorio se marcan.

Reporte estructurado. Los datos extraídos y validados se presentan en una vista consolidada que el analista revisa, corrige si es necesario, y aprueba.

El factor privacidad

Los documentos de due diligence contienen información extremadamente sensible: identificaciones personales, datos fiscales, estructura accionaria, información financiera confidencial. Son exactamente el tipo de documentos que no deberían procesarse en servidores de terceros.

Si el sistema de análisis envía estos documentos a una API en la nube, los datos de la entidad bajo revisión — y de todas las personas vinculadas a ella — viajan por internet y se procesan en infraestructura que el analista no controla.

Para despachos legales, fondos de inversión e instituciones financieras, esto puede ser un incumplimiento de sus obligaciones de confidencialidad con el cliente, de las disposiciones de protección de datos personales, y de la regulación de prevención de lavado de dinero que exige controles sobre el manejo de información sensible.

El procesamiento privado elimina este riesgo completamente. Los documentos se procesan en un servidor dentro de la red del despacho o la institución. Los modelos de OCR y de lenguaje corren localmente. Ningún dato sale.

Detección de beneficiarios finales

La identificación del beneficiario final (Ultimate Beneficial Owner / UBO) es un requerimiento regulatorio en México y en la mayoría de las jurisdicciones. Se debe identificar a toda persona física que directa o indirectamente posea más del 25% del capital o ejerza control efectivo sobre la entidad.

En estructuras corporativas simples, esto es directo. En estructuras con múltiples capas societarias, subsidiarias y fideicomisos, la cadena de control puede ser larga y opaca.

El cruce automático de datos permite seguir la cadena: la empresa A tiene como accionista a la empresa B (60%). La empresa B tiene como accionista a Juan Pérez (45%). Entonces Juan Pérez controla indirectamente el 27% de la empresa A (60% × 45%) y es beneficiario final.

Este cálculo, que manualmente requiere diagramas y hojas de cálculo, se hace automáticamente cuando los datos de cada nivel de la cadena están estructurados.

Fullkro: due diligence con IA privada

En Leeuwwolk desarrollamos Fullkro para automatizar exactamente este proceso. El sistema procesa paquetes documentales completos, extrae datos estructurados con IA contextual, cruza información entre documentos, detecta beneficiarios finales y genera reportes consolidados.

El modelo de OCR fue entrenado con más de 950 documentos legales mexicanos reales. Leeuwwolk garantiza la privacidad de los documentos de tus clientes: encriptación en tránsito y en reposo, sin compartir datos con terceros, sin enviar información a servicios de IA públicos.

→ Conoce Fullkro y acelera tu due diligence

Leeuwwolk es una empresa mexicana especializada en inteligencia artificial privada para el sector legal y financiero.