Dijit.app Dijit.app Documentación

Documentación/ Revisar datos generales del documento/ Cómo lee Dijit un documento

Cómo lee Dijit un documento

Entender qué hace el sistema con un documento explica por qué unos campos salen bien siempre y otros requieren atención. El proceso tiene cuatro fases y tarda menos de tres segundos por página.

Las cuatro fases

FaseQué ocurre
1. ReconocimientoEl OCR convierte la imagen del documento en texto localizable.
2. ExtracciónLos modelos de IA interpretan qué es cada dato: cuál de los textos es el emisor, cuál la fecha, cuál la base imponible.
3. ValidaciónSe comprueba la coherencia interna: que base más impuestos sea el total, que las líneas sumen la base, que el desglose de impuestos cuadre, y que el documento no esté duplicado.
4. ClasificaciónSe asignan las cuentas contables aplicando el histórico de la empresa y las reglas configuradas.

El resultado de la fase 3 es lo que determina el estado con el que el documento aparece en el listado.

OCR e inteligencia artificial

Son dos cosas distintas y las dos hacen falta:

Por eso el sistema no depende de plantillas por proveedor: no necesita saber de antemano dónde imprime cada uno sus datos.

Precisión y de qué depende

La precisión media de lectura y clasificación es del 99 % sobre PDF original. En documentos fotografiados depende de la calidad de la imagen.

Origen del documentoComportamiento
PDF generado por el sistema del emisorEl texto está incorporado al archivo. Es el mejor caso.
PDF escaneadoRequiere reconocimiento. Bueno con un escaneo limpio.
FotografíaSensible al encuadre, la iluminación y las sombras.
Ticket térmico o fotocopia degradadaEl peor caso: el original ya ha perdido información.

La consecuencia práctica: cuando un documento se lee mal de forma sistemática, antes de corregirlo una y otra vez conviene mirar cómo entra. Mejorar el origen resuelve más que corregir el resultado.

Qué aprende del histórico

El sistema no trata cada documento como si fuera el primero:

De ahí que la carga de revisión sea mayor el primer mes que el sexto: cada corrección reduce el trabajo futuro.

Lo que el sistema no hace

No completa datos que no estén en el documento. Si un dato no consta o no resulta legible, el campo queda vacío y el documento se marca para revisión. Un campo vacío no es un fallo de lectura: es la constancia de que ahí no había nada legible.

Tampoco decide por el usuario: valida y señala, pero la aprobación es siempre de una persona o del flujo configurado.

Dónde se procesa

Los modelos se ejecutan dentro de la infraestructura Azure de Dijit.app, en servidores de la Unión Europea. Los documentos de los clientes no se utilizan para entrenar modelos.

↑ Volver arriba

Última revisión: 31 de agosto de 2026 · Equipo Dijit.app