El principal objetivo de este sistema es eliminar la tarea repetitiva de picar datos a mano cada vez que llega una factura recurrente por correo electrónico, garantizando velocidad, privacidad absoluta y cero costes en APIs externas.
Para lograrlo sin depender de modelos de IA de pago ni suscripciones SaaS caras, todo el procesamiento se ejecuta mediante un microservicio propio en Python conectado a nuestro flujo de trabajo.
El Flujo de Usuario: Procesamiento automático en segundo plano
- Recepción del correo: Cuando un proveedor habitual envía una factura por email, el sistema detecta automáticamente el archivo PDF adjunto.
- Respaldo en la nube: El archivo se guarda en una carpeta organizada de Google Drive para tener un backup seguro y accesible para la gestoría a final de mes.
- Procesamiento instantáneo: En milisegundos, una API propia lee el documento en memoria, identifica el proveedor (mediante plantillas previamente mapeadas) y extrae el número de factura, la fecha y el importe total.
- Registro limpio: Los datos se guardan de forma estructurada en Airtable vinculados al archivo, dejando la bandeja de entrada organizada sin intervención manual.

📌 Aviso clave sobre el funcionamiento:
Este sistema requiere mapear previamente la plantilla de cada nuevo proveedor. Está diseñado específicamente para facturas recurrentes de proveedores habituales. Esto es lo que permite obtener una precisión del 100%, velocidad en milisegundos y coste 0 € en APIs de IA.
Demostración en vídeo del flujo
Ver en YouTube: https://youtu.be/UdyuBHKVyiY
La Arquitectura Técnica por Detrás
Para que el proceso sea ultra rápido y privado, la lógica se divide entre orquestación No-Code y código propio:
- Orquestador (Make): Escucha la entrada de nuevos correos en Gmail, gestiona las etiquetas del email, sube el PDF a Google Drive y envía el archivo a nuestra API.
- Motor de extracción (FastAPI + Python): Un microservicio ligero que procesa el PDF en memoria mediante
pdfplumber, detecta el proveedor con reglas predefinidas (Regex) y normaliza las fechas antes de responder con un JSON limpio. - Base de datos (Airtable): Recibe los datos extraídos y crea el registro final listo para revisión o contabilidad.
¿Por qué este enfoque marca la diferencia?
- Coste cercano a 0 €: No requiere tokens de modelos de lenguaje ni plataformas de OCR de pago.
- Privacidad total: Los documentos financieros se procesan en tu propia infraestructura sin enviar datos a APIs de terceros.
- Respaldo automatizado: Google Drive actúa como repositorio ordenado para enviar directamente a la gestoría sin búsquedas manuales.
- Cero alucinaciones: La extracción mediante patrones predefinidos garantiza precisión matemática en proveedores habituales.
En el próximo capítulo analizaremos al detalle el código del motor en Python (FastAPI), mostrando cómo gestionamos la lectura en memoria, el mapeo de plantillas por proveedor y la normalización de fechas.