Paperless-ngx: escanea facturas y búscalas en segundos
Instala Paperless-ngx en Docker, digitaliza PDFs con OCR local, etiqueta lo que importa y olvídate de rebuscar en carpetas de «facturas_2023_final_v2».
Si tienes un NAS, casi seguro ya guardas facturas en una carpeta de Nextcloud o en un share SMB. El problema no es el espacio: es encontrar «la factura del wifi de marzo» cuando Hacienda o el banco te la piden. Ahí entra Paperless-ngx: un archivador documental con OCR local, etiquetas y búsqueda full-text que vive en tu hardware.
No sustituye a Nextcloud. Nextcloud es tu Drive: sync, calendarios, contactos, colaboración. Paperless es el archivo de PDFs escaneados — facturas, contratos, nóminas — que quieres buscar por texto, no abrir uno a uno.
Paperless no es «otro Nextcloud». Es el cajón donde metes el papel digitalizado y, tres años después, escribes «iberdrola» y aparece en dos segundos.
Qué es Paperless-ngx (y por qué en el NAS)
Paperless-ngx es un fork activo de Paperless: web UI, base de datos, motor de OCR (Tesseract) y un flujo de «consume» que vigila una carpeta. Escaneas o sueltas un PDF → el contenedor lo OCR-ea → lo indexa → lo puedes filtrar por etiqueta, remitente, fecha o texto libre.
Todo el procesamiento es local. No mandas facturas a un SaaS de «AI document management». Si te importa la privacidad de tus datos fiscales y laborales, eso no es un detalle: es el motivo de usarlo.
Paperless-ngx frente a Nextcloud (y por qué conviven)
| Necesitas… | Usa | Por qué |
|---|---|---|
| Sync de archivos, Office, agenda | Nextcloud | Es tu nube personal completa |
| Buscar texto dentro de facturas PDF | Paperless-ngx | OCR + índice full-text de serie |
| Compartir una carpeta con la familia | Nextcloud | Permisos y clientes maduros |
| Archivo fiscal de 5–10 años | Paperless-ngx | Etiquetas, remitentes, fechas |
| Sustituir Google Drive entero | Nextcloud (no Paperless) | Paperless no hace sync de móvil |
Patrón habitual: escaneas → el PDF cae en la carpeta consume de Paperless (o la subes a Nextcloud y la sincronizas a esa carpeta). Paperless archiva. Nextcloud sigue siendo el sitio de trabajo diario. Si aún no tienes Nextcloud, la guía de instalación es el siguiente paso lógico de esta ruta.
Antes de empezar
Instalación con Docker Compose
La stack oficial usa varios servicios: webserver, broker Redis, base de datos (PostgreSQL o MariaDB) y el worker de consumo. Lo más limpio es un docker-compose.yml en una carpeta dedicada, por ejemplo /docker/paperless/.
/docker/paperless/
docker-compose.yml
.env
data/ # BD y redis (persistencia)
media/ # documentos archivados
export/ # exportaciones
consume/ # suelta aquí los PDF nuevos
services:
broker:
image: redis:7
restart: unless-stopped
db:
image: postgres:16
restart: unless-stopped
volumes:
- ./data/pg:/var/lib/postgresql/data
environment:
POSTGRES_DB: paperless
POSTGRES_USER: paperless
POSTGRES_PASSWORD: ${DB_PASSWORD}
webserver:
image: ghcr.io/paperless-ngx/paperless-ngx:latest
restart: unless-stopped
depends_on:
- db
- broker
ports:
- "8000:8000"
volumes:
- ./data:/usr/src/paperless/data
- ./media:/usr/src/paperless/media
- ./export:/usr/src/paperless/export
- ./consume:/usr/src/paperless/consume
env_file: .env
En el .env defines contraseña de BD, PAPERLESS_SECRET_KEY, zona horaria (Europe/Madrid) e idiomas OCR. Para español e inglés:
PAPERLESS_OCR_LANGUAGE=spa+eng
PAPERLESS_TIME_ZONE=Europe/Madrid
PAPERLESS_URL=http://192.168.1.50:8000
Levanta con docker compose up -d, espera un minuto y abre http://IP-DEL-NAS:8000. Crea el usuario admin en el primer arranque. Usa una contraseña larga; este panel no es un blog.
OCR local: qué hace realmente
Cuando llega un PDF o imagen, el worker pasa Tesseract (y a veces un preprocesado) y guarda el texto reconocido junto al archivo. Ese texto alimenta el buscador. No hace falta que el PDF «tenga capa de texto» de origen: un escaneo a 300 dpi de una factura en papel suele bastar.
- spa+eng cubre la mayoría de facturas españolas y mails en inglés.
- Escaneos borrosos o fotos de móvil a contraluz bajan la calidad del OCR: mejor escáner plano o app de documento.
- El OCR consume CPU. En un NAS débil, procesa de noche o de uno en uno; no tires 500 PDFs a la vez el día 1.
La carpeta consume: el truco que lo hace automático
Montas ./consume y cualquier archivo que aparezca ahí lo recoge Paperless, lo procesa y lo mueve al archivo (media). Es el corazón del flujo:
\\NAS\paperless-consume. O una carpeta de Nextcloud sincronizada al host y bind-mount a consume.media. Si haces backup, incluye media, data y el compose — no solo consume.Etiquetas, correspondents y tipos de documento
Paperless brilla cuando ordenas con tres ejes:
- Correspondent — quién emite: Iberdrola, Agencia Tributaria, banco…
- Document type — factura, contrato, nómina, seguro…
- Tags — año fiscal, «deducible», «casa», «coche»…
Puedes crear reglas automáticas (matching) para que «IBERDROLA» en el texto asigne el correspondent solo. Empieza con 5–10 reglas; no intentes taxonomía perfecta el primer fin de semana.
Una etiqueta «2025-irpf» puesta el día que archivas te ahorra una tarde en abril. El OCR es la mitad; la otra mitad es disciplina de etiquetado.
Búsqueda full-text: el premio
En el buscador escribe fragmentos: CIF, importe, «fibra», el número de contrato. Combina con filtros de etiqueta y fecha. Para uso diario es lo que echas de menos en una carpeta plana de Nextcloud llena de scan001.pdf.
Consejo práctico: tras importar un lote viejo, busca dos o tres facturas que sepas de memoria. Si no salen, revisa idioma OCR y calidad del escaneo antes de dar por bueno el archivo histórico.
Errores que he visto (y cómo evitarlos)
Permisos en consume: los PDF no se procesan
Síntoma: el archivo se queda en la carpeta. Solución: alinea UID/GID (USERMAP_UID / USERMAP_GID en Paperless) con el usuario que escribe por SMB.
OCR en blanco o basura
Síntoma: buscas y no hay texto. Solución: idioma spa instalado en la imagen, DPI decente, no fotos torcidas de móvil.
Usar Paperless como sustituto de Nextcloud
Síntoma: echas de menos sync en el portátil. Solución: no lo fuerces. Lee Nextcloud vs alternativas y deja a cada herramienta su trabajo.
Sin backup del volumen media
Síntoma: disco muerto, archivo muerto. Solución: 3-2-1 también para documentos fiscales.
Checklist Paperless-ngx en el NAS
- Docker Compose con webserver, DB y Redis; volúmenes data, media, consume, export.
- OCR en spa+eng y zona Europe/Madrid.
- Carpeta consume como bandeja (escáner o sync desde Nextcloud).
- Correspondents + tags desde el primer lote real.
- Acceso solo LAN o Tailscale; sin puerto público abierto.
- Backup de media + data; Paperless no sustituye a Nextcloud.