Si tienes un NAS, casi seguro ya guardas facturas en una carpeta de Nextcloud o en un share SMB. El problema no es el espacio: es encontrar «la factura del wifi de marzo» cuando Hacienda o el banco te la piden. Ahí entra Paperless-ngx: un archivador documental con OCR local, etiquetas y búsqueda full-text que vive en tu hardware.

No sustituye a Nextcloud. Nextcloud es tu Drive: sync, calendarios, contactos, colaboración. Paperless es el archivo de PDFs escaneados — facturas, contratos, nóminas — que quieres buscar por texto, no abrir uno a uno.

Paperless no es «otro Nextcloud». Es el cajón donde metes el papel digitalizado y, tres años después, escribes «iberdrola» y aparece en dos segundos.

Qué es Paperless-ngx (y por qué en el NAS)

Paperless-ngx es un fork activo de Paperless: web UI, base de datos, motor de OCR (Tesseract) y un flujo de «consume» que vigila una carpeta. Escaneas o sueltas un PDF → el contenedor lo OCR-ea → lo indexa → lo puedes filtrar por etiqueta, remitente, fecha o texto libre.

Todo el procesamiento es local. No mandas facturas a un SaaS de «AI document management». Si te importa la privacidad de tus datos fiscales y laborales, eso no es un detalle: es el motivo de usarlo.

Paperless-ngx frente a Nextcloud (y por qué conviven)

Necesitas… Usa Por qué
Sync de archivos, Office, agenda Nextcloud Es tu nube personal completa
Buscar texto dentro de facturas PDF Paperless-ngx OCR + índice full-text de serie
Compartir una carpeta con la familia Nextcloud Permisos y clientes maduros
Archivo fiscal de 5–10 años Paperless-ngx Etiquetas, remitentes, fechas
Sustituir Google Drive entero Nextcloud (no Paperless) Paperless no hace sync de móvil

Patrón habitual: escaneas → el PDF cae en la carpeta consume de Paperless (o la subes a Nextcloud y la sincronizas a esa carpeta). Paperless archiva. Nextcloud sigue siendo el sitio de trabajo diario. Si aún no tienes Nextcloud, la guía de instalación es el siguiente paso lógico de esta ruta.

Antes de empezar

Docker (y Docker Compose) en el NAS
Synology, QNAP, TrueNAS o un Debian cualquiera. Si aún estás eligiendo hardware, revisa qué es un NAS y evita los errores típicos del primer NAS.
Un volumen con espacio y backup
Los originales y el OCR ocupan. Planifica copia según la regla 3-2-1: Paperless sin backup es un archivador de cartón junto a una vela.
Escáner o fuente de PDFs
Multifunción con carpeta de red, app de escaneo al NAS, o PDFs que ya tienes. Paperless no escanea él solo: consume lo que le dejas.

Instalación con Docker Compose

La stack oficial usa varios servicios: webserver, broker Redis, base de datos (PostgreSQL o MariaDB) y el worker de consumo. Lo más limpio es un docker-compose.yml en una carpeta dedicada, por ejemplo /docker/paperless/.

Estructura de carpetas recomendada
/docker/paperless/ docker-compose.yml .env data/ # BD y redis (persistencia) media/ # documentos archivados export/ # exportaciones consume/ # suelta aquí los PDF nuevos
Fragmento típico de docker-compose (simplificado)
services: broker: image: redis:7 restart: unless-stopped db: image: postgres:16 restart: unless-stopped volumes: - ./data/pg:/var/lib/postgresql/data environment: POSTGRES_DB: paperless POSTGRES_USER: paperless POSTGRES_PASSWORD: ${DB_PASSWORD} webserver: image: ghcr.io/paperless-ngx/paperless-ngx:latest restart: unless-stopped depends_on: - db - broker ports: - "8000:8000" volumes: - ./data:/usr/src/paperless/data - ./media:/usr/src/paperless/media - ./export:/usr/src/paperless/export - ./consume:/usr/src/paperless/consume env_file: .env

En el .env defines contraseña de BD, PAPERLESS_SECRET_KEY, zona horaria (Europe/Madrid) e idiomas OCR. Para español e inglés:

Idiomas OCR en .env
PAPERLESS_OCR_LANGUAGE=spa+eng PAPERLESS_TIME_ZONE=Europe/Madrid PAPERLESS_URL=http://192.168.1.50:8000

Levanta con docker compose up -d, espera un minuto y abre http://IP-DEL-NAS:8000. Crea el usuario admin en el primer arranque. Usa una contraseña larga; este panel no es un blog.

OCR local: qué hace realmente

Cuando llega un PDF o imagen, el worker pasa Tesseract (y a veces un preprocesado) y guarda el texto reconocido junto al archivo. Ese texto alimenta el buscador. No hace falta que el PDF «tenga capa de texto» de origen: un escaneo a 300 dpi de una factura en papel suele bastar.

  • spa+eng cubre la mayoría de facturas españolas y mails en inglés.
  • Escaneos borrosos o fotos de móvil a contraluz bajan la calidad del OCR: mejor escáner plano o app de documento.
  • El OCR consume CPU. En un NAS débil, procesa de noche o de uno en uno; no tires 500 PDFs a la vez el día 1.

La carpeta consume: el truco que lo hace automático

Montas ./consume y cualquier archivo que aparezca ahí lo recoge Paperless, lo procesa y lo mueve al archivo (media). Es el corazón del flujo:

Comparte consume por SMB o la enlaza desde Nextcloud
En el escáner: «guardar en carpeta de red» apuntando a \\NAS\paperless-consume. O una carpeta de Nextcloud sincronizada al host y bind-mount a consume.
Suelta el PDF y espera
En la UI verás el documento en cola y luego archivado. Si falla, revisa permisos del volumen (UID del contenedor debe poder leer/escribir).
No uses consume como archivo permanente
Es bandeja de entrada. Lo permanente vive en media. Si haces backup, incluye media, data y el compose — no solo consume.

Etiquetas, correspondents y tipos de documento

Paperless brilla cuando ordenas con tres ejes:

  • Correspondent — quién emite: Iberdrola, Agencia Tributaria, banco…
  • Document type — factura, contrato, nómina, seguro…
  • Tags — año fiscal, «deducible», «casa», «coche»…

Puedes crear reglas automáticas (matching) para que «IBERDROLA» en el texto asigne el correspondent solo. Empieza con 5–10 reglas; no intentes taxonomía perfecta el primer fin de semana.

Una etiqueta «2025-irpf» puesta el día que archivas te ahorra una tarde en abril. El OCR es la mitad; la otra mitad es disciplina de etiquetado.

Búsqueda full-text: el premio

En el buscador escribe fragmentos: CIF, importe, «fibra», el número de contrato. Combina con filtros de etiqueta y fecha. Para uso diario es lo que echas de menos en una carpeta plana de Nextcloud llena de scan001.pdf.

Consejo práctico: tras importar un lote viejo, busca dos o tres facturas que sepas de memoria. Si no salen, revisa idioma OCR y calidad del escaneo antes de dar por bueno el archivo histórico.

Errores que he visto (y cómo evitarlos)

Permisos en consume: los PDF no se procesan

Síntoma: el archivo se queda en la carpeta. Solución: alinea UID/GID (USERMAP_UID / USERMAP_GID en Paperless) con el usuario que escribe por SMB.

OCR en blanco o basura

Síntoma: buscas y no hay texto. Solución: idioma spa instalado en la imagen, DPI decente, no fotos torcidas de móvil.

Usar Paperless como sustituto de Nextcloud

Síntoma: echas de menos sync en el portátil. Solución: no lo fuerces. Lee Nextcloud vs alternativas y deja a cada herramienta su trabajo.

Sin backup del volumen media

Síntoma: disco muerto, archivo muerto. Solución: 3-2-1 también para documentos fiscales.

Checklist Paperless-ngx en el NAS

  • Docker Compose con webserver, DB y Redis; volúmenes data, media, consume, export.
  • OCR en spa+eng y zona Europe/Madrid.
  • Carpeta consume como bandeja (escáner o sync desde Nextcloud).
  • Correspondents + tags desde el primer lote real.
  • Acceso solo LAN o Tailscale; sin puerto público abierto.
  • Backup de media + data; Paperless no sustituye a Nextcloud.