OnePDFs
Volver al Blog

Cómo censurar datos en un PDF con IA — gratis, privado, sin subida

29 de mayo de 202610 min de lecturaOnePDFs Team

Tienes un PDF con una docena de nombres, dos correos electrónicos, tres teléfonos y una dirección personal. Legal necesita una copia visualmente cubierta para mañana. Hacerlo a mano significa hacer clic página por página, encontrar cada caso, dibujar rectángulos y cruzar los dedos para no haberte saltado nada.

Una expresión regular captura los patrones obvios — emails, teléfonos estructurados — pero falla con los nombres ("Apple" ¿es una fruta o un CEO?) y los formatos internacionales de teléfono. Acabas revisando el documento entero igualmente.

Aquí brilla la IA. La herramienta Smart Redact de OnePDFs ejecuta el modelo abierto privacy-filter de OpenAI directamente en tu navegador. Recorre cada página, encuentra información personal en 8 categorías y te deja revisar antes de aplicar. El PDF nunca sale de tu equipo — sin subida al servidor, sin cuenta, sin coste.

Qué significa "redacción con IA" aquí

La mayoría de los "redactores PDF con IA" online o suben tu fichero (pesadilla de privacidad para los documentos que más quieres ocultar) o ejecutan un simple regex tras una página de marketing. Smart Redact no hace ninguno. El modelo NER (reconocimiento de entidades nombradas) de OpenAI, con 1.500 millones de parámetros, ejecuta la detección localmente en el navegador. Si sus aproximadamente 900 MB no están en caché, el navegador los descarga; puede reutilizarlos mientras sigan disponibles, pero una limpieza o expulsión de caché obliga a descargarlos de nuevo.

Lo que detecta en una sola pasada:

CategoríaEjemplos
PersonaNombres como "Carlos García" o "Tim Apple" — distingue contexto de persona vs. palabras homógrafas
DirecciónCalles, códigos postales, líneas de ciudad + país
EmailEstándar, además de formas ofuscadas (john [at] example.com)
TeléfonoFormatos internacionales, prefijos, extensiones
URLEnlaces http/https/ftp y dominios desnudos
FechaFechas de nacimiento, fechas de documento en cualquier formato común
Número de cuentaTrozos de tarjeta, números bancarios, cadenas tipo IBAN
SecretoClaves API, contraseñas, tokens pegados por error en el documento

Esto es lo que el regex no consigue. El contexto importa: el modelo sabe que "Apple" en "Apple Inc. anunció resultados" es una empresa, pero "Apple" en "Le escribí a Tim Apple la semana pasada" es una persona.

Tres pasos para redactar un PDF

El flujo es deliberadamente simple — subir, escanear, aplicar.

Paso 1: Abre la herramienta Smart Redact

Visita /tools/pdf-smart-redact y suelta tu PDF en el área de carga. El fichero se queda en tu navegador; nada se envía a ninguna parte. El editor abre con el subherramienta Smart Redact ya activa.

Página de Smart Redact con el área de carga y el aviso de descarga de unos 900 MB del modelo

Paso 2: Ejecuta el escaneo IA

Pulsa Escanear. Si el modelo privacy-filter no está en la caché del navegador, primero deben descargarse unos 900 MB. Una copia disponible en Cache Storage puede reutilizarse, pero el navegador puede expulsarla o el usuario borrarla. El tiempo de carga y detección depende de la conexión, el navegador, el dispositivo, la aceleración disponible, el número de páginas y la complejidad del documento; no hay un tiempo fijo. La detección se ejecuta localmente, con WebGPU cuando está disponible y una alternativa compatible con el navegador.

Mientras escanea, el panel muestra progreso por página. Los elementos detectados aparecen en una lista agrupada por página, con cada uno resaltado en el PDF con un color por categoría.

PDF de cliente en español con datos personales resaltados — nombres, correos, teléfonos +34, dirección de Madrid e IBAN — el panel lateral muestra las entidades clasificadas

Paso 3: Revisa y aplica

Aquí entra el control humano. El panel ofrece tres controles arriba:

  1. Tipos de detección — ocho casillas, una por categoría de PII. Desmarca las que no quieras cubrir. Quizá quieres dejar las fechas visibles porque son públicas. Las desmarcas y los resaltados correspondientes desaparecen del PDF al instante.
  2. Umbral de confianza — un deslizador de 0,50 a 0,99. Más alto significa menos falsos positivos pero puede saltarse casos raros; más bajo captura más pero marca casos dudosos. El valor por defecto 0,85 es el punto dulce para la mayoría de documentos.
  3. Aplicar redacciones — la acción final. Haz clic y cada entidad confirmada recibe una máscara rectangular negra y opaca. En la implementación actual, la exportación dibuja ese rectángulo sobre la zona; no elimina el objeto de texto subyacente ni los píxeles de la imagen original. Es un enmascarado visual, no una redacción segura garantizada.

Si ves un falso positivo en la lista, pulsa la × al lado para quitar esa entrada. Si una categoría entera está marcando de más, desmarca la categoría. Antes de Aplicar solo se muestran candidatos; Aplicar añade las máscaras seleccionadas, pero no borra el contenido de origen que queda debajo.

PDF español tras Aplicar redacciones con rectángulos negros opacos que cubren visualmente nombres, correos, teléfonos, direcciones, IBAN y tokens API

¿Por qué no usar simplemente la herramienta de redacción manual?

OnePDFs ya tiene PDF Cubrir en negro y PDF Cubrir en blanco para enmascarado manual. Son útiles cuando sabes exactamente qué ocultar y dónde. Smart Redact ayuda cuando:

  • El documento es largo y quieres asegurarte de no haberte saltado nada
  • No sabes de antemano qué nombres o correos aparecen
  • Quieres cubrir visualmente una categoría (por ejemplo, todos los teléfonos) sin tocar el resto
  • Procesas documentos similares repetidamente y quieres reglas consistentes

Para copias de revisión y usos de bajo riesgo, es útil escanear con IA y después revisar a mano. Con material realmente sensible, no dependas solo de estas máscaras visuales: usa un proceso de redacción que elimine el contenido subyacente y verifica el archivo exportado. Smart Redact multiplica la productividad, pero no sustituye al criterio ni a la depuración segura.

La cuestión de la privacidad

El sentido de una herramienta como esta es no comprometer los datos que intentas proteger. Por eso conviene ser explícitos sobre dónde ocurre cada cosa:

  • Tu PDF: se queda en tu navegador. Se lee a memoria, lo procesa pdf.js para extraer texto, nunca viaja por la red.
  • El modelo: cuando no están en caché se descargan unos 900 MB de pesos desde el CDN de HuggingFace y se guardan en Cache Storage mientras sigan disponibles. Una expulsión o limpieza puede exigir otra descarga. Ningún fichero del modelo se envía de vuelta; la inferencia se ejecuta localmente, no en el servidor de OnePDFs.
  • Resultados de detección: lista de entidades con posiciones y puntuaciones de confianza, todo en memoria del navegador.
  • El PDF enmascarado visualmente: se construye localmente con pdf-lib y se ofrece como descarga. El código de la herramienta no escribe deliberadamente en los registros el texto ni las entidades detectadas, pero los rectángulos negros no demuestran por sí solos que el contenido subyacente se haya eliminado.

Si trabajas en entornos corporativos con políticas estrictas de manejo de datos, esto importa. La IA no ve tu documento; solo corre en el mismo runtime de JavaScript que ya cargó la página.

Cuando la IA falla

Seamos honestos sobre los límites. El modelo privacy-filter es bueno pero no perfecto:

  • PDF escaneados sin capa de texto: el modelo necesita texto extraíble. Los PDF solo-imagen (la mayoría de escaneos) no funcionan — el botón Smart Redact se desactiva. Usa primero un OCR fiable que genere una capa de texto buscable y comprueba el reconocimiento.
  • Nombres en contextos inusuales: un nombre enterrado dentro de un fragmento de código, o un nombre en escritura no latina, puede pasar desapercibido. Baja el umbral de confianza para capturar más, después revisa.
  • Números que parecen cuenta pero no lo son: IDs de factura, códigos SKU, etc. Falsos positivos. Desmarca "Cuenta" si tu documento contiene muchos, o quita las entradas individuales.

Para una copia de revisión normal, escanea con los valores por defecto, recorre el documento con los resaltados visibles y solo entonces pulsa Aplicar. Después de exportar, abre el resultado en otro lector PDF, busca cada valor enmascarado e intenta seleccionar y copiar el texto alrededor de cada zona cubierta. Estas pruebas pueden detectar una máscara fallida o dependiente del lector, pero superarlas no convierte una cobertura visual en protección suficiente para información muy sensible.

Preguntas frecuentes

¿Cuánto cuesta?

No hay suscripción ni coste por página. Si no queda una copia válida en caché, el navegador puede necesitar descargar unos 900 MB de datos del modelo; el consumo puede contar en tu tarifa de internet.

¿Funciona offline?

La inferencia se ejecuta localmente cuando el modelo está disponible y una copia en caché evita otra descarga. Sin embargo, el funcionamiento sin conexión también depende de que la página y los recursos necesarios sigan disponibles en el navegador, por lo que no se garantiza para todas las sesiones posteriores.

¿Funciona con PDF en otros idiomas?

El modelo privacy-filter se entrenó principalmente con datos en inglés, pero la cobertura real va más allá. En pruebas con documentos en español identificó nombres de personas, direcciones a nivel de calle ("Calle Gran Vía 28..."), teléfonos +34, correos, URLs e IBANs españoles. Algunos formatos de fecha en español se le escapan ocasionalmente — fácil de limpiar a mano. La detección de personas y direcciones es notablemente fiable en lenguas latinas (español, alemán, francés).

¿Qué pasa con el texto original tras aplicar redacciones?

Con la implementación actual, el texto original no se elimina. Aplicar añade una máscara rectangular y la exportación la dibuja o la guarda como anotación cuadrada, mientras el texto subyacente puede seguir dentro del PDF. Según la ruta de exportación y el lector, la búsqueda, la copia o la extracción de texto podrían revelarlo. Usa la herramienta para enmascarado visual y revisión, no como única protección de datos sensibles; emplea un proceso que depure el contenido subyacente y verifica el archivo exportado en otro lector antes de compartirlo.

¿Puedo procesar muchos PDF en lote?

Aún no desde la UI. El modelo se carga por pestaña del navegador, pero el flujo de escaneo procesa un documento a la vez. Si tienes un caso estable de procesamiento por lotes, el modelo cacheado y nuestra infraestructura de Compresión por lotes podrían enlazarse — escríbenos.

¿Es de código abierto el modelo privacy-filter?

Sí. Está en HuggingFace bajo licencia permisiva. Usamos la portación a Transformers.js para inferencia en navegador.

Pruébalo

Abre Smart Redact, suelta un PDF con información personal que quieras ocultar y revisa los candidatos que encuentre la IA. Si el modelo no está en caché, el navegador puede descargar unos 900 MB; una copia disponible puede reutilizarse. El tiempo total varía según conexión, navegador, dispositivo, páginas y complejidad del documento.

Para enmascarado visual donde la IA no encaja — cobertura negra puntual, censura rectangular o cobertura blanca manual — puedes usar PDF Cubrir en negro y PDF Cubrir en blanco. Son herramientas visuales complementarias, no sustituyen una redacción que elimine el contenido subyacente.

Todo el flujo corre en tu navegador. Sin subida, sin registro, sin coste. Esa es la propuesta entera.