🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónReconocedores y listas de contexto
4 tareas · 40 min · Principiante
Un detector de datos personales no es una sola regla: es un conjunto de reconocedores, cada uno con su forma de buscar y su manera de puntuar lo que encuentra. El filtro de Cachudito, en Coligüe Cooperativa, está construido sobre Presidio, una biblioteca de código abierto para detectar y anonimizar datos personales. Tienes su configuración, la traza de decisiones de un día, los mensajes tal como quedaron guardados y la lista de formatos internos de la cooperativa. Lees por qué cada número se tapó o no. Nada se ejecuta.
Objetivo de la sala
Un detector de datos personales no es una sola regla: es un conjunto de reconocedores, cada uno con su forma de buscar y su manera de puntuar lo que encuentra. El filtro de Cachudito, en Coligüe Cooperativa, está construido sobre Presidio, una biblioteca de código abierto para detectar y anonimizar datos personales. Tienes su configuración, la traza de decisiones de un día, los mensajes tal como quedaron guardados y la lista de formatos internos de la cooperativa. Lees por qué cada número se tapó o no. Nada se ejecuta.Presidio separa dos piezas: un analizador, que encuentra posibles datos personales y devuelve para cada uno el tipo, la posición en el texto y una puntuación entre 0 y 1, y un anonimizador, que decide qué se hace con cada hallazgo. El analizador trabaja con reconocedores de varias clases. Los de patrón usan expresiones regulares y pueden añadir una validación, como comprobar un dígito de verificación. Los de lista buscan términos concretos que alguien les da. Los de modelo usan un modelo de entidades nombradas, entrenado para reconocer nombres de personas, lugares u organizaciones en una frase.
La puntuación base dice cuánto se fía el reconocedor de su hallazgo sin más información. Un patrón muy genérico debe empezar bajo: un número de seis a diez dígitos puede ser un documento, pero también una fecha escrita sin separadores, un importe o un código interno. Si ese patrón empezara alto, el filtro taparía medio chat.
Responde para continuar
¿Por qué rec-cedula tiene una puntuación base mucho más baja que rec-correo?
Ver pista de ayuda
Abre `filtro/traza-2026-09-29.log` y mira qué texto detectó rec-cedula en M-3143.
El contexto es lo que convierte un número ambiguo en un hallazgo creíble. El reconocedor lleva una lista de palabras; si una aparece cerca del valor, la puntuación sube. Presidio lo llama mejora por contexto y permite poner las palabras en el reconocedor o pasarlas en cada petición, por ejemplo el nombre de una columna. Lo frágil es la lista: si la gente escribe con una palabra que no está, el número se queda con su puntuación base y no llega al umbral.
Lee la traza junto con los mensajes guardados. Hay un documento que salió en claro. Busca qué palabra lo precedía.
Responde para continuar
¿Qué palabra del mensaje habría subido la puntuación de D-202 si estuviera en la lista de contexto de rec-cedula?
Ver pista de ayuda
En `registros/mensajes-2026-09-29.log`, lee M-3141 y compara sus palabras con la lista `contexto` de rec-cedula en `filtro/reconocedores.yml`.
La misma palabra que ayuda en un mensaje estorba en otro. «Documento» acompaña a una cédula cuando alguien la dicta, pero también a cualquier archivo que el asociado adjunta. Cuando una palabra de contexto es muy común, sube la puntuación de números que no tienen nada de personal y el filtro empieza a tapar referencias que el asesor necesita para atender.
Busca en la traza la detección que enmascaró como cédula un número interno de la cooperativa.
Responde para continuar
¿Qué detección enmascaró como cédula un número que en realidad es un formato interno de Coligüe?
Ver pista de ayuda
Compara los textos detectados por rec-cedula con `referencia/formatos-internos.txt`, y lee el mensaje de cada detección.
Un ajuste de reconocedor se juzga por lo que arregla y por lo que rompe. Quitar una palabra de contexto, subir el umbral o desactivar un reconocedor resuelven el caso que se mira, pero cambian el resultado de todas las demás detecciones que dependían de esa pieza. Por eso se busca la corrección más estrecha: la que actúa sobre el formato que falla y deja igual el resto.
Responde para continuar
¿Qué corrige el falso positivo de D-207 sin perder la detección de D-205?
Ver pista de ayuda
D-205 también subió gracias a «documento». Mira qué dice `referencia/formatos-internos.txt` de la lista de permitidos.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.