🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónFuentes de sesgo: datos, etiquetas y despliegue
5 tareas · 40 min · Principiante
Un sistema que trata peor a un grupo de personas tiene un fallo, igual que uno que filtra datos: se puede medir, tiene causa y tiene dueño. En esta sala se buscan las causas antes de medir nada, en los tres sitios donde suele nacer el sesgo: los datos con que se entrenó el modelo, la etiqueta que aprendió y la forma en que se usa. El caso es Huillín, el modelo de preselección de microcréditos de Cooperativa Corontillo, una cooperativa de ahorro y crédito inventada. Todo es lectura de evidencia ficticia; no hay ningún modelo y no se ejecuta nada.
Objetivo de la sala
Un sistema que trata peor a un grupo de personas tiene un fallo, igual que uno que filtra datos: se puede medir, tiene causa y tiene dueño. En esta sala se buscan las causas antes de medir nada, en los tres sitios donde suele nacer el sesgo: los datos con que se entrenó el modelo, la etiqueta que aprendió y la forma en que se usa. El caso es Huillín, el modelo de preselección de microcréditos de Cooperativa Corontillo, una cooperativa de ahorro y crédito inventada. Todo es lectura de evidencia ficticia; no hay ningún modelo y no se ejecuta nada.Un modelo que aprende de decisiones pasadas aprende también sus defectos, aunque nadie haya querido discriminar. Para buscarlos con orden conviene separar tres orígenes:
- Los datos. Quién está en el conjunto de entrenamiento y en qué proporción. Si un grupo casi no aparece, el modelo aprende poco de él y se equivoca más con él. Y aunque un atributo protegido (zona, sexo, edad) se quite del modelo, otra variable muy relacionada puede reintroducirlo: se le llama variable sustituta.
- Las etiquetas. Lo que el modelo intenta predecir. Si la etiqueta sale de decisiones humanas anteriores, o solo se observa para una parte de las personas, el modelo aprende la decisión de entonces, no la realidad.
- El despliegue. Dónde, con quién y cómo se usa. Un modelo ajustado para una población y llevado a otra, un umbral fijado en un sitio y aplicado en todos, o personas que acatan el puntaje sin revisarlo cambian el resultado sin tocar una línea del modelo.
El marco de gestión de riesgos de IA del NIST trata la equidad, con el sesgo dañino gestionado, como una de las características de un sistema confiable, y su publicación especial 1270 distingue sesgos sistémicos, estadísticos o computacionales y humanos. Esta sala usa la división práctica de arriba porque dice dónde buscar en la evidencia.
Responde para continuar
Un modelo de crédito aprende si una persona «pagaría» a partir de lo que decidieron los asesores durante cinco años. ¿En qué origen está el riesgo principal?
Ver pista de ayuda
Pregúntate qué intenta predecir el modelo y de dónde salió ese valor para cada persona.
Abre el laboratorio. La gerencia de riesgos de Corontillo te deja la ficha del conjunto de entrenamiento de Huillín, el diccionario de variables, las solicitudes de este año y las notas de despliegue. Empieza por la representación: compara la proporción de solicitudes rurales con que se entrenó el modelo con la proporción que recibe hoy. Una diferencia grande dice que el modelo vio poco de la población a la que ahora decide.
Responde para continuar
¿Cuántos puntos porcentuales separan la proporción de solicitudes rurales de este año de la proporción rural del conjunto de entrenamiento? Escribe solo el número entero.
Ver pista de ayuda
Abre `ficha-de-datos.txt` y `solicitudes-2026.txt`. Divide las rurales entre el total en cada archivo, pásalo a porcentaje y resta.
La etiqueta de Huillín es si la persona pagó. Pero solo se sabe si pagó quien recibió el crédito: de quien fue rechazado no hay resultado observado. Este es un problema conocido de los modelos de crédito y de selección, a veces llamado de etiquetas selectivas: el resultado solo existe para quien pasó la decisión anterior.
Lo que importa es qué hizo el equipo con esos huecos. Si les puso un resultado inventado, el modelo aprende que el grupo más rechazado en el pasado «no paga», y el sesgo de la decisión antigua se convierte en dato. Busca en la ficha la regla de preparación que hace exactamente eso.
Responde para continuar
¿Qué regla de preparación asigna un resultado a personas cuyo resultado nunca se observó?
Formato esperado: R-_
Ver pista de ayuda
En `ficha-de-datos.txt` mira la lista de reglas de preparación. Hay otra que completa un dato vacío, pero no es la etiqueta.
El diccionario dice que la zona, el sexo y la franja de edad no entran al modelo. Eso no basta para que el modelo no las use: si una variable que sí entra casi permite deducir un atributo protegido, el modelo puede tratar distinto a ese grupo sin «verlo». El equipo de datos midió la asociación de cada variable con cada atributo, en una escala de 0 a 1.
Busca la variable que entra al modelo y casi reproduce un atributo protegido. Una asociación moderada es una señal para vigilar; una cercana a 1 es casi el mismo dato con otro nombre.
Responde para continuar
¿Qué variable que entra a Huillín funciona como sustituta de la zona?
Ver pista de ayuda
Abre `diccionario-de-variables.txt` y ordena mentalmente por la columna de asociación.
Lee ahora las notas de despliegue. En enero de 2026 Huillín empezó a decidir en las agencias móviles rurales, con el mismo umbral que se fijó con los datos de una sucursal urbana, con un dato de ingreso que en modo sin conexión se guarda de otra forma y con asesores que aplican el puntaje sin revisarlo. Ninguna de esas tres cosas cambia el modelo, y las tres pueden cambiar a quién se rechaza.
Responde para continuar
Según las notas de despliegue, ¿qué conclusión se sostiene antes de medir nada?
Ver pista de ayuda
Separa lo que cambió en el modelo de lo que cambió en dónde y cómo se usa.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.