Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Fuentes de sesgo: datos, etiquetas y despliegue

5 tareas · 40 min · Principiante

Un sistema que trata peor a un grupo de personas tiene un fallo, igual que uno que filtra datos: se puede medir, tiene causa y tiene dueño. En esta sala se buscan las causas antes de medir nada, en los tres sitios donde suele nacer el sesgo: los datos con que se entrenó el modelo, la etiqueta que aprendió y la forma en que se usa. El caso es Huillín, el modelo de preselección de microcréditos de Cooperativa Corontillo, una cooperativa de ahorro y crédito inventada. Todo es lectura de evidencia ficticia; no hay ningún modelo y no se ejecuta nada.

0 de 5 · 0%

Objetivo de la sala

Un sistema que trata peor a un grupo de personas tiene un fallo, igual que uno que filtra datos: se puede medir, tiene causa y tiene dueño. En esta sala se buscan las causas antes de medir nada, en los tres sitios donde suele nacer el sesgo: los datos con que se entrenó el modelo, la etiqueta que aprendió y la forma en que se usa. El caso es Huillín, el modelo de preselección de microcréditos de Cooperativa Corontillo, una cooperativa de ahorro y crédito inventada. Todo es lectura de evidencia ficticia; no hay ningún modelo y no se ejecuta nada.

Un modelo que aprende de decisiones pasadas aprende también sus defectos, aunque nadie haya querido discriminar. Para buscarlos con orden conviene separar tres orígenes:

  • Los datos. Quién está en el conjunto de entrenamiento y en qué proporción. Si un grupo casi no aparece, el modelo aprende poco de él y se equivoca más con él. Y aunque un atributo protegido (zona, sexo, edad) se quite del modelo, otra variable muy relacionada puede reintroducirlo: se le llama variable sustituta.
  • Las etiquetas. Lo que el modelo intenta predecir. Si la etiqueta sale de decisiones humanas anteriores, o solo se observa para una parte de las personas, el modelo aprende la decisión de entonces, no la realidad.
  • El despliegue. Dónde, con quién y cómo se usa. Un modelo ajustado para una población y llevado a otra, un umbral fijado en un sitio y aplicado en todos, o personas que acatan el puntaje sin revisarlo cambian el resultado sin tocar una línea del modelo.

El marco de gestión de riesgos de IA del NIST trata la equidad, con el sesgo dañino gestionado, como una de las características de un sistema confiable, y su publicación especial 1270 distingue sesgos sistémicos, estadísticos o computacionales y humanos. Esta sala usa la división práctica de arriba porque dice dónde buscar en la evidencia.

Responde para continuar

Un modelo de crédito aprende si una persona «pagaría» a partir de lo que decidieron los asesores durante cinco años. ¿En qué origen está el riesgo principal?

Ver pista de ayuda

Pregúntate qué intenta predecir el modelo y de dónde salió ese valor para cada persona.

Abre el laboratorio. La gerencia de riesgos de Corontillo te deja la ficha del conjunto de entrenamiento de Huillín, el diccionario de variables, las solicitudes de este año y las notas de despliegue. Empieza por la representación: compara la proporción de solicitudes rurales con que se entrenó el modelo con la proporción que recibe hoy. Una diferencia grande dice que el modelo vio poco de la población a la que ahora decide.

Responde para continuar

¿Cuántos puntos porcentuales separan la proporción de solicitudes rurales de este año de la proporción rural del conjunto de entrenamiento? Escribe solo el número entero.

Ver pista de ayuda

Abre `ficha-de-datos.txt` y `solicitudes-2026.txt`. Divide las rurales entre el total en cada archivo, pásalo a porcentaje y resta.

La etiqueta de Huillín es si la persona pagó. Pero solo se sabe si pagó quien recibió el crédito: de quien fue rechazado no hay resultado observado. Este es un problema conocido de los modelos de crédito y de selección, a veces llamado de etiquetas selectivas: el resultado solo existe para quien pasó la decisión anterior.

Lo que importa es qué hizo el equipo con esos huecos. Si les puso un resultado inventado, el modelo aprende que el grupo más rechazado en el pasado «no paga», y el sesgo de la decisión antigua se convierte en dato. Busca en la ficha la regla de preparación que hace exactamente eso.

Responde para continuar

¿Qué regla de preparación asigna un resultado a personas cuyo resultado nunca se observó?

Formato esperado: R-_

Ver pista de ayuda

En `ficha-de-datos.txt` mira la lista de reglas de preparación. Hay otra que completa un dato vacío, pero no es la etiqueta.

El diccionario dice que la zona, el sexo y la franja de edad no entran al modelo. Eso no basta para que el modelo no las use: si una variable que sí entra casi permite deducir un atributo protegido, el modelo puede tratar distinto a ese grupo sin «verlo». El equipo de datos midió la asociación de cada variable con cada atributo, en una escala de 0 a 1.

Busca la variable que entra al modelo y casi reproduce un atributo protegido. Una asociación moderada es una señal para vigilar; una cercana a 1 es casi el mismo dato con otro nombre.

Responde para continuar

¿Qué variable que entra a Huillín funciona como sustituta de la zona?

Ver pista de ayuda

Abre `diccionario-de-variables.txt` y ordena mentalmente por la columna de asociación.

Lee ahora las notas de despliegue. En enero de 2026 Huillín empezó a decidir en las agencias móviles rurales, con el mismo umbral que se fijó con los datos de una sucursal urbana, con un dato de ingreso que en modo sin conexión se guarda de otra forma y con asesores que aplican el puntaje sin revisarlo. Ninguna de esas tres cosas cambia el modelo, y las tres pueden cambiar a quién se rechaza.

Responde para continuar

Según las notas de despliegue, ¿qué conclusión se sostiene antes de medir nada?

Ver pista de ayuda

Separa lo que cambió en el modelo de lo que cambió en dónde y cómo se usa.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad