Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Pruebas de robustez con librerías de defensa: leer resultados

5 tareas · 40 min · Principiante

Existen librerías abiertas que evalúan la robustez de un modelo propio: le aplican perturbaciones con distintos métodos y presupuestos y devuelven cuánto acierta. Usarlas es trabajo de ingeniería con autorización; leer bien lo que devuelven es trabajo de seguridad, porque un informe puede concluir «es robusto» con la prueba equivocada. Bandurria Seguros quiere pasar a producción [email protected], entrenada para resistir perturbaciones. Lees el encargo, el informe y la muestra, y decides si la conclusión se sostiene. No se ejecuta ninguna prueba; solo se lee un informe ficticio.

0 de 5 · 0%

Objetivo de la sala

Existen librerías abiertas que evalúan la robustez de un modelo propio: le aplican perturbaciones con distintos métodos y presupuestos y devuelven cuánto acierta. Usarlas es trabajo de ingeniería con autorización; leer bien lo que devuelven es trabajo de seguridad, porque un informe puede concluir «es robusto» con la prueba equivocada. Bandurria Seguros quiere pasar a producción [email protected], entrenada para resistir perturbaciones. Lees el encargo, el informe y la muestra, y decides si la conclusión se sostiene. No se ejecuta ninguna prueba; solo se lee un informe ficticio.

Una prueba de robustez se hace sobre modelos propios y con autorización escrita: qué se prueba, dónde, quién autoriza, en qué ventana y qué queda fuera. Lo normal es probar una copia del modelo en un entorno aislado, no la API de producción, por dos razones: la prueba manda miles de entradas raras que no deben mezclarse con el tráfico real, y una prueba contra un sistema de terceros sin su permiso no es una prueba, es un ataque.

El encargo también fija lo que el informe debe traer para que se pueda revisar: la muestra, la semilla y las pruebas que se hicieron.

Responde para continuar

Durante la ventana del encargo, alguien propone repetir la prueba contra la API de producción «para ver el caso real». ¿Qué respondes?

Ver pista de ayuda

Lee qué dice `encargo-PR-2026-14.txt` en los campos «Donde» y «Excluido».

Un informe de robustez suele traer varias pruebas para el mismo presupuesto, y no valen lo mismo. La que cuenta para decidir es la más exigente que se hizo, porque la robustez real del modelo frente a alguien con tiempo no es mejor que lo que aguanta frente a esa prueba. Citar la prueba más débil porque da el número más bonito es el error más común al resumir estos informes.

Lee el informe y busca la exactitud de la versión candidata en la prueba más exigente.

Responde para continuar

¿Qué exactitud tiene [email protected] en la prueba más exigente del informe? Escribe solo el número.

Ver pista de ayuda

En `informe-robustez.txt`, la explicación bajo la tabla dice cuál es la prueba más exigente.

Entrenar un modelo para resistir perturbaciones casi nunca sale gratis: suele perder algo de exactitud en las fotos normales, que son la inmensa mayoría de las que llegan. Ese costo se mide y se compara con la puerta de salida que tenga la empresa; no se esconde detrás de la ganancia en robustez.

Calcula cuántos puntos de exactitud limpia pierde la versión candidata frente a la de producción.

Responde para continuar

¿Cuántos puntos de exactitud limpia pierde [email protected] frente a [email protected]?

Ver pista de ayuda

Resta las dos filas `limpia` del informe.

Cuando un modelo «defendido» gana muchísimo contra la prueba de un solo paso y casi nada contra la iterativa, hay que sospechar. Algunas defensas no hacen al modelo más robusto: hacen que el método simple deje de encontrar la dirección en la que el modelo falla, y la prueba iterativa, que corrige paso a paso, la encuentra igual. Es un fenómeno bien documentado en la investigación sobre robustez, y la regla práctica que deja es sencilla: una defensa se evalúa con la prueba más fuerte disponible, y si es posible con una pensada para esa defensa.

Compara la ganancia de la versión candidata en las dos pruebas adversariales y lee la conclusión del equipo.

Responde para continuar

¿Qué opinas de la conclusión del equipo de ciencia de datos?

Ver pista de ayuda

Mira cuánto gana 2.4.0 en `un_solo_paso` y cuánto en `iterativa_40_pasos`.

Una exactitud global sobre 500 fotos esconde lo que pasa en las clases pequeñas. Si una clase tiene pocas fotos en la muestra, su cifra, cuando se reporta, tiene un margen de error enorme; y si no se reporta, no se sabe nada de ella. Que la clase escasa sea justo la más cara para el negocio es motivo para pedir una muestra equilibrada o resultados por clase antes de decidir.

Abre el detalle de la muestra y anota cuántas fotos tiene la clase que más le cuesta a la aseguradora cuando el modelo la confunde con leve.

Responde para continuar

¿Cuántas fotos de la clase grave tiene la muestra del informe?

Ver pista de ayuda

Lee `muestra.txt`.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad