🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónPruebas de robustez con librerías de defensa: leer resultados
5 tareas · 40 min · Principiante
Existen librerías abiertas que evalúan la robustez de un modelo propio: le aplican perturbaciones con distintos métodos y presupuestos y devuelven cuánto acierta. Usarlas es trabajo de ingeniería con autorización; leer bien lo que devuelven es trabajo de seguridad, porque un informe puede concluir «es robusto» con la prueba equivocada. Bandurria Seguros quiere pasar a producción [email protected], entrenada para resistir perturbaciones. Lees el encargo, el informe y la muestra, y decides si la conclusión se sostiene. No se ejecuta ninguna prueba; solo se lee un informe ficticio.
Objetivo de la sala
Existen librerías abiertas que evalúan la robustez de un modelo propio: le aplican perturbaciones con distintos métodos y presupuestos y devuelven cuánto acierta. Usarlas es trabajo de ingeniería con autorización; leer bien lo que devuelven es trabajo de seguridad, porque un informe puede concluir «es robusto» con la prueba equivocada. Bandurria Seguros quiere pasar a producción [email protected], entrenada para resistir perturbaciones. Lees el encargo, el informe y la muestra, y decides si la conclusión se sostiene. No se ejecuta ninguna prueba; solo se lee un informe ficticio.Una prueba de robustez se hace sobre modelos propios y con autorización escrita: qué se prueba, dónde, quién autoriza, en qué ventana y qué queda fuera. Lo normal es probar una copia del modelo en un entorno aislado, no la API de producción, por dos razones: la prueba manda miles de entradas raras que no deben mezclarse con el tráfico real, y una prueba contra un sistema de terceros sin su permiso no es una prueba, es un ataque.
El encargo también fija lo que el informe debe traer para que se pueda revisar: la muestra, la semilla y las pruebas que se hicieron.
Responde para continuar
Durante la ventana del encargo, alguien propone repetir la prueba contra la API de producción «para ver el caso real». ¿Qué respondes?
Ver pista de ayuda
Lee qué dice `encargo-PR-2026-14.txt` en los campos «Donde» y «Excluido».
Un informe de robustez suele traer varias pruebas para el mismo presupuesto, y no valen lo mismo. La que cuenta para decidir es la más exigente que se hizo, porque la robustez real del modelo frente a alguien con tiempo no es mejor que lo que aguanta frente a esa prueba. Citar la prueba más débil porque da el número más bonito es el error más común al resumir estos informes.
Lee el informe y busca la exactitud de la versión candidata en la prueba más exigente.
Responde para continuar
¿Qué exactitud tiene [email protected] en la prueba más exigente del informe? Escribe solo el número.
Ver pista de ayuda
En `informe-robustez.txt`, la explicación bajo la tabla dice cuál es la prueba más exigente.
Entrenar un modelo para resistir perturbaciones casi nunca sale gratis: suele perder algo de exactitud en las fotos normales, que son la inmensa mayoría de las que llegan. Ese costo se mide y se compara con la puerta de salida que tenga la empresa; no se esconde detrás de la ganancia en robustez.
Calcula cuántos puntos de exactitud limpia pierde la versión candidata frente a la de producción.
Responde para continuar
¿Cuántos puntos de exactitud limpia pierde [email protected] frente a [email protected]?
Ver pista de ayuda
Resta las dos filas `limpia` del informe.
Cuando un modelo «defendido» gana muchísimo contra la prueba de un solo paso y casi nada contra la iterativa, hay que sospechar. Algunas defensas no hacen al modelo más robusto: hacen que el método simple deje de encontrar la dirección en la que el modelo falla, y la prueba iterativa, que corrige paso a paso, la encuentra igual. Es un fenómeno bien documentado en la investigación sobre robustez, y la regla práctica que deja es sencilla: una defensa se evalúa con la prueba más fuerte disponible, y si es posible con una pensada para esa defensa.
Compara la ganancia de la versión candidata en las dos pruebas adversariales y lee la conclusión del equipo.
Responde para continuar
¿Qué opinas de la conclusión del equipo de ciencia de datos?
Ver pista de ayuda
Mira cuánto gana 2.4.0 en `un_solo_paso` y cuánto en `iterativa_40_pasos`.
Una exactitud global sobre 500 fotos esconde lo que pasa en las clases pequeñas. Si una clase tiene pocas fotos en la muestra, su cifra, cuando se reporta, tiene un margen de error enorme; y si no se reporta, no se sabe nada de ella. Que la clase escasa sea justo la más cara para el negocio es motivo para pedir una muestra equilibrada o resultados por clase antes de decidir.
Abre el detalle de la muestra y anota cuántas fotos tiene la clase que más le cuesta a la aseguradora cuando el modelo la confunde con leve.
Responde para continuar
¿Cuántas fotos de la clase grave tiene la muestra del informe?
Ver pista de ayuda
Lee `muestra.txt`.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.