Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Conjuntos de evaluación por categoría de riesgo

4 tareas · 40 min · Principiante

Las salas anteriores de la ruta enseñaron por qué un asistente se evalúa y a leer el informe que deja una herramienta. Aquí se da un paso atrás: antes de medir nada hay que construir el material con el que se mide. Un conjunto de evaluación es un catálogo de casos agrupados por categoría de riesgo, con casos legítimos mezclados, una parte reservada para decidir y sin casos repetidos que inflen la cobertura. Trabajas sobre el catálogo del asistente «Tenca», de la comercializadora ficticia Quetro Energía. Todo es lectura de un catálogo; ningún caso trae un texto de ataque, solo qué se comprueba.

0 de 4 · 0%

Objetivo de la sala

Las salas anteriores de la ruta enseñaron por qué un asistente se evalúa y a leer el informe que deja una herramienta. Aquí se da un paso atrás: antes de medir nada hay que construir el material con el que se mide. Un conjunto de evaluación es un catálogo de casos agrupados por categoría de riesgo, con casos legítimos mezclados, una parte reservada para decidir y sin casos repetidos que inflen la cobertura. Trabajas sobre el catálogo del asistente «Tenca», de la comercializadora ficticia Quetro Energía. Todo es lectura de un catálogo; ningún caso trae un texto de ataque, solo qué se comprueba.

Un conjunto de evaluación se usa de dos maneras distintas. Durante el desarrollo, el equipo lo corre a diario, mira qué casos fallan y ajusta el prompt o los filtros hasta que pasan. Antes de aprobar un cambio, lo corre para decidir si el sistema está listo. Si las dos cosas se hacen con los mismos casos, ocurre algo conocido: las defensas se ajustan, sin querer, a esos casos concretos. La tasa de fallo baja, pero lo que ha mejorado es la memoria del sistema sobre ese catálogo, no su capacidad de resistir casos parecidos que no ha visto.

La solución es partir el conjunto. La partición de desarrollo se lee fallo por fallo y se usa para corregir. La partición retenida solo se corre al decidir, y nadie la usa para ajustar: si alguien la mira para corregir un fallo, ese caso pasa a desarrollo y hay que escribir uno nuevo para el retenido. Así la tasa del retenido mide si las defensas generalizan.

Responde para continuar

¿Para qué sirve reservar una partición retenida en un conjunto de evaluación?

Ver pista de ayuda

Si ajustas con los mismos casos con los que decides, la tasa baja sin que el sistema sea más seguro. Lo retenido evita ese autoengaño.

Un conjunto formado solo por ataques empuja hacia un asistente que se niega a todo: sus tasas de ataque son excelentes y es inútil para el cliente. Por eso el catálogo incluye casos benignos, peticiones legítimas de clientes normales, con el mismo reparto entre desarrollo y retenido. Con ellos se puede medir, más adelante en el módulo, cuántas veces el asistente rechaza algo que debía atender. La proporción la decide el equipo según cuánto le preocupa cada lado; lo importante es que exista y que se conozca.

Abre el catálogo de Tenca y calcula qué parte del total son casos benignos.

Responde para continuar

¿Qué porcentaje de los casos del catálogo de Tenca son peticiones legítimas (tipo benigno)? Escribe solo el número.

Ver pista de ayuda

Con la terminal, `cat quetro/catalogo-de-casos.csv`. Cuenta los benignos y divide entre el total de casos; multiplica por cien.

Cobertura no significa el mismo número de casos por categoría, pero sí un mínimo. Una categoría con pocos casos produce tasas que se mueven mucho con un solo caso que cambie de resultado, y el equipo no podrá distinguir una regresión de un azar. Se mira cuántos casos de ataque tiene cada categoría y se marca la que queda por debajo del mínimo para ampliarla antes de fiarse de sus cifras. Más casos se añaden donde el impacto es mayor o donde las defensas son más frágiles.

Cuenta los casos de ataque por categoría en el catálogo.

Responde para continuar

Escribe el código de la categoría que tiene menos casos de ataque en el catálogo.

Ver pista de ayuda

Ordena el catálogo por categoría y cuenta solo las filas de tipo ataque; las benignas no son una categoría de riesgo.

Un caso nuevo debe comprobar algo distinto de los que ya existen. Dos casos que solo se diferencian en un nombre propio o en una palabra no suman cobertura: cuentan como dos en el total y como uno en la práctica, y si uno está en desarrollo y el otro en retenido, la partición retenida ha dejado de ser independiente. Es un error común al crecer un catálogo copiando filas: la cifra de «casos» sube y la cobertura real no.

La columna que describe qué se comprueba delata estos duplicados; léela en la partición retenida.

Responde para continuar

Escribe el id del caso de la partición retenida que repite el texto base de un caso de desarrollo.

Ver pista de ayuda

Lee la última columna de las filas con partición retenida; una de ellas lo dice con sus propias palabras.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad