Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Casos de prueba por categoría

5 tareas · 40 min · Principiante

Una evaluación no es una lista de trucos: es un plan que cubre las categorías de riesgo que el cliente puso en alcance, con casos que dicen qué se comprueba y con qué criterio se da por superado. En esta sala lees el plan de pruebas de Calandria, el asistente de Tordo Seguros, contra el marco OWASP Top 10 for LLM Applications (edición 2025). Buscas lo que falta, lo que no se puede juzgar y cuántos casos hay de cada categoría. El plan describe objetivos y criterios; no contiene cargas de ataque ni se ejecuta nada.

0 de 5 · 0%

Objetivo de la sala

Una evaluación no es una lista de trucos: es un plan que cubre las categorías de riesgo que el cliente puso en alcance, con casos que dicen qué se comprueba y con qué criterio se da por superado. En esta sala lees el plan de pruebas de Calandria, el asistente de Tordo Seguros, contra el marco OWASP Top 10 for LLM Applications (edición 2025). Buscas lo que falta, lo que no se puede juzgar y cuántos casos hay de cada categoría. El plan describe objetivos y criterios; no contiene cargas de ataque ni se ejecuta nada.

Un plan por categorías parte de una lista conocida de riesgos y se pregunta, para cada una, qué comprobaría que el sistema la contiene. OWASP Top 10 for LLM Applications es esa lista: inyección de instrucciones, divulgación de información sensible, manejo inseguro de la salida, agencia excesiva, filtración del prompt del sistema, debilidades de vectores y embeddings, desinformación y otras. Organizar el plan así tiene una ventaja que no tiene un repertorio de ideas sueltas: se puede ver qué categoría quedó sin cubrir.

La cobertura es la pregunta de fondo de un plan: no «cuántas pruebas hay», sino «qué riesgos del alcance no tiene ninguna».

Responde para continuar

¿Qué ventaja da organizar los casos de prueba por categorías de riesgo reconocidas?

Ver pista de ayuda

Una lista de ideas puede tener muchas pruebas y aun así olvidar un riesgo entero. La categoría hace visible el hueco.

El cliente dejó por escrito qué categorías están en alcance. Tienes ese listado y el plan de pruebas. Cruza los dos: una categoría que está en alcance y no tiene ni un caso es un hueco, y el informe final no podrá decir nada sobre ella, ni bueno ni malo.

Fíjate en los códigos: también hay categorías que el cliente excluyó expresamente, que no cuentan como hueco.

Responde para continuar

Escribe el código de la categoría en alcance que no tiene ningún caso en el plan de pruebas.

Ver pista de ayuda

Con la terminal, `cat tordo/cobertura.txt` y `cat tordo/plan-de-pruebas.csv`. Compara los códigos de una y otra.

Cada caso lleva un objetivo y un criterio de paso. El criterio es lo que permite que dos personas lleguen a la misma conclusión viendo la misma respuesta: «no devuelve ningún dato fuera de la póliza del usuario» se puede verificar; «que no se vea mal» no. Un caso con un criterio así produce resultados que nadie puede defender ni repetir, y es lo primero que se arregla al revisar un plan.

Recorre la columna de criterios y localiza el que depende de la opinión de quien mira.

Responde para continuar

Escribe el identificador del caso cuyo criterio de paso no se puede verificar objetivamente.

Ver pista de ayuda

Con la terminal, `cat tordo/plan-de-pruebas.csv`. Lee la cuarta columna de cada fila.

Contar casos por categoría es el primer vistazo a cómo está repartido el esfuerzo. La inyección de instrucciones, por ejemplo, se prueba por varios canales: lo que escribe el usuario, lo que trae un documento y lo que se escribe en un campo de formulario. Cada canal es un caso distinto porque falla por motivos distintos y se corrige en sitios distintos.

Cuenta las filas de la categoría de inyección de instrucciones en el plan.

Responde para continuar

¿Cuántos casos del plan de pruebas pertenecen a la categoría LLM01? Escribe solo el número.

Ver pista de ayuda

Con la terminal, `cat tordo/plan-de-pruebas.csv`. Cuenta las filas cuya segunda columna es LLM01.

Los casos del plan llevan una columna de repeticiones. No es un capricho: un modelo no responde igual dos veces, así que un solo intento no demuestra nada. Se repite cada caso en variantes y se mide una proporción. Además, el plan describe el objetivo y el criterio, no el texto de ataque: ese texto vive en la herramienta que lo genera, y lo que el informe debe conservar es qué se comprobó y con qué resultado, para que otra persona pueda repetirlo.

Responde para continuar

¿Qué debe quedar escrito de cada caso para que otra persona pueda repetir la evaluación?

Ver pista de ayuda

Si el modelo no responde igual dos veces, no basta con apuntar el resultado. Hace falta saber qué se buscaba y cuántas veces se probó.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad