Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Herramientas de evaluación — garak, PyRIT y promptfoo

4 tareas · 35 min · Principiante

Las vacantes de seguridad de IA piden evaluación adversaria con herramientas. Tres ejemplos de código abierto son garak, PyRIT y promptfoo. En esta sala no se instalan ni se lanzan: se leen su ficha de licencias, comprobada contra el repositorio oficial de cada proyecto, y los parámetros de dos corridas de Tordo Seguros, escritas en un formato simplificado e inventado. Aprendes para qué sirve cada una, qué hay que verificar antes de usarlas en un encargo y a detectar una corrida mal apuntada antes de que ocurra.

0 de 4 · 0%

Objetivo de la sala

Las vacantes de seguridad de IA piden evaluación adversaria con herramientas. Tres ejemplos de código abierto son garak, PyRIT y promptfoo. En esta sala no se instalan ni se lanzan: se leen su ficha de licencias, comprobada contra el repositorio oficial de cada proyecto, y los parámetros de dos corridas de Tordo Seguros, escritas en un formato simplificado e inventado. Aprendes para qué sirve cada una, qué hay que verificar antes de usarlas en un encargo y a detectar una corrida mal apuntada antes de que ocurra.

Las tres sirven para repetir muchos intentos contra un sistema y puntuar lo que responde, pero cada una nació para una cosa. garak funciona con sondas que generan los intentos y detectores que puntúan las respuestas, y se usa mucho para barridos amplios contra un modelo o un punto de acceso. PyRIT es un marco para organizar y repetir evaluaciones de riesgo en IA generativa, incluidas las conversaciones de varias rondas. promptfoo evalúa a partir de casos y se integra con la integración continua, de modo que las pruebas corren cada vez que cambia algo.

Elegir no es cuestión de moda: se elige según lo que hay que medir. Un barrido amplio, una conversación que se desarrolla en varias vueltas y una regresión que debe saltar en cada cambio piden cosas distintas, y a veces se combinan.

Responde para continuar

Una empresa quiere que, cada vez que cambie el prompt de su asistente, corran solas unas pruebas por casos y falle la integración si empeoran. ¿Qué herramienta de las tres encaja mejor?

Ver pista de ayuda

La pista está en «por casos» y «cada vez que cambie». Esa es la integración continua.

En el laboratorio tienes la ficha de herramientas con su licencia, comprobada contra el repositorio oficial de cada proyecto, y con una advertencia: la versión vigente no se comprobó. Es una costumbre sana. Una licencia abierta permite usar el software en un encargo remunerado, pero no dice nada de qué versión usar, si ha cambiado de condiciones desde la última vez que se miró ni si el modelo o servicio que se evalúa tiene sus propias reglas de uso.

Por eso, antes de cada evaluación se vuelve a mirar la licencia y la versión en la documentación oficial, se fija esa versión y se anota en el informe: así el resultado se puede repetir con lo mismo.

Responde para continuar

Las tres herramientas tienen licencia abierta. ¿Qué sigue habiendo que hacer antes de usarlas en un encargo?

Ver pista de ayuda

La ficha dice qué se comprobó y qué no. Lo que falta, la versión, se resuelve al preparar cada evaluación.

Tienes los parámetros de dos corridas. Una apunta a un objetivo y la otra a otro, y solo uno de los dos cabe en el alcance. Es un fallo corriente: alguien copia la configuración de un entorno a otro y deja el objetivo viejo. Si la corrida llega a lanzarse, el daño ya está hecho; por eso se revisa el objetivo antes de pulsar el botón y no después.

Compara el objetivo de cada corrida con el resumen del alcance.

Responde para continuar

Escribe el host del objetivo de la corrida que se saldría del alcance autorizado.

Ver pista de ayuda

Con la terminal, `cat tordo/alcance-resumen.txt` y los archivos de la carpeta corridas. Busca el objetivo que no coincide con el entorno autorizado.

Si un hallazgo importa, alguien tiene que poder repetir la corrida que lo produjo. Eso exige dejar escritos los parámetros que gobiernan el azar: cuántas veces se repite cada intento, a qué ritmo y con qué semilla. La semilla es el número que hace que dos corridas con la misma configuración tomen las mismas decisiones aleatorias; sin ella, la repetición se parece a la original pero no es igual, y discutir un resultado se vuelve difícil.

Mira los parámetros de la corrida que sí apunta al entorno autorizado.

Responde para continuar

Escribe la semilla fijada en la corrida que apunta al entorno autorizado.

Ver pista de ayuda

Con la terminal, `cat tordo/corridas/corrida-casos.txt`. Es la línea «semilla».

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad