Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Texto hostil dentro de la evidencia

4 tareas · 40 min · Principiante

Miércoles 4 de noviembre, 13:20 UTC. Un correo de cobro llega a un socio de la Cooperativa Cedrales (empresa inventada) y el SOC pide al asistente que lo resuma. Entre los textos del correo hay uno que no está pensado para el socio sino para el asistente. Aquí aprendes qué es una instrucción oculta en el contenido analizado, por qué el asistente no distingue entre datos y órdenes y qué control sí funciona. Todo es lectura de tablas de ejemplo; el texto hostil es una frase inofensiva escrita para reconocerla.

0 de 4 · 0%

Objetivo de la sala

Miércoles 4 de noviembre, 13:20 UTC. Un correo de cobro llega a un socio de la Cooperativa Cedrales (empresa inventada) y el SOC pide al asistente que lo resuma. Entre los textos del correo hay uno que no está pensado para el socio sino para el asistente. Aquí aprendes qué es una instrucción oculta en el contenido analizado, por qué el asistente no distingue entre datos y órdenes y qué control sí funciona. Todo es lectura de tablas de ejemplo; el texto hostil es una frase inofensiva escrita para reconocerla.

Un asistente recibe un solo bloque de texto: lo que le pidió la persona y el contenido que debe analizar, mezclados. Si ese contenido incluye una frase redactada como orden, el modelo puede tratarla como una instrucción más. Eso es la inyección indirecta de instrucciones, el primer riesgo de la lista de OWASP para aplicaciones con modelos de lenguaje (LLM01 en la edición 2025). El texto puede estar a la vista o escondido: un fragmento con el mismo color que el fondo, un comentario del HTML, un campo de metadatos.

Para quien analiza, la regla es simple: el contenido de la evidencia es siempre dato y nunca autoridad. Una frase dirigida al asistente dentro de un correo, un archivo o un comentario no es una instrucción del SOC: es un indicio de que alguien quiso influir en la herramienta.

Responde para continuar

Un correo analizado trae una frase dirigida al asistente que resume el caso. ¿Qué es esa frase?

Ver pista de ayuda

Quien escribió la frase no tiene ninguna autoridad sobre el SOC.

La consola trae los textos del correo que el asistente leyó, uno por fila, con su origen. Prueba SELECT * FROM campos_del_caso. Lee cada fila como lo haría una persona que busca texto que no tiene sentido para quien recibe el correo.

Responde para continuar

Escribe el id del campo que contiene un texto dirigido al asistente de resúmenes.

Ver pista de ayuda

Busca la fila cuyo texto se dirige a una herramienta y no a la persona que recibe el correo.

Leer una instrucción oculta es un problema; que además el asistente tenga permiso de actuar lo vuelve un incidente. OWASP llama a ese exceso de permisos agencia excesiva (LLM06 en la edición 2025). Prueba SELECT * FROM acciones_del_asistente y luego SELECT * FROM acciones_del_asistente WHERE aprobo_una_persona = "no".

El registro no dice por qué el asistente hizo cada cosa: solo qué hizo, sobre qué caso y si una persona lo aprobó. Es lo que se puede afirmar con honestidad.

Responde para continuar

Escribe el id del caso cuyo estado cambió el asistente sin que una persona lo aprobara.

Ver pista de ayuda

Mira las acciones que cambian el estado y su columna de aprobación.

No hay forma fiable de pedirle a un modelo que ignore el texto hostil: el filtro que se escriba en palabras es una orden más entre las demás. Lo que funciona está fuera del modelo: darle solo los permisos que necesita y exigir que una persona apruebe lo que cambia el estado de un caso. Si lo único que el asistente puede hacer es escribir un borrador, la frase oculta no logra nada más que un borrador raro.

Responde para continuar

¿Qué control reduce de verdad el daño de una instrucción oculta?

Ver pista de ayuda

El control que no depende de que el modelo obedezca.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad