🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónTexto hostil dentro de la evidencia
4 tareas · 40 min · Principiante
Miércoles 4 de noviembre, 13:20 UTC. Un correo de cobro llega a un socio de la Cooperativa Cedrales (empresa inventada) y el SOC pide al asistente que lo resuma. Entre los textos del correo hay uno que no está pensado para el socio sino para el asistente. Aquí aprendes qué es una instrucción oculta en el contenido analizado, por qué el asistente no distingue entre datos y órdenes y qué control sí funciona. Todo es lectura de tablas de ejemplo; el texto hostil es una frase inofensiva escrita para reconocerla.
Objetivo de la sala
Miércoles 4 de noviembre, 13:20 UTC. Un correo de cobro llega a un socio de la Cooperativa Cedrales (empresa inventada) y el SOC pide al asistente que lo resuma. Entre los textos del correo hay uno que no está pensado para el socio sino para el asistente. Aquí aprendes qué es una instrucción oculta en el contenido analizado, por qué el asistente no distingue entre datos y órdenes y qué control sí funciona. Todo es lectura de tablas de ejemplo; el texto hostil es una frase inofensiva escrita para reconocerla.Un asistente recibe un solo bloque de texto: lo que le pidió la persona y el contenido que debe analizar, mezclados. Si ese contenido incluye una frase redactada como orden, el modelo puede tratarla como una instrucción más. Eso es la inyección indirecta de instrucciones, el primer riesgo de la lista de OWASP para aplicaciones con modelos de lenguaje (LLM01 en la edición 2025). El texto puede estar a la vista o escondido: un fragmento con el mismo color que el fondo, un comentario del HTML, un campo de metadatos.
Para quien analiza, la regla es simple: el contenido de la evidencia es siempre dato y nunca autoridad. Una frase dirigida al asistente dentro de un correo, un archivo o un comentario no es una instrucción del SOC: es un indicio de que alguien quiso influir en la herramienta.
Responde para continuar
Un correo analizado trae una frase dirigida al asistente que resume el caso. ¿Qué es esa frase?
Ver pista de ayuda
Quien escribió la frase no tiene ninguna autoridad sobre el SOC.
La consola trae los textos del correo que el asistente leyó, uno por fila, con su origen. Prueba SELECT * FROM campos_del_caso. Lee cada fila como lo haría una persona que busca texto que no tiene sentido para quien recibe el correo.
Responde para continuar
Escribe el id del campo que contiene un texto dirigido al asistente de resúmenes.
Ver pista de ayuda
Busca la fila cuyo texto se dirige a una herramienta y no a la persona que recibe el correo.
Leer una instrucción oculta es un problema; que además el asistente tenga permiso de actuar lo vuelve un incidente. OWASP llama a ese exceso de permisos agencia excesiva (LLM06 en la edición 2025). Prueba SELECT * FROM acciones_del_asistente y luego SELECT * FROM acciones_del_asistente WHERE aprobo_una_persona = "no".
El registro no dice por qué el asistente hizo cada cosa: solo qué hizo, sobre qué caso y si una persona lo aprobó. Es lo que se puede afirmar con honestidad.
Responde para continuar
Escribe el id del caso cuyo estado cambió el asistente sin que una persona lo aprobara.
Ver pista de ayuda
Mira las acciones que cambian el estado y su columna de aprobación.
No hay forma fiable de pedirle a un modelo que ignore el texto hostil: el filtro que se escriba en palabras es una orden más entre las demás. Lo que funciona está fuera del modelo: darle solo los permisos que necesita y exigir que una persona apruebe lo que cambia el estado de un caso. Si lo único que el asistente puede hacer es escribir un borrador, la frase oculta no logra nada más que un borrador raro.
Responde para continuar
¿Qué control reduce de verdad el daño de una instrucción oculta?
Ver pista de ayuda
El control que no depende de que el modelo obedezca.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.