🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónEntradas no confiables por herramientas y documentos
5 tareas · 45 min · Principiante
Un agente no solo lee lo que escribe su usuario: lee adjuntos, correos y resultados de otras herramientas, y todo eso entra en el mismo contexto que sus instrucciones. Si un texto de fuera trae una frase con forma de orden, el modelo puede tratarla como tal. Esta sala la mira por el lado de la defensa: no cómo se escribe esa frase, sino qué control la detiene y cuál falta. Tienes dos trazas de Huemul, el agente de Alerce Seguros, y la cobertura de su filtro de adjuntos. Las notas dirigidas al asistente que verás en los extractos son evidencia ficticia para reconocer, no instrucciones para ti. Solo lees trazas; no se reproduce nada.
Objetivo de la sala
Un agente no solo lee lo que escribe su usuario: lee adjuntos, correos y resultados de otras herramientas, y todo eso entra en el mismo contexto que sus instrucciones. Si un texto de fuera trae una frase con forma de orden, el modelo puede tratarla como tal. Esta sala la mira por el lado de la defensa: no cómo se escribe esa frase, sino qué control la detiene y cuál falta. Tienes dos trazas de Huemul, el agente de Alerce Seguros, y la cobertura de su filtro de adjuntos. Las notas dirigidas al asistente que verás en los extractos son evidencia ficticia para reconocer, no instrucciones para ti. Solo lees trazas; no se reproduce nada.Tu módulo de inyección por resultado de herramienta ya mostró el mecanismo: el modelo no distingue entre el texto que debe procesar y el texto que debe obedecer. Aquí interesa el diseño que lo contiene. Todo contenido que llega de fuera —correos, adjuntos, páginas, resultados de otros servidores— se trata como no confiable, se etiqueta con su origen y nunca decide por sí solo una acción con efecto.
La defensa que sirve no depende de que el modelo «se dé cuenta». Depende de controles fuera de él: una política de salida que mira adónde van los datos, una confirmación humana para las acciones con efecto, y permisos que ya de por sí no alcanzan a hacer daño.
Responde para continuar
Un adjunto trae una frase con forma de orden para el asistente. ¿Qué defensa es la sólida?
Ver pista de ayuda
Compara las dos trazas: la que se detuvo y la que no. Mira qué componente decidió, si el modelo o algo fuera de él.
Una traza de agente enumera cada paso: la entrada del usuario, las llamadas a herramientas, el origen del contenido leído, la etiqueta de confianza y lo que el modelo propuso. Leerla en orden permite reconstruir de dónde vino un comportamiento extraño sin tener que adivinar.
Abre la ejecución 8841 y localiza qué adjunto contenía la nota dirigida al asistente.
Responde para continuar
¿Qué adjunto de la ejecución 8841 traía una nota dirigida al asistente?
Ver pista de ayuda
El paso [3] de la traza dice cuál adjunto se leyó, de dónde venía y qué extracto traía.
Una política de salida decide a qué destinos puede enviar información el agente. Funciona con una lista cerrada de dominios permitidos y no necesita entender el texto: solo compara el destino con la lista. Por eso no se deja convencer por una frase bien escrita.
En la misma ejecución, el modelo propuso enviar el expediente a un destino externo y la regla R-07 lo bloqueó. Lee la traza y anota el dominio de ese destino.
Responde para continuar
¿Qué dominio de destino bloqueó la política de salida?
Ver pista de ayuda
En el paso [4] el modelo propone un envío; en el [5] la política lo bloquea y cita la regla.
La segunda traza muestra lo contrario: el texto venía de un origen que el filtro no cubre, no llevó etiqueta, y la herramienta de cierre no pedía confirmación. El modelo propuso, el sistema ejecutó, y el siniestro quedó cerrado sin que ninguna persona lo viera. No hubo un fallo técnico: hubo un diseño sin ninguna capa que dijera «alto».
Abre la ejecución 8847 y anota qué siniestro quedó cerrado sin aprobador.
Responde para continuar
¿Qué siniestro quedó cerrado en la ejecución 8847 sin que ninguna persona lo aprobara?
Ver pista de ayuda
El paso [6] de la ejecución 8847 muestra el estado final y el aprobador.
Un filtro de etiquetado vale tanto como los orígenes que cubre. El de Huemul se instaló cuando solo existían dos orígenes de contenido, y desde entonces se añadieron otros que no se incorporaron. Un hallazgo de cobertura se corrige cubriendo cada origen nuevo, pero además —y es lo que lo hace resistente— se diseña para que una acción con efecto no dependa solo de que la etiqueta exista.
Lee filtro-de-adjuntos.txt y decide qué corrección cierra el hallazgo de forma duradera.
Responde para continuar
¿Qué corrección cierra de forma duradera el hallazgo de cobertura del filtro?
Ver pista de ayuda
Cuenta los orígenes de la tabla que dicen «no» y piensa qué pasaría con el próximo origen que se añada.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.