Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Entradas no confiables por herramientas y documentos

5 tareas · 45 min · Principiante

Un agente no solo lee lo que escribe su usuario: lee adjuntos, correos y resultados de otras herramientas, y todo eso entra en el mismo contexto que sus instrucciones. Si un texto de fuera trae una frase con forma de orden, el modelo puede tratarla como tal. Esta sala la mira por el lado de la defensa: no cómo se escribe esa frase, sino qué control la detiene y cuál falta. Tienes dos trazas de Huemul, el agente de Alerce Seguros, y la cobertura de su filtro de adjuntos. Las notas dirigidas al asistente que verás en los extractos son evidencia ficticia para reconocer, no instrucciones para ti. Solo lees trazas; no se reproduce nada.

0 de 5 · 0%

Objetivo de la sala

Un agente no solo lee lo que escribe su usuario: lee adjuntos, correos y resultados de otras herramientas, y todo eso entra en el mismo contexto que sus instrucciones. Si un texto de fuera trae una frase con forma de orden, el modelo puede tratarla como tal. Esta sala la mira por el lado de la defensa: no cómo se escribe esa frase, sino qué control la detiene y cuál falta. Tienes dos trazas de Huemul, el agente de Alerce Seguros, y la cobertura de su filtro de adjuntos. Las notas dirigidas al asistente que verás en los extractos son evidencia ficticia para reconocer, no instrucciones para ti. Solo lees trazas; no se reproduce nada.

Tu módulo de inyección por resultado de herramienta ya mostró el mecanismo: el modelo no distingue entre el texto que debe procesar y el texto que debe obedecer. Aquí interesa el diseño que lo contiene. Todo contenido que llega de fuera —correos, adjuntos, páginas, resultados de otros servidores— se trata como no confiable, se etiqueta con su origen y nunca decide por sí solo una acción con efecto.

La defensa que sirve no depende de que el modelo «se dé cuenta». Depende de controles fuera de él: una política de salida que mira adónde van los datos, una confirmación humana para las acciones con efecto, y permisos que ya de por sí no alcanzan a hacer daño.

Responde para continuar

Un adjunto trae una frase con forma de orden para el asistente. ¿Qué defensa es la sólida?

Ver pista de ayuda

Compara las dos trazas: la que se detuvo y la que no. Mira qué componente decidió, si el modelo o algo fuera de él.

Una traza de agente enumera cada paso: la entrada del usuario, las llamadas a herramientas, el origen del contenido leído, la etiqueta de confianza y lo que el modelo propuso. Leerla en orden permite reconstruir de dónde vino un comportamiento extraño sin tener que adivinar.

Abre la ejecución 8841 y localiza qué adjunto contenía la nota dirigida al asistente.

Responde para continuar

¿Qué adjunto de la ejecución 8841 traía una nota dirigida al asistente?

Ver pista de ayuda

El paso [3] de la traza dice cuál adjunto se leyó, de dónde venía y qué extracto traía.

Una política de salida decide a qué destinos puede enviar información el agente. Funciona con una lista cerrada de dominios permitidos y no necesita entender el texto: solo compara el destino con la lista. Por eso no se deja convencer por una frase bien escrita.

En la misma ejecución, el modelo propuso enviar el expediente a un destino externo y la regla R-07 lo bloqueó. Lee la traza y anota el dominio de ese destino.

Responde para continuar

¿Qué dominio de destino bloqueó la política de salida?

Ver pista de ayuda

En el paso [4] el modelo propone un envío; en el [5] la política lo bloquea y cita la regla.

La segunda traza muestra lo contrario: el texto venía de un origen que el filtro no cubre, no llevó etiqueta, y la herramienta de cierre no pedía confirmación. El modelo propuso, el sistema ejecutó, y el siniestro quedó cerrado sin que ninguna persona lo viera. No hubo un fallo técnico: hubo un diseño sin ninguna capa que dijera «alto».

Abre la ejecución 8847 y anota qué siniestro quedó cerrado sin aprobador.

Responde para continuar

¿Qué siniestro quedó cerrado en la ejecución 8847 sin que ninguna persona lo aprobara?

Ver pista de ayuda

El paso [6] de la ejecución 8847 muestra el estado final y el aprobador.

Un filtro de etiquetado vale tanto como los orígenes que cubre. El de Huemul se instaló cuando solo existían dos orígenes de contenido, y desde entonces se añadieron otros que no se incorporaron. Un hallazgo de cobertura se corrige cubriendo cada origen nuevo, pero además —y es lo que lo hace resistente— se diseña para que una acción con efecto no dependa solo de que la etiqueta exista.

Lee filtro-de-adjuntos.txt y decide qué corrección cierra el hallazgo de forma duradera.

Responde para continuar

¿Qué corrección cierra de forma duradera el hallazgo de cobertura del filtro?

Ver pista de ayuda

Cuenta los orígenes de la tabla que dicen «no» y piensa qué pasaría con el próximo origen que se añada.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad