Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Detectar la filtración leyendo registros

5 tareas · 40 min · Principiante

Tiaca Conecta ya sabe que su prompt v12 llevaba una credencial. La pregunta siguiente es si alguien la sacó. Tarka tiene un detector que revisa cada respuesta antes de enviarla y una marca de control escrita en el prompt para delatar una filtración. Tienes los ajustes del detector y las trazas del 28 de septiembre al 1 de octubre de 2026. Lees las trazas como quien investiga: qué respuesta llevó el prompt fuera, desde dónde se insistió y qué dejó pasar el detector. Los pedidos de los usuarios están resumidos en una frase; no se reproduce ninguno.

0 de 5 · 0%

Objetivo de la sala

Tiaca Conecta ya sabe que su prompt v12 llevaba una credencial. La pregunta siguiente es si alguien la sacó. Tarka tiene un detector que revisa cada respuesta antes de enviarla y una marca de control escrita en el prompt para delatar una filtración. Tienes los ajustes del detector y las trazas del 28 de septiembre al 1 de octubre de 2026. Lees las trazas como quien investiga: qué respuesta llevó el prompt fuera, desde dónde se insistió y qué dejó pasar el detector. Los pedidos de los usuarios están resumidos en una frase; no se reproduce ninguno.

Una forma barata de detectar que el prompt ha salido es escribir en él una marca de control: una cadena única, sin ningún significado ni valor, que no tiene por qué aparecer nunca en una respuesta normal. Un filtro que revisa cada salida busca esa cadena; si la encuentra, el prompt se está repitiendo. A esta técnica se la suele llamar marca centinela o canario.

Dos detalles importan. La marca no es un secreto, así que no protege nada: solo avisa. Y una respuesta puede llevar el prompt sin la marca, porque el modelo puede resumirlo, traducirlo o reordenarlo. Por eso se combina con una medida de coincidencia entre la respuesta y el prompt, que capta también las versiones transformadas.

Responde para continuar

¿Qué hace la marca de control escrita en el prompt de Tarka?

Ver pista de ayuda

La marca no tiene valor propio; su utilidad está en dónde aparece.

La primera búsqueda en las trazas es directa: qué respuestas llevaron la marca. Una coincidencia de la marca es la evidencia más fuerte de filtración, porque no hay ninguna razón legítima para que salga. Fíjate también en qué hizo el detector con esa respuesta, porque los ajustes dicen qué pasa cuando aparece la marca.

Consulta las trazas y localiza la conversación cuya respuesta contenía la marca de control.

Responde para continuar

¿En qué conversación la respuesta de Tarka contenía la marca de control?

Ver pista de ayuda

Ejecuta `SELECT * FROM trazas` y mira la columna `centinela_en_respuesta`.

Una filtración rara vez llega en un único intento. Quien busca el prompt suele probar varias peticiones parecidas, a poca distancia unas de otras, desde el mismo origen: que repita, que traduzca, que resuma, que cambie de formato. En las trazas eso se ve como un grupo de conversaciones con el mismo origen, pedidos sobre las propias instrucciones y una coincidencia con el prompt que sube y baja.

Mira el origen de las conversaciones que piden algo sobre las instrucciones del asistente y encuentra el que se repite.

Responde para continuar

¿Desde qué dirección de origen se repiten las peticiones sobre las instrucciones del asistente?

Ver pista de ayuda

En la misma consulta, agrupa a ojo por la columna `origen` las filas cuyo `pedido_del_usuario` habla de las instrucciones o las reglas.

Un detector con dos umbrales separa lo que avisa de lo que bloquea. Entre ambos queda una franja en la que la respuesta sale igualmente y solo se anota una alerta. Esa franja es justo donde caen las versiones resumidas o traducidas del prompt, que nunca coinciden al cien por cien.

Lee los ajustes del detector y cuenta las respuestas con una coincidencia igual o superior al umbral de alerta que, aun así, llegaron al cliente.

Responde para continuar

¿Cuántas respuestas con coincidencia igual o superior al umbral de alerta llegaron igualmente al cliente?

Ver pista de ayuda

Ejecuta `SELECT * FROM detector_de_salida` para ver el umbral de alerta y cuenta en `trazas` las filas que lo alcanzan y cuya `accion_del_filtro` es «entregada».

Si una respuesta llevó el prompt fuera y el prompt contenía una credencial, la credencial se trata como comprometida desde la primera respuesta filtrada, aunque no se vea su uso. Ajustar el detector o bajar los umbrales evita filtraciones futuras, pero no deshace la que ya ocurrió.

Responde para continuar

Confirmada la filtración de la v12, ¿qué se hace primero?

Ver pista de ayuda

Lo que salió ya está fuera; la pregunta es qué deja de servir.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad