Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Extracción por consultas: señales en el tráfico

5 tareas · 40 min · Principiante

Para copiar un modelo no hace falta robar sus pesos: basta con preguntarle muchas veces, guardar lo que responde y entrenar otro modelo con esas respuestas. Desde fuera, eso se parece a un cliente que usa mucho el servicio, y no todo cliente que usa mucho está copiando. Ruil Lenguaje te pasa el resumen de uso de su API de una semana. Lees quién pregunta qué, cuánto y cómo, y separas el uso intenso del patrón de extracción. Todo es lectura de registros ficticios; no se envía ninguna consulta.

0 de 5 · 0%

Objetivo de la sala

Para copiar un modelo no hace falta robar sus pesos: basta con preguntarle muchas veces, guardar lo que responde y entrenar otro modelo con esas respuestas. Desde fuera, eso se parece a un cliente que usa mucho el servicio, y no todo cliente que usa mucho está copiando. Ruil Lenguaje te pasa el resumen de uso de su API de una semana. Lees quién pregunta qué, cuánto y cómo, y separas el uso intenso del patrón de extracción. Todo es lectura de registros ficticios; no se envía ninguna consulta.

La extracción por consultas convierte la API en una fuente de datos de entrenamiento. Alguien prepara muchas entradas, recoge las respuestas del modelo y entrena con ellas un modelo propio que imita su comportamiento. No necesita los pesos ni el corpus: le basta con que la API conteste. MITRE ATLAS describe esta técnica como una forma de exfiltración a través de la API de inferencia, y OWASP la incluye en el consumo sin límites porque el daño crece con el volumen que la API deja pasar.

La diferencia con un ataque de denegación de servicio es el objetivo. Quien satura una API quiere que deje de responder; quien extrae quiere que responda mucho, bien y de forma estable, sobre todo el abanico de casos que el modelo sabe resolver.

Responde para continuar

¿Qué busca quien extrae un modelo por consultas?

Ver pista de ayuda

Piensa en para qué le sirven las respuestas a quien las guarda.

El volumen solo no distingue. Un cliente que integra el servicio en su plataforma puede mandar más peticiones que nadie y estar usándolo justo para lo que lo compró. Las señales de extracción son otras y se ven juntas. Casi todas las entradas son distintas entre sí, porque repetir no enseña nada nuevo. Cubren todo el catálogo de casos y no solo los del negocio del cliente. El uso es parejo las 24 horas, como un proceso automático. Y las entradas tienen pinta de fabricadas: plantillas en las que cambia un solo dato cada vez.

Consulta el uso de la semana y los resúmenes de peticiones, y busca la clave que reúne esas señales.

Responde para continuar

¿Qué clave de la API muestra el patrón de extracción?

Ver pista de ayuda

En `uso_semanal`, compara `peticiones` con `prompts_distintos`, y mira `tipos_de_clausula` y `horas_con_uso`. Luego confírmalo en `muestra_de_peticiones`.

Una respuesta con solo la etiqueta más probable enseña poco por petición. Una que trae las alternativas con su probabilidad enseña mucho más: muestra cómo de seguro está el modelo y qué otras opciones consideró, y eso permite entrenar una imitación con muchas menos consultas. Del mismo modo, fijar la aleatoriedad en cero garantiza que cada respuesta sea la estable, la que conviene copiar. Un cliente normal casi nunca necesita ninguna de las dos cosas.

Revisa los parámetros opcionales de cada clave y el catálogo del servicio.

Responde para continuar

¿Qué parámetro opcional que devuelve probabilidades pide esa clave y ningún otro cliente?

Ver pista de ayuda

Mira la columna `parametros_extra` de `uso_semanal` y la explicación de cada parámetro en `catalogo`.

Antes de escribir el hallazgo conviene descartar al que más ruido hace. Si se acusa al cliente equivocado, se pierde un cliente y el que copia sigue copiando.

Responde para continuar

La clave rk-2093 envía más peticiones que nadie. ¿Por qué no encaja con una extracción?

Ver pista de ayuda

Compara sus prompts distintos, sus tipos de cláusula y sus parámetros con los de la clave sospechosa, y lee su uso declarado en `clientes`.

La cobertura dice cuánto del comportamiento del modelo quedó registrado en las respuestas que alguien se llevó. Un cliente real usa los tipos de cláusula de su negocio; una extracción busca recorrerlos todos, porque una imitación que solo sabe resolver unos pocos no sustituye al original.

Responde para continuar

¿Cuántos tipos de cláusula distintos recibió esa clave en una sola semana?

Ver pista de ayuda

Está en `uso_semanal`; compáralo con el total de tipos que reconoce el modelo en `catalogo`.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad