Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Clasificadores de seguridad de contenido

5 tareas · 40 min · Principiante

Un clasificador de seguridad de contenido es un modelo que lee un mensaje o una respuesta y dice si es seguro o no frente a una lista de categorías de daño. Es útil y tiene un alcance preciso: solo ve lo que su lista nombra. Achiote Mercado (empresa inventada) probó Llama Guard tres días alrededor de Toche, su asistente, y una persona etiquetó después cada caso. Lees la configuración, la lista de categorías y los veredictos: qué se le escapó por diseño, qué categoría pesó en las respuestas y qué costaría bajar el umbral. Todo es lectura de evidencia ficticia; no se ejecuta nada.

0 de 5 · 0%

Objetivo de la sala

Un clasificador de seguridad de contenido es un modelo que lee un mensaje o una respuesta y dice si es seguro o no frente a una lista de categorías de daño. Es útil y tiene un alcance preciso: solo ve lo que su lista nombra. Achiote Mercado (empresa inventada) probó Llama Guard tres días alrededor de Toche, su asistente, y una persona etiquetó después cada caso. Lees la configuración, la lista de categorías y los veredictos: qué se le escapó por diseño, qué categoría pesó en las respuestas y qué costaría bajar el umbral. Todo es lectura de evidencia ficticia; no se ejecuta nada.

Llama Guard 3 es un modelo afinado sobre Llama 3.1 de 8 mil millones de parámetros. Recibe un mensaje del usuario o la respuesta del asistente y contesta con un veredicto, seguro o inseguro, y en el segundo caso con los códigos de las categorías que se violan. La ficha del modelo publica la lista: catorce categorías, de S1 a S14, alineadas con una taxonomía de peligros estandarizada del sector, más una propia para el abuso de un intérprete de código.

Esa lista es su alcance. Son categorías de contenido dañino: violencia, odio, privacidad, contenido sexual y otras. Un mensaje que pide al asistente saltarse sus reglas no es, por sí mismo, contenido dañino de ninguna de esas categorías, y el clasificador puede darlo por seguro sin equivocarse respecto de su propia tarea. Para eso hacen falta otros controles.

Responde para continuar

Un clasificador de contenido marca como seguro un mensaje que pide al asistente saltarse sus reglas. ¿Qué indica eso?

Ver pista de ayuda

Compara lo que pedía el mensaje con la lista de categorías que el clasificador sabe nombrar.

Abre los veredictos. La columna de la etiqueta la puso una persona después del piloto; la de la decisión es lo que hizo el clasificador. Hay un caso que la persona etiquetó como intento de cambiar las reglas del asistente y que el clasificador dejó pasar con una probabilidad muy baja.

Responde para continuar

¿Qué veredicto corresponde al intento de cambiar las reglas que el clasificador dio por seguro? Escribe su identificador.

Ver pista de ayuda

Ejecuta `SELECT * FROM veredictos` y busca la etiqueta del revisor que no es legítimo ni dañino.

Un clasificador que también lee las respuestas sirve de última mirada antes de entregar: atrapa lo que el modelo principal escribió sin deber. En un asistente que maneja pedidos de muchas personas, el riesgo típico de la salida es que se cuele un dato de otro cliente.

Cuenta las respuestas de Toche (no las entradas) que el clasificador marcó con la categoría de privacidad.

Responde para continuar

¿Cuántas respuestas de Toche marcó el clasificador con la categoría de privacidad? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM veredictos` y `SELECT * FROM categorias`. Filtra por que_se_clasifico y por el código de privacidad.

El clasificador no da solo un veredicto: también se puede leer la probabilidad de que el primer token de su respuesta sea «inseguro», y comparar esa cifra con un umbral. Bajar el umbral atrapa más contenido dañino que quedaba cerca del límite, y también bloquea más mensajes legítimos que sonaban parecido. Antes de moverlo, se cuenta qué entraría de nuevo en cada lado.

Hay una propuesta abierta para bajar el umbral. Cuenta los mensajes que la persona etiquetó como legítimos y que hoy pasan, pero quedarían bloqueados con el umbral propuesto.

Responde para continuar

¿Cuántos casos legítimos más bloquearía el clasificador con el umbral propuesto? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM configuracion` y `SELECT * FROM veredictos`. Busca las filas legítimas con la probabilidad entre el umbral propuesto y el actual.

Con el umbral más bajo se atraparía un caso dañino más y se bloquearían tres consultas legítimas de clientes, todas sobre productos con filo o medicamentos de venta libre, que son parte normal del catálogo. Y el intento de cambiar las reglas seguiría pasando, porque no es una cuestión de umbral sino de alcance.

Lo sensato separa los dos problemas: el umbral se decide con el costo de cada error, y lo que el clasificador no ve por diseño se cubre con otra pieza.

Responde para continuar

Con los resultados del piloto, ¿qué decides para el clasificador de Toche?

Ver pista de ayuda

Separa lo que se resuelve con el umbral de lo que el clasificador no está hecho para ver.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad