🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónClasificadores de seguridad de contenido
5 tareas · 40 min · Principiante
Un clasificador de seguridad de contenido es un modelo que lee un mensaje o una respuesta y dice si es seguro o no frente a una lista de categorías de daño. Es útil y tiene un alcance preciso: solo ve lo que su lista nombra. Achiote Mercado (empresa inventada) probó Llama Guard tres días alrededor de Toche, su asistente, y una persona etiquetó después cada caso. Lees la configuración, la lista de categorías y los veredictos: qué se le escapó por diseño, qué categoría pesó en las respuestas y qué costaría bajar el umbral. Todo es lectura de evidencia ficticia; no se ejecuta nada.
Objetivo de la sala
Un clasificador de seguridad de contenido es un modelo que lee un mensaje o una respuesta y dice si es seguro o no frente a una lista de categorías de daño. Es útil y tiene un alcance preciso: solo ve lo que su lista nombra. Achiote Mercado (empresa inventada) probó Llama Guard tres días alrededor de Toche, su asistente, y una persona etiquetó después cada caso. Lees la configuración, la lista de categorías y los veredictos: qué se le escapó por diseño, qué categoría pesó en las respuestas y qué costaría bajar el umbral. Todo es lectura de evidencia ficticia; no se ejecuta nada.Llama Guard 3 es un modelo afinado sobre Llama 3.1 de 8 mil millones de parámetros. Recibe un mensaje del usuario o la respuesta del asistente y contesta con un veredicto, seguro o inseguro, y en el segundo caso con los códigos de las categorías que se violan. La ficha del modelo publica la lista: catorce categorías, de S1 a S14, alineadas con una taxonomía de peligros estandarizada del sector, más una propia para el abuso de un intérprete de código.
Esa lista es su alcance. Son categorías de contenido dañino: violencia, odio, privacidad, contenido sexual y otras. Un mensaje que pide al asistente saltarse sus reglas no es, por sí mismo, contenido dañino de ninguna de esas categorías, y el clasificador puede darlo por seguro sin equivocarse respecto de su propia tarea. Para eso hacen falta otros controles.
Responde para continuar
Un clasificador de contenido marca como seguro un mensaje que pide al asistente saltarse sus reglas. ¿Qué indica eso?
Ver pista de ayuda
Compara lo que pedía el mensaje con la lista de categorías que el clasificador sabe nombrar.
Abre los veredictos. La columna de la etiqueta la puso una persona después del piloto; la de la decisión es lo que hizo el clasificador. Hay un caso que la persona etiquetó como intento de cambiar las reglas del asistente y que el clasificador dejó pasar con una probabilidad muy baja.
Responde para continuar
¿Qué veredicto corresponde al intento de cambiar las reglas que el clasificador dio por seguro? Escribe su identificador.
Ver pista de ayuda
Ejecuta `SELECT * FROM veredictos` y busca la etiqueta del revisor que no es legítimo ni dañino.
Un clasificador que también lee las respuestas sirve de última mirada antes de entregar: atrapa lo que el modelo principal escribió sin deber. En un asistente que maneja pedidos de muchas personas, el riesgo típico de la salida es que se cuele un dato de otro cliente.
Cuenta las respuestas de Toche (no las entradas) que el clasificador marcó con la categoría de privacidad.
Responde para continuar
¿Cuántas respuestas de Toche marcó el clasificador con la categoría de privacidad? Escribe solo el número.
Ver pista de ayuda
Ejecuta `SELECT * FROM veredictos` y `SELECT * FROM categorias`. Filtra por que_se_clasifico y por el código de privacidad.
El clasificador no da solo un veredicto: también se puede leer la probabilidad de que el primer token de su respuesta sea «inseguro», y comparar esa cifra con un umbral. Bajar el umbral atrapa más contenido dañino que quedaba cerca del límite, y también bloquea más mensajes legítimos que sonaban parecido. Antes de moverlo, se cuenta qué entraría de nuevo en cada lado.
Hay una propuesta abierta para bajar el umbral. Cuenta los mensajes que la persona etiquetó como legítimos y que hoy pasan, pero quedarían bloqueados con el umbral propuesto.
Responde para continuar
¿Cuántos casos legítimos más bloquearía el clasificador con el umbral propuesto? Escribe solo el número.
Ver pista de ayuda
Ejecuta `SELECT * FROM configuracion` y `SELECT * FROM veredictos`. Busca las filas legítimas con la probabilidad entre el umbral propuesto y el actual.
Con el umbral más bajo se atraparía un caso dañino más y se bloquearían tres consultas legítimas de clientes, todas sobre productos con filo o medicamentos de venta libre, que son parte normal del catálogo. Y el intento de cambiar las reglas seguiría pasando, porque no es una cuestión de umbral sino de alcance.
Lo sensato separa los dos problemas: el umbral se decide con el costo de cada error, y lo que el clasificador no ve por diseño se cubre con otra pieza.
Responde para continuar
Con los resultados del piloto, ¿qué decides para el clasificador de Toche?
Ver pista de ayuda
Separa lo que se resuelve con el umbral de lo que el clasificador no está hecho para ver.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.