🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónRechazos indebidos: el otro lado de la balanza
5 tareas · 35 min · Principiante
Un asistente que se niega a todo tiene cero ataques exitosos y ningún valor para el cliente. Medir solo el ataque empuja justo hacia ahí. Esta sala añade la segunda métrica de un conjunto de evaluación, el rechazo indebido, y enseña a leer las dos juntas. Se compara, sobre Tenca, el asistente de Quetro Energía, una versión del prompt con otra: la nueva baja los ataques y sube los rechazos. Se calcula la tasa de rechazo, la diferencia entre versiones y se descubre por qué el contador automático de rechazos no se puede creer sin revisar. Todo es lectura de resúmenes y de una muestra de ejemplo.
Objetivo de la sala
Un asistente que se niega a todo tiene cero ataques exitosos y ningún valor para el cliente. Medir solo el ataque empuja justo hacia ahí. Esta sala añade la segunda métrica de un conjunto de evaluación, el rechazo indebido, y enseña a leer las dos juntas. Se compara, sobre Tenca, el asistente de Quetro Energía, una versión del prompt con otra: la nueva baja los ataques y sube los rechazos. Se calcula la tasa de rechazo, la diferencia entre versiones y se descubre por qué el contador automático de rechazos no se puede creer sin revisar. Todo es lectura de resúmenes y de una muestra de ejemplo.Si lo único que se mide es cuántos ataques triunfan, la forma más barata de mejorar la cifra es hacer que el asistente rechace más. Un prompt que dice «ante la duda, no ayudes» baja a casi cero casi cualquier categoría de ataque y destroza la utilidad del producto: el cliente que pide una copia de su factura recibe una negativa. El coste es real pero no sale en la métrica de ataque.
Por eso un conjunto de evaluación serio mide también el rechazo indebido: la proporción de peticiones legítimas que el asistente no atendió. Las dos métricas son los dos platillos de una balanza. Una mejora de seguridad que se compra con muchos rechazos indebidos es un cambio de lugar del problema, no una solución.
Responde para continuar
¿Por qué hace falta medir el rechazo indebido además de la tasa de éxito del ataque?
Ver pista de ayuda
Rechazar todo da cero ataques exitosos. Lo que delata ese truco es la tasa de peticiones legítimas no atendidas.
La definición es simple: rechazos indebidos confirmados entre peticiones legítimas del conjunto benigno. Hay un detalle importante: el numerador son los rechazos que una persona confirmó, no los que marcó el contador automático. El contador del equipo detecta rechazos por frases como «no puedo», y cualquier respuesta que contenga esas palabras queda marcada, aunque haya ayudado. Se revisa a mano cada marcada y solo las confirmadas cuentan.
Abre el resumen por versión y calcula la tasa de rechazo indebido de la versión nueva del prompt, la que trae menos ataques exitosos.
Responde para continuar
¿Qué porcentaje de las peticiones legítimas son rechazos indebidos confirmados con la versión nueva del prompt (prompt-v7)? Escribe solo el número.
Ver pista de ayuda
Con la terminal, `cat quetro/resumen-por-version.txt`. Usa la columna de confirmados, no la de marcados por el detector, entre las peticiones legítimas.
La comparación entre versiones se hace en puntos porcentuales, no en porcentaje relativo: pasar de una tasa a otra se expresa restando. Decir «subió un 275 %» suena dramático y a la vez oculta lo que le importa a quien decide, que es cuántos clientes más se quedan sin ayuda de cada cien. Los puntos lo dicen directamente.
Calcula la tasa de la versión anterior (prompt-v6) y resta.
Responde para continuar
¿Cuántos puntos porcentuales sube el rechazo indebido de prompt-v7 frente a prompt-v6? Escribe solo el número.
Ver pista de ayuda
Calcula la tasa de rechazo indebido de cada versión con los confirmados y las 200 peticiones, y resta la menor de la mayor.
El contador automático de rechazos es útil como filtro, no como veredicto. Su fallo típico es el falso aviso: marca una respuesta que contiene una frase de negativa, pero que en realidad atendió la petición. Si el equipo usara la cifra del contador sin revisarla, inflaría el rechazo indebido y descartaría una versión buena. Revisar una muestra de las marcadas y contar cuántas son falsos avisos permite estimar cuánto se equivoca el contador.
Abre la muestra revisada a mano y busca la respuesta que de verdad ayudó al cliente.
Responde para continuar
Escribe el id de la respuesta marcada como rechazo que en realidad sí atendió la petición del cliente.
Ver pista de ayuda
Con la terminal, `cat quetro/muestra-de-marcados.csv`. Lee la columna de revisión: una de las seis dice que la respuesta sí ayudó.
La versión nueva del prompt baja los ataques a la mitad y sube los rechazos indebidos. Ninguna de las dos cifras decide sola. Quien decide necesita ver el compromiso por escrito: cuánto se gana en un lado, cuánto se pierde en el otro, y qué pasa en las categorías de impacto más alto. El informe de evaluación no aprueba ni rechaza «por la nota»: pone las dos cifras juntas y propone el siguiente paso.
Responde para continuar
Una versión del prompt baja mucho los ataques exitosos pero sube los rechazos indebidos. ¿Qué se hace?
Ver pista de ayuda
Una sola cifra no decide. El informe enseña las dos, explica el compromiso y propone el siguiente paso.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.