Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Evaluaciones en línea y muestreo

5 tareas · 40 min · Principiante

Un banco de pruebas antes del despliegue dice cómo respondía el asistente con preguntas preparadas; una evaluación en línea dice cómo responde hoy, con clientes de verdad. Como no se puede revisar cada traza, se elige cuáles se guardan y cuáles se evalúan, y esa elección decide lo que el equipo puede ver. Canastero Créditos guarda las trazas de Chiricoca con un muestreo en el colector y las evalúa con reglas, con un modelo que hace de juez y con revisión humana. Tienes la configuración del muestreo, la política de evaluación, los resultados de la semana 40 y la calibración del juez. Es solo lectura: nada se ejecuta.

0 de 5 · 0%

Objetivo de la sala

Un banco de pruebas antes del despliegue dice cómo respondía el asistente con preguntas preparadas; una evaluación en línea dice cómo responde hoy, con clientes de verdad. Como no se puede revisar cada traza, se elige cuáles se guardan y cuáles se evalúan, y esa elección decide lo que el equipo puede ver. Canastero Créditos guarda las trazas de Chiricoca con un muestreo en el colector y las evalúa con reglas, con un modelo que hace de juez y con revisión humana. Tienes la configuración del muestreo, la política de evaluación, los resultados de la semana 40 y la calibración del juez. Es solo lectura: nada se ejecuta.

Hay dos momentos para decidir si una traza se guarda. En el muestreo de cabeza se decide al empezar, al azar: es barato, pero se decide sin saber cómo terminará la petición, así que un error raro tiene las mismas probabilidades de perderse que cualquier otra traza. En el muestreo de cola el colector espera a que la traza termine y decide con lo que pasó: puede guardar todas las que fallaron, todas las lentas y una fracción del resto. Cuesta más memoria y espera, y a cambio no se pierde lo que más interesa.

Lo que no cumple ninguna condición del muestreo de cola solo queda si cae en la fracción al azar. Por eso cada condición de la política de evaluación tiene que tener su regla de muestreo; si no la tiene, depende de la suerte.

Responde para continuar

¿Qué muestreo permite guardar todas las trazas que terminaron con error?

Ver pista de ayuda

Abre `colector/muestreo.yml` y lee cuándo decide el colector y con qué condiciones.

Una muestra al azar reproduce las proporciones del tráfico: los flujos con mucho volumen reciben muchas evaluaciones y los pequeños casi ninguna. El problema es que los flujos pequeños suelen ser los delicados, los que tocan una decisión difícil o una situación económica complicada, y con unas pocas trazas evaluadas cualquier puntuación es ruido. La política lo previene con un mínimo por flujo.

Compara los resultados de la semana 40 con la política de evaluación. Anota el flujo que no llega al mínimo de trazas evaluadas.

Responde para continuar

¿Qué flujo de Chiricoca no llega al mínimo de trazas evaluadas que exige la política?

Ver pista de ayuda

Lee el mínimo semanal en `politica-de-evaluacion.txt` y compáralo con la columna `trazas_evaluadas` de los resultados.

Un modelo que hace de juez evalúa miles de trazas a un costo bajo, pero es otro modelo, con sus propios errores y sesgos. Antes de dejar que su veredicto dispare una alerta se calibra: personas revisan a mano una muestra y se cuenta en cuántas el juez coincidió con ellas. Un evaluador que coincide poco genera alertas que nadie debería creer, o calla cuando debía avisar.

Con el archivo de calibración, calcula el porcentaje de coincidencia del evaluador que comprueba si las respuestas se apoyan en las fuentes.

Responde para continuar

¿Qué porcentaje de coincidencia con la revisión humana tiene el evaluador fidelidad_a_fuentes?

Ver pista de ayuda

Divide `coincidencias` entre `trazas_revisadas` y multiplica por 100.

Cuando el filtro de salida bloquea una respuesta, el asistente devuelve un mensaje alternativo y la petición termina sin error. Para el colector es una traza normal, rápida y correcta. Si la política quiere revisar esos bloqueos y ninguna regla del muestreo los reconoce, solo se guardan los que caigan en la fracción al azar, y la revisión prometida no se puede hacer.

Compara las políticas del muestreo con la política de evaluación y anota la regla de evaluación que la configuración actual no permite cumplir.

Responde para continuar

¿Qué regla de la política de evaluación no se puede cumplir con el muestreo configurado?

Ver pista de ayuda

Lee el comentario del final de `muestreo.yml` y busca en la política la regla que habla del filtro de salida.

Subir el porcentaje al azar para todos encarece el almacenamiento y la evaluación sin resolver lo importante: los flujos pequeños siguen recibiendo pocas trazas en proporción. La corrección es dirigir el muestreo: reglas por condición (bloqueos del filtro) y por flujo (un mínimo garantizado, o guardar todo en los flujos de poco volumen).

Responde para continuar

¿Qué cambio en el muestreo resuelve los dos hallazgos de esta sala?

Ver pista de ayuda

Piensa en qué dos tipos de traza se están perdiendo y en qué regla guardaría cada uno.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad