Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Evaluación con modelo como juez: límites

5 tareas · 35 min · Principiante

Cuando la respuesta es abierta, no hay una cadena exacta con la que compararla, y muchos marcos usan otro modelo para calificar. Es rápido y barato, pero ese juez tiene sesgos que se pueden medir. Llaca Finanzas califica con un modelo juez dos categorías de seguridad de su asistente Chungungo y compara candidatos por pares. Tienes su configuración, su rúbrica, una calibración contra personas y una prueba de orden hecha a mano. Es solo lectura: no se llama a ningún modelo.

0 de 5 · 0%

Objetivo de la sala

Cuando la respuesta es abierta, no hay una cadena exacta con la que compararla, y muchos marcos usan otro modelo para calificar. Es rápido y barato, pero ese juez tiene sesgos que se pueden medir. Llaca Finanzas califica con un modelo juez dos categorías de seguridad de su asistente Chungungo y compara candidatos por pares. Tienes su configuración, su rúbrica, una calibración contra personas y una prueba de orden hecha a mano. Es solo lectura: no se llama a ningún modelo.

Un modelo juez recibe la pregunta, la respuesta evaluada y una rúbrica, y devuelve una nota o un veredicto. Sirve para calificar respuestas abiertas a escala, algo que una comparación de texto exacta no puede hacer. Pero el juez es otro modelo, con sus propias tendencias, y las más conocidas son estas: prefiere la respuesta que se le muestra en cierta posición; premia las respuestas largas aunque no sean mejores; tiende a favorecer respuestas de su propia familia de modelos; es indulgente con lo que suena seguro; y puede dejarse llevar por texto dirigido a él dentro de la respuesta que califica.

Ninguno de esos sesgos se ve en la nota final. Se ven comparando al juez con personas, invirtiendo el orden de presentación y leyendo su configuración.

Responde para continuar

¿Cuál de estas prácticas reduce el riesgo de que el juez favorezca a un candidato por razones ajenas a la calidad?

Ver pista de ayuda

Dos de los sesgos de la lista se atacan con la elección del juez y con una comparación externa.

El primer dato a revisar en un juez es de dónde viene. Si el juez y uno de los candidatos salen de la misma familia de modelos, las comparaciones entre candidatos dejan de ser neutrales, por mucho que la rúbrica sea buena.

Abre el laboratorio y lee la configuración del juez junto con la lista de candidatos.

Responde para continuar

¿Con qué candidato comparte familia el modelo juez? Escribe su nombre tal como aparece.

Ver pista de ayuda

Abre `juez/configuracion-del-juez.yml` y `LEEME.txt` y compara la familia del juez con el nombre de cada candidato.

La forma básica de calibrar un juez es darle a personas las mismas respuestas, sin que vean la nota del juez, y contar en cuántas coinciden. El acuerdo es la suma de los casos en que los dos aprueban y los dos rechazan, entre el total. Además del acuerdo importa la dirección del desacuerdo: no es lo mismo un juez que rechaza de más que uno que aprueba lo que las personas rechazarían.

Responde para continuar

¿Qué porcentaje de acuerdo tiene el juez con las personas en la calibración? Escribe solo el número.

Ver pista de ayuda

Abre `juez/calibracion-2026-10-01.txt`. Suma la diagonal de la tabla y divide entre el total de respuestas.

En una comparación por pares, un juez sin sesgo de posición elige el mismo ganador muestre primero la respuesta que muestre. Si el ganador cambia al invertir el orden, ese veredicto no dice nada de la calidad. La configuración de Llaca no repite las comparaciones con el orden invertido, así que el equipo lo hizo a mano con una muestra.

Responde para continuar

¿En cuántos de los pares revisados cambia el ganador al invertir el orden? Escribe solo el número.

Ver pista de ayuda

Abre `juez/pares-con-orden-invertido.txt` y compara las dos últimas columnas fila a fila.

Con la configuración, la rúbrica y las dos pruebas delante, el juez de Llaca acumula varios problemas a la vez: su familia, su temperatura, un criterio de la rúbrica que premia la longitud, el orden fijo y una respuesta que le habló directamente. La rúbrica explica parte de los aprobados indebidos de la calibración.

Responde para continuar

¿Qué conjunto de cambios corresponde al juez de Llaca antes de volver a usar sus notas?

Ver pista de ayuda

Cada cambio correcto responde a uno de los problemas que encontraste en las tareas 2 a 4 o en la rúbrica.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad