🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónEvaluación con modelo como juez: límites
5 tareas · 35 min · Principiante
Cuando la respuesta es abierta, no hay una cadena exacta con la que compararla, y muchos marcos usan otro modelo para calificar. Es rápido y barato, pero ese juez tiene sesgos que se pueden medir. Llaca Finanzas califica con un modelo juez dos categorías de seguridad de su asistente Chungungo y compara candidatos por pares. Tienes su configuración, su rúbrica, una calibración contra personas y una prueba de orden hecha a mano. Es solo lectura: no se llama a ningún modelo.
Objetivo de la sala
Cuando la respuesta es abierta, no hay una cadena exacta con la que compararla, y muchos marcos usan otro modelo para calificar. Es rápido y barato, pero ese juez tiene sesgos que se pueden medir. Llaca Finanzas califica con un modelo juez dos categorías de seguridad de su asistente Chungungo y compara candidatos por pares. Tienes su configuración, su rúbrica, una calibración contra personas y una prueba de orden hecha a mano. Es solo lectura: no se llama a ningún modelo.Un modelo juez recibe la pregunta, la respuesta evaluada y una rúbrica, y devuelve una nota o un veredicto. Sirve para calificar respuestas abiertas a escala, algo que una comparación de texto exacta no puede hacer. Pero el juez es otro modelo, con sus propias tendencias, y las más conocidas son estas: prefiere la respuesta que se le muestra en cierta posición; premia las respuestas largas aunque no sean mejores; tiende a favorecer respuestas de su propia familia de modelos; es indulgente con lo que suena seguro; y puede dejarse llevar por texto dirigido a él dentro de la respuesta que califica.
Ninguno de esos sesgos se ve en la nota final. Se ven comparando al juez con personas, invirtiendo el orden de presentación y leyendo su configuración.
Responde para continuar
¿Cuál de estas prácticas reduce el riesgo de que el juez favorezca a un candidato por razones ajenas a la calidad?
Ver pista de ayuda
Dos de los sesgos de la lista se atacan con la elección del juez y con una comparación externa.
El primer dato a revisar en un juez es de dónde viene. Si el juez y uno de los candidatos salen de la misma familia de modelos, las comparaciones entre candidatos dejan de ser neutrales, por mucho que la rúbrica sea buena.
Abre el laboratorio y lee la configuración del juez junto con la lista de candidatos.
Responde para continuar
¿Con qué candidato comparte familia el modelo juez? Escribe su nombre tal como aparece.
Ver pista de ayuda
Abre `juez/configuracion-del-juez.yml` y `LEEME.txt` y compara la familia del juez con el nombre de cada candidato.
La forma básica de calibrar un juez es darle a personas las mismas respuestas, sin que vean la nota del juez, y contar en cuántas coinciden. El acuerdo es la suma de los casos en que los dos aprueban y los dos rechazan, entre el total. Además del acuerdo importa la dirección del desacuerdo: no es lo mismo un juez que rechaza de más que uno que aprueba lo que las personas rechazarían.
Responde para continuar
¿Qué porcentaje de acuerdo tiene el juez con las personas en la calibración? Escribe solo el número.
Ver pista de ayuda
Abre `juez/calibracion-2026-10-01.txt`. Suma la diagonal de la tabla y divide entre el total de respuestas.
En una comparación por pares, un juez sin sesgo de posición elige el mismo ganador muestre primero la respuesta que muestre. Si el ganador cambia al invertir el orden, ese veredicto no dice nada de la calidad. La configuración de Llaca no repite las comparaciones con el orden invertido, así que el equipo lo hizo a mano con una muestra.
Responde para continuar
¿En cuántos de los pares revisados cambia el ganador al invertir el orden? Escribe solo el número.
Ver pista de ayuda
Abre `juez/pares-con-orden-invertido.txt` y compara las dos últimas columnas fila a fila.
Con la configuración, la rúbrica y las dos pruebas delante, el juez de Llaca acumula varios problemas a la vez: su familia, su temperatura, un criterio de la rúbrica que premia la longitud, el orden fijo y una respuesta que le habló directamente. La rúbrica explica parte de los aprobados indebidos de la calibración.
Responde para continuar
¿Qué conjunto de cambios corresponde al juez de Llaca antes de volver a usar sus notas?
Ver pista de ayuda
Cada cambio correcto responde a uno de los problemas que encontraste en las tareas 2 a 4 o en la rúbrica.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.