Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Líneas base y ruido entre corridas

5 tareas · 40 min · Principiante

Una cifra sola no dice nada: hay que compararla con algo, y ese algo es la línea base. Pero un sistema con azar en sus respuestas no da el mismo número dos veces, así que la base no es una cifra sino una banda. En esta sala se aprende qué se congela para que dos corridas sean comparables, cómo se calcula la media y el ancho de la banda con varias corridas repetidas y cómo se decide si un cambio es real o ruido. Se trabaja con cinco corridas de la base de Tenca, el asistente de Quetro Energía, y una corrida candidata. Todo son tablas de ejemplo en modo lectura.

0 de 5 · 0%

Objetivo de la sala

Una cifra sola no dice nada: hay que compararla con algo, y ese algo es la línea base. Pero un sistema con azar en sus respuestas no da el mismo número dos veces, así que la base no es una cifra sino una banda. En esta sala se aprende qué se congela para que dos corridas sean comparables, cómo se calcula la media y el ancho de la banda con varias corridas repetidas y cómo se decide si un cambio es real o ruido. Se trabaja con cinco corridas de la base de Tenca, el asistente de Quetro Energía, y una corrida candidata. Todo son tablas de ejemplo en modo lectura.

Comparar dos corridas solo tiene sentido si lo único que cambió es lo que se quiere evaluar. Para eso la línea base congela y anota todo lo demás: la versión del modelo, el texto del prompt, la versión del conjunto de casos, los parámetros de muestreo como la temperatura y el detector que decide qué es un éxito. Un cambio en cualquiera de ellos hace que la comparación mida otra cosa sin que nadie lo note.

Y como el modelo muestrea con azar, la línea base no se hace con una corrida, sino con varias repeticiones de la misma configuración. De ellas salen la media y la variación natural: lo que cualquier corrida puede dar por casualidad, sin que nada haya cambiado.

Responde para continuar

¿Qué es una línea base fiable para evaluar un asistente con azar en sus respuestas?

Ver pista de ayuda

El azar del muestreo hace que cada corrida varíe. La base necesita repeticiones y una configuración que no cambie entre ellas.

Un descuido frecuente al repetir una base es que una corrida use una versión distinta del conjunto de casos, por ejemplo porque alguien ejecutó el conjunto antiguo. El número de intentos cambia, los casos cambian y la tasa deja de significar lo mismo. Meter esa corrida en la media la desplaza sin que parezca un error, porque la cifra no se ve rara a simple vista.

Abre la tabla de corridas de la base y busca la que no cumple la condición de comparabilidad del conjunto.

Responde para continuar

Escribe el id de la corrida de la base que no es comparable con las demás.

Ver pista de ayuda

Ejecuta `SELECT * FROM corridas_base`. Compara las columnas modelo, prompt y conjunto de las cinco corridas; una difiere.

Con las corridas comparables se calcula la media de éxitos. Esa media es el punto de referencia contra el que se comparará el candidato. Se calcula solo con las corridas del mismo modelo, prompt y conjunto, y se anotan junto a la fecha y a los parámetros, para que quien la lea dentro de un mes sepa exactamente con qué se hizo.

Calcula la media de éxitos de las corridas comparables.

Responde para continuar

¿Cuál es la media de éxitos de las corridas comparables de la base? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM corridas_base`. Descarta la corrida que no es comparable, suma los éxitos de las demás y divide entre cuántas son.

La media sola no basta. Entre las corridas de la base hay una variación que no se debe a ningún cambio, sino al azar del muestreo. La forma más sencilla de verla es el rango: la diferencia entre la corrida con más éxitos y la que tiene menos, dentro de las comparables. Ese rango es la banda de ruido: cualquier corrida del sistema sin cambios puede caer en cualquier punto de la banda.

Esto no sustituye a las pruebas estadísticas formales, pero es una regla práctica que un equipo puede aplicar a mano y que evita el error de celebrar o alarmarse por una diferencia que el azar produce solo.

Responde para continuar

¿Cuántos éxitos mide el ancho de la banda de ruido de la base (el rango de éxitos de las corridas comparables)? Escribe solo el número.

Ver pista de ayuda

Entre las corridas comparables, resta los éxitos de la que menos tiene a los de la que más tiene.

Una vez que la base tiene su banda, la decisión sobre un candidato es mecánica. Si el candidato cae dentro de la banda, la diferencia con la media no se distingue del azar: no hay evidencia de que algo haya cambiado, ni para bien ni para mal. Si cae claramente fuera, vale la pena repetirlo para confirmarlo. Decir «ha mejorado» o «ha empeorado» por una diferencia que cabe dentro de la banda es leer ruido como señal.

Hay una consecuencia útil: antes de probar un candidato ya se sabe cuánta diferencia es demasiado pequeña para decir nada.

Responde para continuar

La corrida K-01 de la tabla candidata da un número de éxitos distinto de la media de la base, pero dentro de su banda de ruido. ¿Qué se concluye?

Ver pista de ayuda

Ejecuta `SELECT * FROM candidata` y compárala con la banda de la base. Una diferencia menor que la variación propia de la base no se distingue del azar.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad