Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Regresiones al cambiar el modelo o el prompt

5 tareas · 40 min · Principiante

El proveedor entrega un modelo nuevo, o el equipo reescribe el prompt, y la pregunta es siempre la misma: ¿se rompió algo que estaba bien? Esta sala enseña a contestarla con una puerta de aprobación por categoría, a separar si la culpa es del modelo o del prompt cambiando un factor cada vez, y a no dejarse tranquilizar por una cifra global que mejora mientras una categoría empeora. Se trabaja con un cambio candidato de Tenca, el asistente de Quetro Energía, en tablas de solo lectura con cifras inventadas.

0 de 5 · 0%

Objetivo de la sala

El proveedor entrega un modelo nuevo, o el equipo reescribe el prompt, y la pregunta es siempre la misma: ¿se rompió algo que estaba bien? Esta sala enseña a contestarla con una puerta de aprobación por categoría, a separar si la culpa es del modelo o del prompt cambiando un factor cada vez, y a no dejarse tranquilizar por una cifra global que mejora mientras una categoría empeora. Se trabaja con un cambio candidato de Tenca, el asistente de Quetro Energía, en tablas de solo lectura con cifras inventadas.

Una regresión es un cambio que vuelve a abrir algo que estaba cerrado. Para cazarla antes de desplegar, el equipo define una puerta de aprobación: reglas escritas de antemano que el candidato debe cumplir. Las más habituales son dos: un techo por categoría, la tasa máxima tolerable, y un salto máximo frente a la base, cuánto puede empeorar como mucho. Las reglas se aplican categoría por categoría, no sobre la cifra global.

La razón es la misma que en la sala de métricas: una mejora grande en una categoría puede compensar en el promedio una subida seria en otra. El promedio aprueba lo que cada categoría, por separado, suspendería. Una categoría que empeora es una regresión aunque el global mejore.

Responde para continuar

Un candidato mejora la tasa global de éxito del ataque, pero una categoría concreta empeora mucho. ¿Pasa la puerta de aprobación?

Ver pista de ayuda

El promedio deja que una mejora grande tape una subida seria. Por eso las reglas van por categoría.

Abre la tabla con las cuatro combinaciones de modelo y prompt para la categoría LLM02. La combinación en producción es la base; el candidato es el cambio que se quiere desplegar, con el modelo nuevo y el prompt nuevo juntos. Calcula la tasa de cada una con sus éxitos entre los intentos válidos y resta: la diferencia, en puntos porcentuales, es lo que se compara con el salto máximo de la categoría.

Responde para continuar

¿Cuántos puntos porcentuales sube la tasa de LLM02 entre la combinación en producción y el candidato? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM matriz_llm02`. Calcula éxitos entre intentos válidos de las filas «en produccion» y «candidato (los dos)» y resta.

Cuando el candidato empeora, la pregunta siguiente es qué lo causó, porque de eso depende la acción: si es el prompt, se reescribe; si es el modelo, hay que hablar con el proveedor o seguir con el anterior. Cuando se cambian el modelo y el prompt a la vez, no se puede saber. La solución es la tabla de cuatro combinaciones: la base, solo el prompt nuevo, solo el modelo nuevo y los dos. Se compara en cada eje cuánto cambia la tasa al cambiar solo ese factor y se mira cuál mueve la cifra.

Lee las cuatro filas de la matriz y señala el factor responsable.

Responde para continuar

Escribe el identificador de la versión de modelo que explica el empeoramiento de LLM02.

Ver pista de ayuda

Compara las filas que comparten modelo y difieren en prompt, y las que comparten prompt y difieren en modelo. Solo uno de los dos ejes mueve la tasa.

Aplicar la puerta es una comprobación mecánica y se hace con las reglas de la tabla: para cada categoría, ¿supera el candidato su techo? ¿Empeora más que su salto máximo? Basta con que ocurra una de las dos cosas para que la categoría incumpla. Mejorar no cuenta como incumplir, aunque la diferencia sea grande. Y hay categorías que incumplen sin tocar el techo, solo por el salto: una tasa que sigue siendo baja pero que se ha duplicado es una señal que merece atención.

Revisa la tabla de reglas y resultados y cuenta las que incumplen.

Responde para continuar

¿Cuántas categorías incumplen las reglas de aprobación, por techo, por salto o por ambos? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM reglas_y_resultados`. Para cada fila resta base de candidato y compara con el salto máximo, y compara el candidato con el techo.

Una regresión detectada antes de desplegar es un éxito de la evaluación: hizo su trabajo. La reacción correcta es no desplegar el cambio, anotar qué eje lo causó y decidir con esa información. Si es el modelo, el candidato no avanza hasta tener una versión que cumpla o una mitigación en la arquitectura que cubra esa categoría; reescribir el prompt no arregla un problema que viene del modelo. El resultado queda anotado en el historial para que el mismo modelo no se vuelva a probar sin cambios.

Responde para continuar

La matriz muestra que la regresión viene del modelo nuevo y no del prompt. ¿Qué se hace?

Ver pista de ayuda

Un prompt no corrige lo que el modelo hace por sí mismo. La puerta existe para parar el despliegue, no para ajustarse hasta pasarla.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad