Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Métricas de costo, latencia y calidad

5 tareas · 40 min · Principiante

Las trazas cuentan peticiones una a una; las métricas las resumen para ver tendencias y poner alertas. En un asistente hay tres familias que se vigilan juntas: cuánto cuesta, cuánto tarda y qué tan bien responde, y un cambio que mejora una suele empeorar otra. Tienes las métricas diarias de Chiricoca, el asistente de Canastero Créditos, del 29 de septiembre al 5 de octubre de 2026, los precios del contrato con sus proveedores y los indicadores por versión de las instrucciones. Los lees como quien tiene que explicar qué cambió esa semana. Es solo lectura: nada se ejecuta.

0 de 5 · 0%

Objetivo de la sala

Las trazas cuentan peticiones una a una; las métricas las resumen para ver tendencias y poner alertas. En un asistente hay tres familias que se vigilan juntas: cuánto cuesta, cuánto tarda y qué tan bien responde, y un cambio que mejora una suele empeorar otra. Tienes las métricas diarias de Chiricoca, el asistente de Canastero Créditos, del 29 de septiembre al 5 de octubre de 2026, los precios del contrato con sus proveedores y los indicadores por versión de las instrucciones. Los lees como quien tiene que explicar qué cambió esa semana. Es solo lectura: nada se ejecuta.

La latencia de un asistente no se reparte de forma pareja: la mayoría de las respuestas llega rápido y unas pocas tardan muchísimo, por ejemplo las que encadenan herramientas o las que cayeron en un modelo de respaldo. El promedio mezcla los dos grupos y esconde a los clientes que esperaron. Por eso se vigilan percentiles: la mediana (p50) dice cómo le va al cliente típico y el percentil 95 (p95) dice cómo le va a uno de cada veinte en el peor lado.

En un asistente se mira además el tiempo hasta el primer fragmento de la respuesta, que es lo que el cliente percibe como «ya contestó» cuando la respuesta llega por partes, y se separa del tiempo total de la traza.

Responde para continuar

¿Por qué se vigila el percentil 95 de la latencia y no solo el promedio?

Ver pista de ayuda

Ejecuta `SELECT * FROM metricas_diarias` y compara cómo se mueven las columnas de p50 y p95 de un día a otro.

Cuando el p95 sube y la mediana no se mueve, el problema no es general: es un grupo de peticiones que tarda mucho más que el resto. Las causas típicas son un proveedor que rechaza peticiones y obliga a caer al modelo de respaldo, una herramienta que tarda, o un tipo de pregunta que dispara más vueltas del agente. La métrica dice cuándo; las trazas de ese día dicen cuáles.

Consulta las métricas diarias y localiza el día en que la cola lenta creció mientras la mediana se quedó igual.

Responde para continuar

¿Qué día subió el p95 de latencia sin que se moviera la mediana?

Ver pista de ayuda

Busca el día con el `latencia_p95_ms` fuera de escala y mira su `latencia_p50_ms`.

El costo de un asistente se reconstruye con tokens y precio: tokens de entrada por su precio, más tokens de salida por el suyo, que suele ser varias veces mayor. Tenerlo calculado por día y por modelo permite ver si un cambio de instrucciones o de modelo encareció el servicio, y es la misma cuenta que después se usa para alertar sobre un gasto anómalo.

Con las métricas del 4 de octubre y la tabla de precios, calcula cuánto costaron ese día los tokens del modelo principal.

Responde para continuar

¿Cuántos pesos costaron los tokens de modelo-a-2026-08 el 2026-10-04?

Ver pista de ayuda

Multiplica los tokens de entrada y de salida de ese día por el precio de cada 1000 tokens de `precios` y suma los dos resultados.

Una respuesta cortada por llegar al máximo de tokens de salida termina a mitad de frase, y en un asistente de créditos eso puede dejar una condición sin decir. El motivo de fin queda en cada span (gen_ai.response.finish_reasons), y agregado por versión de las instrucciones muestra si un cambio de configuración lo provocó. Bajar ese máximo ahorra costo y casi siempre se paga en calidad.

Consulta los indicadores por versión de las instrucciones y anota la versión con la que se dispararon las respuestas cortadas.

Responde para continuar

¿Con qué versión de las instrucciones se dispararon las respuestas cortadas por longitud?

Ver pista de ayuda

Ejecuta `SELECT * FROM por_version_de_instrucciones` y compara `pct_cortadas_por_longitud` entre versiones.

Los votos de los clientes parecen la medida más directa de calidad, pero tienen dos sesgos: vota quien quiere, casi siempre muy contento o muy molesto, y basta mover el botón para que voten menos. Una evaluación automática sobre una muestra de trazas no depende de que el cliente vote, y por eso se lee junto a los votos, con el número de votos al lado.

Responde para continuar

Con los indicadores por versión delante, ¿qué concluyes de la calidad de instr-v14?

Ver pista de ayuda

Lee la nota de la tabla: qué cambió en el botón de votar y en el máximo de tokens con instr-v14.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad