Loading
_ DESCIFRANDO CONEXIÓN SEGURA...

Evaluación de RAG: fidelidad y relevancia

5 tareas · 40 min · Principiante

Un asistente que responde con documentos recuperados puede fallar en dos sitios: al buscar y al redactar. Las métricas de evaluación de RAG separan esos fallos, y la más citada, la fidelidad, se confunde a menudo con la exactitud. Llaca Finanzas evaluó una muestra de conversaciones de su asistente Chungungo y un borrador concluye que la recuperación está sana. Revisas el lote en una consola de solo lectura, con las métricas configuradas, las muestras, el registro de fichas de producto y el resumen del borrador. No se ejecuta nada.

0 de 5 · 0%

Objetivo de la sala

Un asistente que responde con documentos recuperados puede fallar en dos sitios: al buscar y al redactar. Las métricas de evaluación de RAG separan esos fallos, y la más citada, la fidelidad, se confunde a menudo con la exactitud. Llaca Finanzas evaluó una muestra de conversaciones de su asistente Chungungo y un borrador concluye que la recuperación está sana. Revisas el lote en una consola de solo lectura, con las métricas configuradas, las muestras, el registro de fichas de producto y el resumen del borrador. No se ejecuta nada.

En una aplicación con recuperación de documentos se evalúan por separado varias cosas. La fidelidad mira la respuesta frente al contexto recuperado: se descompone la respuesta en afirmaciones y se cuenta cuántas respalda ese contexto. La relevancia mira la respuesta frente a la pregunta: si contesta lo que se preguntó. La precisión del contexto mira si los fragmentos útiles quedaron arriba entre los recuperados, y la cobertura del contexto mira si se recuperó todo lo necesario, para lo cual hace falta una respuesta de referencia escrita por personas.

La fidelidad no compara con la realidad: compara con lo que se recuperó. Si el buscador trajo un documento viejo o equivocado, una respuesta puede ser perfectamente fiel a él y estar mal. Por eso la fidelidad se lee junto con qué se recuperó y en qué versión.

Responde para continuar

Una respuesta tiene fidelidad 1.00. ¿Qué se puede afirmar de ella?

Ver pista de ayuda

La fidelidad compara la respuesta con un único término de referencia. ¿Cuál?

El borrador da una fidelidad media y concluye que supera el umbral. Pero el umbral de Llaca es por muestra, y la media se calculó sin una muestra que quedó pendiente porque la llamada al modelo evaluador falló. Esa muestra no se puede ignorar: sus conteos de afirmaciones están guardados y su fidelidad se puede calcular a mano.

Abre la consola y revisa el resumen, las muestras y su nota.

Responde para continuar

Contando la muestra pendiente, ¿cuántas muestras quedan por debajo del umbral de fidelidad? Escribe solo el número.

Ver pista de ayuda

Ejecuta `SELECT * FROM resumen` y `SELECT * FROM muestras`. La fidelidad de la pendiente es respaldadas entre afirmaciones.

Una muestra con fidelidad perfecta puede ser la más peligrosa del lote si el documento recuperado ya no está vigente: el asistente repite con exactitud un dato que dejó de ser cierto, y ninguna métrica de fidelidad lo marca. Para encontrarla hay que cruzar la versión de la ficha recuperada con el registro de fichas.

Responde para continuar

¿Qué muestra tiene fidelidad perfecta pero se apoya en una versión de ficha que ya fue reemplazada?

Ver pista de ayuda

Ejecuta `SELECT * FROM fichas` y compara cada `version_de_la_ficha` de las muestras con el estado de esa versión.

La relevancia cubre el otro hueco: una respuesta puede decir solo cosas ciertas y respaldadas sin contestar lo que se preguntó. Para el cliente es igual de inútil, y en un tema como una penalidad o un costo puede llevarlo a decidir sin el dato que pidió.

Responde para continuar

¿Qué muestra tiene fidelidad perfecta y la relevancia más baja del lote?

Ver pista de ayuda

En `muestras`, mira solo las filas con fidelidad 1.00 y compara su columna `relevancia`. La nota de la tabla explica qué pasó.

El borrador concluye que la recuperación está sana porque la media supera el umbral. Con lo que encontraste, la conclusión no se sostiene, y además el lote no mide si el buscador trae todo lo necesario, porque no tiene respuestas de referencia.

Responde para continuar

¿Qué corrección corresponde hacer al borrador del informe?

Ver pista de ayuda

El evaluador hizo bien su trabajo con la ficha que recibió. El problema está en qué se recuperó, en la media y en lo que el lote no mide.

Inicia sesión para registrar tus puntos y progreso en el ranking.

Whoami-Labs Pro

Whoami-Labs Pro utiliza cookies

Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad