🔒 Registro cerrado · Apertura oficial próximamente · Acceso exclusivo para alumnos activos
Iniciar SesiónEvaluación de RAG: fidelidad y relevancia
5 tareas · 40 min · Principiante
Un asistente que responde con documentos recuperados puede fallar en dos sitios: al buscar y al redactar. Las métricas de evaluación de RAG separan esos fallos, y la más citada, la fidelidad, se confunde a menudo con la exactitud. Llaca Finanzas evaluó una muestra de conversaciones de su asistente Chungungo y un borrador concluye que la recuperación está sana. Revisas el lote en una consola de solo lectura, con las métricas configuradas, las muestras, el registro de fichas de producto y el resumen del borrador. No se ejecuta nada.
Objetivo de la sala
Un asistente que responde con documentos recuperados puede fallar en dos sitios: al buscar y al redactar. Las métricas de evaluación de RAG separan esos fallos, y la más citada, la fidelidad, se confunde a menudo con la exactitud. Llaca Finanzas evaluó una muestra de conversaciones de su asistente Chungungo y un borrador concluye que la recuperación está sana. Revisas el lote en una consola de solo lectura, con las métricas configuradas, las muestras, el registro de fichas de producto y el resumen del borrador. No se ejecuta nada.En una aplicación con recuperación de documentos se evalúan por separado varias cosas. La fidelidad mira la respuesta frente al contexto recuperado: se descompone la respuesta en afirmaciones y se cuenta cuántas respalda ese contexto. La relevancia mira la respuesta frente a la pregunta: si contesta lo que se preguntó. La precisión del contexto mira si los fragmentos útiles quedaron arriba entre los recuperados, y la cobertura del contexto mira si se recuperó todo lo necesario, para lo cual hace falta una respuesta de referencia escrita por personas.
La fidelidad no compara con la realidad: compara con lo que se recuperó. Si el buscador trajo un documento viejo o equivocado, una respuesta puede ser perfectamente fiel a él y estar mal. Por eso la fidelidad se lee junto con qué se recuperó y en qué versión.
Responde para continuar
Una respuesta tiene fidelidad 1.00. ¿Qué se puede afirmar de ella?
Ver pista de ayuda
La fidelidad compara la respuesta con un único término de referencia. ¿Cuál?
El borrador da una fidelidad media y concluye que supera el umbral. Pero el umbral de Llaca es por muestra, y la media se calculó sin una muestra que quedó pendiente porque la llamada al modelo evaluador falló. Esa muestra no se puede ignorar: sus conteos de afirmaciones están guardados y su fidelidad se puede calcular a mano.
Abre la consola y revisa el resumen, las muestras y su nota.
Responde para continuar
Contando la muestra pendiente, ¿cuántas muestras quedan por debajo del umbral de fidelidad? Escribe solo el número.
Ver pista de ayuda
Ejecuta `SELECT * FROM resumen` y `SELECT * FROM muestras`. La fidelidad de la pendiente es respaldadas entre afirmaciones.
Una muestra con fidelidad perfecta puede ser la más peligrosa del lote si el documento recuperado ya no está vigente: el asistente repite con exactitud un dato que dejó de ser cierto, y ninguna métrica de fidelidad lo marca. Para encontrarla hay que cruzar la versión de la ficha recuperada con el registro de fichas.
Responde para continuar
¿Qué muestra tiene fidelidad perfecta pero se apoya en una versión de ficha que ya fue reemplazada?
Ver pista de ayuda
Ejecuta `SELECT * FROM fichas` y compara cada `version_de_la_ficha` de las muestras con el estado de esa versión.
La relevancia cubre el otro hueco: una respuesta puede decir solo cosas ciertas y respaldadas sin contestar lo que se preguntó. Para el cliente es igual de inútil, y en un tema como una penalidad o un costo puede llevarlo a decidir sin el dato que pidió.
Responde para continuar
¿Qué muestra tiene fidelidad perfecta y la relevancia más baja del lote?
Ver pista de ayuda
En `muestras`, mira solo las filas con fidelidad 1.00 y compara su columna `relevancia`. La nota de la tabla explica qué pasó.
El borrador concluye que la recuperación está sana porque la media supera el umbral. Con lo que encontraste, la conclusión no se sostiene, y además el lote no mide si el buscador trae todo lo necesario, porque no tiene respuestas de referencia.
Responde para continuar
¿Qué corrección corresponde hacer al borrador del informe?
Ver pista de ayuda
El evaluador hizo bien su trabajo con la ficha que recibió. El problema está en qué se recuperó, en la media y en lo que el lote no mide.
Whoami-Labs Pro
Whoami-Labs Pro utiliza cookies
Utilizamos cookies y almacenamiento local para el funcionamiento del sitio, seguridad de sesión y, si lo autorizas, analítica y marketing. Puedes aceptar, rechazar o personalizar. Política de Privacidad
Preferencias
Configuraciones de cookies
Elige qué categorías permitir. Las esenciales siempre están activas. Consulta la Política de Privacidad.
Esenciales
Siempre activas · sesión, CSRF, tema y esta preferencia
Necesarias para iniciar sesión, proteger formularios (CSRF) y recordar tu elección de cookies y tema. Sin ellas la plataforma no funciona de forma segura.
Analíticos
Hoy no activos en la plataforma; listos para cuando se conecten
Nos ayudan a entender uso de cursos y páginas. Si los activas, se usarán cuando conectemos analítica; hasta entonces no se carga ningún tracker.
Marketing
Hoy no activos; campañas futuras solo con tu permiso
Comunicaciones o campañas. No activos hoy en la plataforma; quedarán listos si los conectamos y solo si los permites.