Supongamos que un asistente clasifica correos de atención al cliente. En una demo acierta con un reclamo claro. Luego llega uno que mezcla una devolución con una consulta sobre el envío: el asistente elige una sola categoría y el mensaje termina en el equipo equivocado. Unas pocas pruebas manuales no muestran con qué frecuencia ocurre.
Evaluar la solución implica acordar qué resultado se espera, probarla con una muestra representativa y volver a medirla cuando cambian el modelo, las instrucciones o los datos.
Definir qué significa "funciona bien"
Antes de medir hay que acordar qué se mide. Conviene separar tres niveles:
- Calidad de la respuesta: ¿es correcta, completa, está basada en la información disponible y tiene el tono adecuado?
- Comportamiento esperado: ¿deriva a una persona cuando corresponde, se niega a responder lo que está fuera de su alcance, respeta las reglas de negocio?
- Impacto en el negocio: ¿reduce tiempos, resuelve consultas, disminuye errores o mejora la experiencia de los usuarios?
Los dos primeros se pueden medir antes de salir a producción. El tercero se confirma en la operación real, pero conviene definirlo desde el inicio para saber qué observar.
Armar un conjunto de evaluación
La herramienta más útil para evaluar una solución de IA es un conjunto de casos de prueba representativo, construido a partir de situaciones reales:
- Casos frecuentes: las consultas o documentos que representan la mayor parte del volumen.
- Casos difíciles: preguntas ambiguas, documentos incompletos, información contradictoria.
- Casos fuera de alcance: lo que la solución no debería responder o debería derivar.
- Casos sensibles: situaciones donde un error tiene consecuencias importantes, como temas de salud, dinero o datos personales.
Para cada caso se define qué se espera: la respuesta correcta, los datos que debería incluir, la acción que debería tomar o el criterio con el que se va a juzgar. Este conjunto se construye junto con las personas que conocen el proceso, porque son quienes saben qué es una buena respuesta.
Para el asistente de correos, cada caso puede incluir el mensaje original, la categoría correcta, si requiere revisión humana y el motivo. La muestra debería contener tanto consultas corrientes como reclamos mezclados, incompletos o urgentes. Así se puede ver en qué situaciones falla, además de calcular un promedio.
Cómo calificar los resultados
Según el tipo de solución, se combinan distintas formas de evaluación:
- Comparación automática: cuando la respuesta tiene un valor esperado concreto, como una categoría, un dato extraído o una acción a ejecutar, se puede medir el porcentaje de aciertos de forma directa.
- Revisión con criterios definidos: para respuestas abiertas, personas expertas califican cada resultado con una guía clara (correcta, parcialmente correcta, incorrecta, riesgosa) para que la evaluación sea consistente.
- Evaluación asistida por modelos: otro modelo de IA puede calificar respuestas siguiendo esos mismos criterios, lo que permite evaluar muchos casos rápidamente. Conviene validar periódicamente que sus calificaciones coinciden con las de personas.
Más que un único número, sirve mirar los resultados por tipo de caso: una solución puede tener un 95% de aciertos en general y fallar sistemáticamente en el tipo de consulta más delicado.
Evaluar en cada cambio
El conjunto de evaluación se vuelve especialmente valioso cuando la solución evoluciona. Cada vez que se ajusta un prompt, se incorporan nuevos documentos, se cambia de modelo o se agrega una funcionalidad, se vuelve a correr la evaluación completa. Así se detectan regresiones antes de que lleguen a los usuarios y se puede comparar objetivamente si un cambio mejora o empeora el resultado.
Es el equivalente a las pruebas automatizadas en el software tradicional, y cumple el mismo rol: permitir que el producto cambie sin que cada cambio sea un riesgo.
Medir en producción
Ningún conjunto de prueba cubre todo lo que va a pasar con usuarios reales. Una vez en producción conviene monitorear:
- Señales de los usuarios: valoraciones de respuestas, consultas reformuladas, abandonos o pedidos de hablar con una persona.
- Correcciones humanas: cuando una persona revisa y modifica el resultado, esa corrección es información valiosa para mejorar la solución y ampliar el conjunto de evaluación.
- Muestreo periódico: revisar una muestra de interacciones reales para detectar errores que ninguna métrica automática capta.
- Métricas operativas: tiempos de respuesta, costos por consulta, errores técnicos y disponibilidad de los servicios de IA utilizados.
- Métricas de negocio: las que se definieron al inicio, comparadas con la situación previa.
Errores comunes
- Evaluar probando unas pocas preguntas a mano antes de cada lanzamiento.
- Armar el conjunto de prueba solo con casos fáciles o inventados, en lugar de casos reales.
- Mirar solo el promedio y no los resultados por tipo de caso.
- No volver a evaluar cuando cambia el modelo, el prompt o la información disponible.
- No medir el impacto en el negocio, y no poder responder si la solución justificó la inversión.
Por dónde empezar
- Definir con el área usuaria qué es una buena respuesta y qué error no es aceptable.
- Reunir una primera muestra de casos reales, incluidos los difíciles y sensibles. Su tamaño depende del volumen y de la variedad de situaciones; después se amplía con los errores encontrados.
- Calificarlos con criterios escritos y medir el punto de partida.
- Correr la evaluación ante cada cambio relevante.
- Sumar al conjunto los errores que aparezcan en producción.
Evaluar bien es también parte de responder la pregunta inicial de si un problema necesita IA: si no se puede definir cómo medir el éxito, probablemente todavía no está claro qué se quiere resolver.
En el ejemplo de atención al cliente, la pregunta final es concreta: ¿el asistente ayuda a distribuir mejor los mensajes sin dejar reclamos delicados en el equipo equivocado? El porcentaje total de aciertos, por sí solo, no alcanza para responderla.