Evals con LLM como Juez 2026: Domina Ragas, DeepEval y Promptfoo
Usar un LLM como juez ya es la forma estándar de calificar salidas de IA. Aprende Ragas, DeepEval y Promptfoo, y dónde la evaluación automática todavía falla.
Tu chatbot RAG pasó todas las pruebas unitarias y aun así envió a producción una política de reembolso inventada. Te enteraste porque un cliente lo capturó en pantalla, no porque tu CI lo detectara. Agregaste un juez basado en un modelo tipo GPT-4, lo viste dar 4.7/5 a respuestas que tu propio equipo llamó basura, y dejaste de confiar en ese número. El problema no es el modelo: es que nunca calibraste al juez contra humanos. Esta guía es para desarrolladores e ingenieros de ML que ya lanzan funciones con LLM y ahora necesitan una capa de evaluación que puedan...