Tu chatbot RAG pasó todas las pruebas unitarias y aun así envió a producción una política de reembolso inventada. Te enteraste porque un cliente lo capturó en pantalla, no porque tu CI lo detectara. Agregaste un juez basado en un modelo tipo GPT-4, lo viste dar 4.7/5 a respuestas que tu propio equipo llamó basura, y dejaste de confiar en ese número. El problema no es el modelo: es que nunca calibraste al juez contra humanos. Esta guía es para desarrolladores e ingenieros de ML que ya lanzan funciones con LLM y ahora necesitan una capa de evaluación que puedan defender en una revisión técnica. Deberías sentirte cómodo con Python, pytest, YAML y pipelines de CI, y tener al menos un sistema en producción o cerca de estarlo. No es una introducción al prompting ni una comparación de proveedores: aquí construyes harnesses funcionales en Ragas, DeepEval y Promptfoo, entiendes dónde un juez automático supera a un humano y dónde falla en silencio, y aprendes a validar cada score antes de confiar en él.
Lo Que Cubre Esta Guía
- Cuándo un LLM como juez supera a evaluadores humanos en 2026 y cuándo falla en silencio.
- Cómo elegir entre scoring puntual, comparación por pares y evaluación basada en referencia.
- Diseño de rúbricas y prompts de scoring que correlacionan con el juicio humano, no con la verbosidad.
- Un workflow de calibración repetible con Cohen’s kappa y estadísticas de acuerdo entre evaluadores.
- Mitigaciones concretas para los tres sesgos que arruinan al juez: posición, verbosidad y autopreferencia.
- Cómo construir un golden dataset minando trazas reales de producción y cuándo los casos sintéticos ayudan o estorban.
- Cómo dimensionar tu set de evaluación para tener poder estadístico real y distinguir regresión de ruido.
- Ragas de principio a fin: faithfulness, context precision, context recall y answer relevancy.
- DeepEval a fondo: G-Eval, métricas basadas en DAG y aserciones estilo pytest que rompen el build.
- Evals adversariales y de red-team para seguridad y resistencia a jailbreaks, con resultados reproducibles.
- Promptfoo con configs en YAML, matrices de comparación de modelos y CI gates que bloquean un mal merge.
- Selección del modelo juez e ingeniería de costos para obtener scores defendibles sin una factura enorme.
- Un proyecto completo: un harness de evaluación RAG desde cero hasta un scorecard que bloquea el CI.
- Monitoreo de drift en producción y los antipatrones que hacen podrir tus suites de evaluación.
Acceso en línea inmediato al completar la compra: la guía completa está disponible al instante, sin esperas ni correos por goteo.











Reviews
There are no reviews yet.