Evaluación de LLMs 2026: Promptfoo, Braintrust y Gates de Regresión
Los evals de LLM son las nuevas pruebas unitarias. Esta guía 2026 compara Promptfoo y Braintrust y te enseña a montar gates de regresión que detectan el model drift antes de que llegue a producción.
Ajustaste un prompt, pasó tres revisiones manuales y se veía mejor… hasta que un cliente reportó que una función clave se rompió justo en los casos límite que nunca volviste a probar. En 2026, "funcionó cuando lo probé" es la forma más rápida de que tus funciones de LLM se degraden en producción: salidas no deterministas, modelos que se deprecian en silencio, pipelines de RAG que empiezan a alucinar tras actualizar la base de conocimiento y agentes que pierden el rumbo en tareas de varios pasos. Ninguno de esos problemas lo ven tus pruebas unitarias actuales. Sin un verdadero eval...