Tu archivo de prompts tiene cientos de líneas de trucos acumulados que nadie recuerda por qué siguen ahí: un “piensa paso a paso”, un esquema JSON pegado en el mensaje del sistema y siete ejemplos few-shot que quizás ni sirven. Entonces sale un modelo nuevo, cambias de Claude a Gemini para bajar costos, y toda esa afinación manual se derrumba sobre tu conjunto de evaluación. En 2026 los modelos cambian más rápido de lo que cualquier persona puede reajustar, y el “prompt engineering” hecho a mano se volvió la parte menos confiable de tu stack.
Esta guía práctica es para desarrolladores que llevan funciones con LLM a producción y están cansados de adivinar. Deberías sentirte cómodo con Python, virtualenvs, API keys y leer un stack trace, y tener al menos una llamada a un LLM funcionando en algún repositorio. No es una introducción a qué es un modelo de lenguaje ni una lista de trucos de prompts: DSPy es un compilador, y aquí lo tratamos como tal. Aprenderás a describir tu tarea una sola vez y dejar que los optimizadores busquen la mejor formulación contra un número real, no contra una corazonada. También verás dónde el juicio humano es innegociable: definir la métrica correcta, cuidar el conjunto de validación y revisar el artefacto final antes de que llegue a producción.
Lo Que Cubre Esta Guía
- Por qué los prompts ajustados a mano se degradan en cada actualización de modelo y qué ahorras al compilarlos
- Instalación limpia y configuración multi-proveedor para alternar entre Claude, GPT-5.x y Gemini sin reescribir módulos
- Declarar la intención con signatures: describir la tarea una vez en lugar de vigilar la redacción para siempre
- Recorrido por la librería de módulos: predicción simple, razonamiento, uso de herramientas y auto-refinamiento
- Cómo construir métricas que midan ingresos y correctitud reales, evitando las trampas que las vuelven inútiles
- Armar un harness de evaluación honesto y un dataset pequeño pero confiable, listo en una tarde
- La escalera de optimizadores: cuál usar primero, cuándo subir y cómo saber que llegaste al límite
- Evolución reflexiva de prompts para los problemas que el bootstrapping few-shot no logra resolver
- Un pipeline de retrieval compilado de extremo a extremo, listo para llevar a tu propio código
- Un agente de tool-calling completo y un juez LLM optimizado que deja de contradecirse
- Destilar un pipeline compilado a un modelo abierto pequeño: la mayor palanca de costos que casi nadie usa
- Economía de producción: caché, gasto de tokens, latencia y disciplina de despliegue con CI y artefactos versionados











Reviews
There are no reviews yet.