Tienes una sola tarjeta de 24GB, un checkpoint de Qwen 3 y un modelo base que sigue alucinando en los casos límite de tu dominio, ignora tus reglas de formato y desperdicia tokens en instrucciones que no deberías necesitar. Los tutoriales que encuentras están a medio funcionar: versiones de CUDA que no coinciden, Unsloth y Axolotl que ya no se llevan bien, cálculos de VRAM que asumen una A100 de 80GB que no tienes, y fusiones de adaptadores que arruinan tus pesos antes de que llegues a producción. Esta guía es para desarrolladores que ya saben escribir Python, usar la terminal y leer un stack trace, pero que nunca han llevado un fine-tune desde un dataset crudo hasta un modelo fusionado y cuantizado en su propia GPU. Aprenderás cuándo el fine-tuning realmente vale la pena frente a un prompt más afinado o RAG, y cómo lograr resultados reproducibles sin hardware exótico. El fine-tuning corrige tono, adherencia al formato y comportamiento de dominio estrecho de forma mucho más económica que un prompt gigante, pero la revisión humana en el etiquetado de datos y la evaluación final sigue siendo innegociable.
Lo Que Cubre Esta Guía
- Cuándo el fine-tuning gana frente a RAG o un prompt más afinado, antes de gastar una GPU-hora.
- LoRA y QLoRA explicados con claridad: qué hacen rank, alpha y los adaptadores en tu VRAM.
- Presupuestos honestos de VRAM para una 3090, 4090 o A100, y qué realmente cabe sin OOM silencioso.
- Un entorno reproducible donde CUDA, PyTorch, Unsloth y Axolotl conviven sin conflictos de versiones.
- Preparación de datasets que entrenan limpio: formato ShareGPT y ChatML, con splits que no filtran.
- Elección de hiperparámetros con intención: rank, alpha, learning rate y target modules.
- Entrenamiento rápido en una sola GPU con Unsloth, ajustado para casi el doble de throughput.
- Ejecuciones basadas en configuración con Axolotl que puedes versionar, comparar y repetir meses después.
- Lectura de tus loss curves para detectar overfitting temprano, no después de publicar.
- Fusión segura de adaptadores y cuantización a GGUF y 4-bit para un despliegue real.
- Evaluación antes de publicar, con pruebas que atrapan regresiones que una métrica esconde.
- Cálculo de costos de GPU en la nube con RunPod y Vast.ai para saber cuándo alquilar conviene.











Reviews
There are no reviews yet.