Los modelos open-weight como Qwen3 y Llama 3.3 salen más rápido de lo que alcanzas a evaluarlos, pero el consejo de “solo hazle fine-tuning” asume una A100 rentada que no vas a pagar por un proyecto personal. Mientras tanto, la T4 gratuita de Colab que sí tienes lanza errores de memoria (OOM) en cuanto cargas un modelo de 7B, la mitad de los notebooks de 2024 ya no funcionan con las versiones actuales de Unsloth y transformers, y no sabes si tu curva de pérdida significa “convergiendo” o “memorizando”. Esta guía es para quien quiere un adapter funcional este fin de semana, no un presupuesto de investigación.
Está dirigida a desarrolladores cómodos con Python, pip y un notebook de Colab o Jupyter que quieren entrenar LLMs open-weight sin pagar por GPUs ni por una API de entrenamiento. Asumimos que sabes leer un stack trace y editar un diccionario de configuración; no asumimos experiencia previa en investigación de ML ni conocimientos de CUDA o matemáticas avanzadas.
Lo Que Cubre Esta Guía
- Por qué 2026 es el momento de entrenar open-weights en lugar de rentar una API, y cuándo el fine-tuning no es la herramienta correcta.
- Cómo Unsloth ahorra memoria y tiempo de verdad, con la historia real de sus kernels y su velocidad.
- Una configuración limpia en Colab gratis que instala el stack actual de Unsloth y sobrevive a los cambios de versión.
- Cómo cargar Qwen3 y Llama 3.3 en 4-bit para que modelos grandes entren donde normalmente dan OOM.
- Fundamentos de LoRA y QLoRA: rank, alpha y target modules explicados con valores por defecto sensatos.
- Cómo construir datasets de instrucciones en formatos ShareGPT y Alpaca, y detectar datos que arruinarán el entrenamiento.
- Cómo configurar el trainer: hiperparámetros, chat templates y packing acordes a tu modelo.
- La matemática de VRAM para que una corrida entre en una T4 de 16GB antes de chocar con el límite.
- Cómo leer la curva de pérdida para distinguir convergencia real de memorización.
- Cómo evaluar tu fine-tune y aplicar soluciones concretas cuando hace overfitting.
- Cómo exportar a GGUF para inferencia local con Ollama y llama.cpp.
- Cómo publicar en Hugging Face: adapters versus pesos fusionados, y cuándo usar cada uno.











Reviews
There are no reviews yet.