Modelos de lenguaje grande (LLM)

Importante

Esta característica está en versión preliminar pública.

Estos cuadernos ajustan y entrenan modelos de lenguaje grandes (LLMs) en tiempo de ejecución de IA. Abarcan métodos de ajuste eficientes en parámetros, como la adaptación de bajo rango (LoRA), y el ajuste supervisado completo en bibliotecas como TRL, Unsloth, Axolotl y LLM Foundry. Para ejemplos de inferencia por lotes, véase Inferencia por lotes.

Tutorial Descripción
Aprendizaje por refuerzo de Gemma4-2B Posentrena Gemma4-2B con Optimización de Política Relativa de Grupo (GRPO) y adaptación de rango bajo (LoRA) en una única GPU H100 usando Unsloth.
Ajuste fino supervisado (completo) de Qwen3-4B Qwen3-4B a peso completo en una sola GPU H100 con TRL, usando precisión mixta BF16 y puntos de control de gradiente.
Ajuste fino supervisado (LoRA) de Llama-3.2-3B LoRA ajusta finamente Llama-3.2-3B en una sola GPU con la biblioteca Unsloth.
Ajuste fino supervisado (LoRA) de GPT-OSS 20B LoRA ajustó GPT-OSS 20B en 8 GPUs H100 con TRL y paralelismo de datos distribuidos.
Ajuste fino supervisado (completo) de Llama-3.2-1B Afinación completa de Llama-3.2-1B en 8 GPUs H100 con TRL y DeepSpeed ZeRO Stage 3.
Ajuste fino supervisado (LoRA) de Olmo3 7B LoRA ajusta finamente Olmo3 7B en varias GPUs con la biblioteca Axolotl.
Ajuste fino supervisado (completo) y despliegue de Qwen3.5-0.8B Ajusta Qwen3.5-0.8B en una sola GPU H100 con TRL y, a continuación, publícalo detrás de un endpoint de servicio de modelos de vLLM.
Ajuste fino supervisado de Llama-3.2-3B en varias GPU LoRA ajusta finamente Llama-3.2-3B en varias GPUs con la biblioteca Unsloth.
Ajuste fino supervisado (LoRA) de GPT-OSS 120B LoRA ajusta GPT-OSS 120B en 8 GPUs H100 con TRL, usando DDP y FSDP.
Entrenamiento de transformadores con varias GPU Entrenar modelos de Transformer utilizando el método Fully Sharded Data Parallel (FSDP) de PyTorch para distribuir los parámetros del modelo entre varias GPU.

Demostración de vídeo

Este vídeo recorre en detalle el Ajuste Fino Supervisado (LoRA) del cuaderno de ejemplo Llama-3.2-3B (12 minutos).