Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Importante
Esta característica está en versión preliminar pública.
Estos cuadernos ajustan y entrenan modelos de lenguaje grandes (LLMs) en tiempo de ejecución de IA. Abarcan métodos de ajuste eficientes en parámetros, como la adaptación de bajo rango (LoRA), y el ajuste supervisado completo en bibliotecas como TRL, Unsloth, Axolotl y LLM Foundry. Para ejemplos de inferencia por lotes, véase Inferencia por lotes.
| Tutorial | Descripción |
|---|---|
| Aprendizaje por refuerzo de Gemma4-2B | Posentrena Gemma4-2B con Optimización de Política Relativa de Grupo (GRPO) y adaptación de rango bajo (LoRA) en una única GPU H100 usando Unsloth. |
| Ajuste fino supervisado (completo) de Qwen3-4B | Qwen3-4B a peso completo en una sola GPU H100 con TRL, usando precisión mixta BF16 y puntos de control de gradiente. |
| Ajuste fino supervisado (LoRA) de Llama-3.2-3B | LoRA ajusta finamente Llama-3.2-3B en una sola GPU con la biblioteca Unsloth. |
| Ajuste fino supervisado (LoRA) de GPT-OSS 20B | LoRA ajustó GPT-OSS 20B en 8 GPUs H100 con TRL y paralelismo de datos distribuidos. |
| Ajuste fino supervisado (completo) de Llama-3.2-1B | Afinación completa de Llama-3.2-1B en 8 GPUs H100 con TRL y DeepSpeed ZeRO Stage 3. |
| Ajuste fino supervisado (LoRA) de Olmo3 7B | LoRA ajusta finamente Olmo3 7B en varias GPUs con la biblioteca Axolotl. |
| Ajuste fino supervisado (completo) y despliegue de Qwen3.5-0.8B | Ajusta Qwen3.5-0.8B en una sola GPU H100 con TRL y, a continuación, publícalo detrás de un endpoint de servicio de modelos de vLLM. |
| Ajuste fino supervisado de Llama-3.2-3B en varias GPU | LoRA ajusta finamente Llama-3.2-3B en varias GPUs con la biblioteca Unsloth. |
| Ajuste fino supervisado (LoRA) de GPT-OSS 120B | LoRA ajusta GPT-OSS 120B en 8 GPUs H100 con TRL, usando DDP y FSDP. |
| Entrenamiento de transformadores con varias GPU | Entrenar modelos de Transformer utilizando el método Fully Sharded Data Parallel (FSDP) de PyTorch para distribuir los parámetros del modelo entre varias GPU. |
Demostración de vídeo
Este vídeo recorre en detalle el Ajuste Fino Supervisado (LoRA) del cuaderno de ejemplo Llama-3.2-3B (12 minutos).