Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Importante
Questa funzionalità è in Anteprima Pubblica.
Questi notebook eseguono l'inferenza e il fine-tuning di modelli linguistici di grandi dimensioni (LLM) su AI Runtime. Coprono l'inferenza batch con Ray Data e vLLM, metodi efficienti dal punto di vista parametrico come Low-Rank Adaptation (LoRA) e il fine-tuning supervisionato completo tra librerie tra cui TRL, Unsloth, Axolotl e LLM Foundry.
| Tutoriale | Descrizione |
|---|---|
| Inferenza in batch con Qwen2.5-32B, Ray Data e vLLM | Esegui inferenza batch multilingue con otto repliche vLLM persistenti di Qwen2.5-32B-Instruct su 8 GPU H100 e salva i risultati nel Catalogo Unity. |
| Ottimizzare il modello Qwen3-4B | Eseguire il fine-tuning completo dei pesi del modello Qwen3-4B su una singola GPU H100 utilizzando Transformer Reinforcement Learning (TRL), con precisione mista BF16 e checkpointing del gradiente per un addestramento efficiente in termini di memoria. |
| Ottimizzare Llama-3.2-3B con Unsloth | Ottimizzare Llama-3.2-3B usando la libreria Unsloth. |
| Perfezionare GPT-OSS 20B | Ottimizzare il modello openAI gpt-oss-20b su 8 GPU H100 usando il parallelismo dei dati distribuito e LoRA per ottimizzare in modo efficiente i parametri. |
| Ottimizzazione con supervisione con DeepSpeed e TRL | Usare l'API Python gpu serverless per eseguire l'ottimizzazione con supervisione (SFT) usando la libreria TRL (Transformer Reinforcement Learning) con l'ottimizzazione DeepSpeed ZeRO Stage 3. |
| Ottimizzazione di LoRA con Axolotl | Usa l'API Python Serverless GPU per eseguire il fine-tuning LoRA di un modello Olmo3 7B con la libreria Axolotl. |
| Ottimizzazione distribuita di Qwen2-0.5B | Ottimizzare il modello Qwen2-0.5B utilizzando i Kernel LoRA e Liger per un training distribuito efficiente dal punto di vista della memoria con riduzione dei parametri. |
| Distribuzione e ottimizzazione fine di Llama-3.2-3B con Unsloth | Affinare Llama-3.2-3B usando l'addestramento distribuito su più GPU con la libreria Unsloth per un addestramento ottimizzato nell'efficienza dei parametri. |
| Ottimizzare Llama 3.1 8B con LLM Foundry | Ottimizzare il modello Llama 3.1 8B usando Mosaic LLM Foundry con strategie di training distribuite e valutazione del modello. |
| Ottimizzare GPT-OSS 120B con DDP e FSDP | Ottimizzare il modello GPT-OSS 120B di OpenAI usando l'ottimizzazione con supervisione su GPU H100 con strategie di training distribuite DDP e FSDP. |
| Training distribuito con PyTorch FSDP | Eseguire il training dei modelli Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) per partizionare i parametri del modello tra più GPU. |
Video dimostrativo
Questo video illustra in dettaglio il notebook di esempio Ottimizzare Llama-3.2-3B con Unsloth (12 minuti).