Guide utente per il runtime di intelligenza artificiale

Importante

Questa funzionalità è in Anteprima Pubblica.

Monitora l'uso e i costi della GPU con la tabella del sistema di utilizzo fatturabile, trova esempi di notebook e risolvi errori comuni.

Migrazione da Slurm

Se proveni da un cluster Slurm piuttosto che da Databricks classici, consulta Migrate from Slurm per vedere come sbatch, srun/torchrun, partizioni e filesystem condivisi si mappano sulla CLI di Databricks.

Tenere traccia dell'utilizzo e dei costi

È possibile monitorare la spesa della GPU del runtime di intelligenza artificiale eseguendo una query sulla tabella del sistema di utilizzo fatturabile (system.billing.usage). La query seguente restituisce l'utilizzo totale per i carichi di lavoro GPU serverless:

SELECT
  SUM(usage_quantity)
FROM
  system.billing.usage
WHERE
  product_features.serverless_gpu IS NOT NULL

Per altre informazioni sullo schema della tabella di utilizzo fatturabile, vedere Informazioni di riferimento sulla tabella di sistema di utilizzo fatturabile.

Il runtime di intelligenza artificiale viene addebitato per ora di GPU sullo SKU di training del modello ai seguenti prezzi:

  • H100 su richiesta: $ 7,00/ora GPU (Stati Uniti orientali)
  • A10 su richiesta: $ 4,90/ORA GPU (Stati Uniti orientali)

Notebook di esempio

Per iniziare, sono disponibili le categorie di notebook di esempio seguenti:

Categoria Description
Modelli di linguaggio di grandi dimensioni Ottimizzazione di modelli linguistici di grandi dimensioni, inclusi metodi efficienti per i parametri (LoRA, QLoRA)
Visione artificiale Rilevamento degli oggetti, classificazione delle immagini e altre attività di visione artificiale
Sistemi di raccomandazione di Deep Learning Creazione di sistemi di raccomandazione con approcci di Deep Learning moderni, ad esempio modelli a due torre
ML classico Attività di Machine Learning tradizionali, tra cui il training del modello XGBoost e la previsione delle serie temporali
Addestramento distribuito su GPU multiple Ridimensionamento della formazione su più GPU con l'API GPU senza server

Per l'elenco completo, vedere Notebook di esempio dell'ambiente di esecuzione IA.

Risoluzione dei problemi

Genie Code può aiutare a risolvere problemi di ambiente e dipendenze e a indagare sui fallimenti di GPU e carichi di lavoro distribuiti nei notebook collegati all'AI Runtime. Vedi Usa il codice Genie con il runtime di IA.

Per fare il debug interattivo sul calcolo, usa il terminale web per eseguire comandi shell, ispezionare l'uso della GPU con nvidia-smi, e gestire i file. Il terminale web è disponibile quando è collegato all'ambiente GPU serverless versione 5 o superiore. Vedere Eseguire i comandi della shell nel terminale Web di Azure Databricks.

ValueError: dimensione numpy.dtype modificata, può indicare incompatibilità binaria. Previsto 96 dall'intestazione C, ottenuto 88 da PyObject

L'errore si verifica in genere quando si verifica una mancata corrispondenza nelle versioni di NumPy usate durante la compilazione di un pacchetto dipendente e la versione di NumPy attualmente installata nell'ambiente di runtime. Questa incompatibilità si verifica spesso a causa di modifiche nell'API C di NumPy ed è particolarmente evidente da NumPy 1.x a 2.x. Questo errore indica che il pacchetto Python installato nel notebook potrebbe aver modificato la versione di NumPy.

Soluzione consigliata:

Controllare la versione di NumPy nel runtime e assicurarsi che sia compatibile con i pacchetti. Per informazioni sulle librerie Python preinstallate, vedere le note di rilascio del calcolo della GPU serverless, per l'ambiente 4 e l'ambiente 3. Se si ha una dipendenza da una versione diversa di NumPy, aggiungere tale dipendenza all'ambiente di calcolo.

PyTorch non riesce a trovare libcudnn durante l'installazione di torch

Quando si installa una versione diversa di torch, è possibile che venga visualizzato l'errore : ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory. Ciò è dovuto al fatto che torch cerca la libreria cuDNN solo nel percorso locale.

Soluzione consigliata:

Reinstallare le dipendenze aggiungendo --force-reinstall durante l'installazione di torch:

%pip install torch --force-reinstall