Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Importante
Esta característica está en versión preliminar pública.
Estos notebooks permiten ejecutar inferencia por lotes a gran escala en GPU serverless de AI Runtime. Cubren una variedad de modalidades, como la generación de texto en LLM y la conversión de voz a texto, utilizando frameworks como Ray Data, vLLM y Transformers.
| Tutorial | Description |
|---|---|
| Inferencia por lotes Qwen2.5-32B con Ray Data y vLLM | Ejecuta inferencia por lotes multilingüe con ocho réplicas vLLM persistentes de Qwen2.5-32B-Instruct en 8 GPUs H100 y guarda los resultados en el Catálogo de Unity. |
| Conversión de voz a texto por lotes con Whisper | Transcriba audio por lotes con OpenAI Whisper large-v3-turbo en GPU sin servidor, utilizando bibliotecas preinstaladas en AI Runtime. |