Inferencia por lotes

Importante

Esta característica está en versión preliminar pública.

Estos notebooks permiten ejecutar inferencia por lotes a gran escala en GPU serverless de AI Runtime. Cubren una variedad de modalidades, como la generación de texto en LLM y la conversión de voz a texto, utilizando frameworks como Ray Data, vLLM y Transformers.

Tutorial Description
Inferencia por lotes Qwen2.5-32B con Ray Data y vLLM Ejecuta inferencia por lotes multilingüe con ocho réplicas vLLM persistentes de Qwen2.5-32B-Instruct en 8 GPUs H100 y guarda los resultados en el Catálogo de Unity.
Conversión de voz a texto por lotes con Whisper Transcriba audio por lotes con OpenAI Whisper large-v3-turbo en GPU sin servidor, utilizando bibliotecas preinstaladas en AI Runtime.