Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Ejecute la inferencia de LLM por lotes con vLLM en Deadline Cloud
El paquete de trabajos vllm_batch on GitHub
El paquete utiliza la función de fragmentación de tareas de Deadline Cloud para agrupar las solicitudes en tareas por lotes, y un entorno de pasos de Open Job Description para cargar el modelo una vez por trabajador en lugar de una vez por tarea. Para obtener más información, consulte Fragmentación de tareas para plantillas de trabajo.
Para ejecutar este paquete, necesita una flota gestionada por servicios con GPU NVIDIA y al menos 32 GB de RAM, y una cola con un entorno de cola conda que lea los parámetros de trabajo. CondaPackages CondaChannels Desde el job_bundles directorio del repositorio de muestras, envía el trabajo:
deadline bundle gui-submit vllm_batch
Puede encadenar la salida al Genere imágenes por lotes con un modelo de difusión en Deadline Cloud paquete para convertir el texto generado en imágenes con subtítulos.
Para ver un tutorial completo sobre la configuración de la granja, el formato de entrada, el tamaño de los fragmentos y la visualización de los resultados, consulte. Ejecute la inferencia de LLM por lotes con vLLM