View a markdown version of this page

Ejecute la inferencia de LLM por lotes con vLLM en Deadline Cloud - Deadline Cloud

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Ejecute la inferencia de LLM por lotes con vLLM en Deadline Cloud

El paquete de trabajos vllm_batch on GitHub ejecuta inferencias del modelo de lenguaje grande (LLM) de alto rendimiento en un archivo JSONL de solicitudes mediante vLLM. El trabajo se distribuye en una flota de GPU, cada solicitud recibe una respuesta de LLM y un paso agregado empaqueta todo en un archivo JSONL además de un visor HTML independiente. El paquete gestiona cargas de trabajo sin conexión y embarazosamente paralelas, como la generación de contenido, los conjuntos de datos de evaluación, la traducción, la extracción y la clasificación.

El paquete utiliza la función de fragmentación de tareas de Deadline Cloud para agrupar las solicitudes en tareas por lotes, y un entorno de pasos de Open Job Description para cargar el modelo una vez por trabajador en lugar de una vez por tarea. Para obtener más información, consulte Fragmentación de tareas para plantillas de trabajo.

Para ejecutar este paquete, necesita una flota gestionada por servicios con GPU NVIDIA y al menos 32 GB de RAM, y una cola con un entorno de cola conda que lea los parámetros de trabajo. CondaPackages CondaChannels Desde el job_bundles directorio del repositorio de muestras, envía el trabajo:

deadline bundle gui-submit vllm_batch

Puede encadenar la salida al Genere imágenes por lotes con un modelo de difusión en Deadline Cloud paquete para convertir el texto generado en imágenes con subtítulos.

Para ver un tutorial completo sobre la configuración de la granja, el formato de entrada, el tamaño de los fragmentos y la visualización de los resultados, consulte. Ejecute la inferencia de LLM por lotes con vLLM