Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Exécuter une inférence LLM par lots avec vLLM sur Deadline Cloud
Le bundle de tâches vllm_batch GitHub
Le bundle utilise la fonction de découpage des tâches de Deadline Cloud pour regrouper les invites en tâches groupées, et un environnement d'étapes Open Job Description pour charger le modèle une fois par collaborateur au lieu d'une fois par tâche. Pour de plus amples informations, veuillez consulter Découpage des tâches pour les modèles de tâches.
Pour exécuter ce bundle, vous avez besoin d'un parc géré par des services avec des GPU NVIDIA et au moins 32 Go de RAM, ainsi que d'une file d'attente avec un environnement de file d'attente conda qui lit CondaPackages les paramètres et les tâches. CondaChannels Depuis le job_bundles répertoire du référentiel d'échantillons, soumettez la tâche :
deadline bundle gui-submit vllm_batch
Vous pouvez enchaîner la sortie dans le Générez des images par lots avec un modèle de diffusion sur Deadline Cloud bundle pour transformer le texte généré en images légendées.
Pour une procédure pas à pas complète qui couvre la configuration de la ferme, le format d'entrée, la taille des morceaux et l'affichage des résultats, voir. Exécuter une inférence LLM par lots avec vLLM