View a markdown version of this page

Exécuter une inférence LLM par lots avec vLLM sur Deadline Cloud - Deadline Cloud

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Exécuter une inférence LLM par lots avec vLLM sur Deadline Cloud

Le bundle de tâches vllm_batch GitHub exécute l'inférence par modèle de langage large (LLM) à haut débit sur un fichier JSONL d'invites à l'aide de vLLM. La tâche se répartit sur un parc de GPU, chaque invite reçoit une réponse LLM et une étape globale regroupe le tout dans un fichier JSONL plus une visionneuse HTML autonome. Le bundle gère des charges de travail hors ligne et parallèles embarrassantes, telles que la génération de contenu, les ensembles de données d'évaluation, la traduction, l'extraction et la classification.

Le bundle utilise la fonction de découpage des tâches de Deadline Cloud pour regrouper les invites en tâches groupées, et un environnement d'étapes Open Job Description pour charger le modèle une fois par collaborateur au lieu d'une fois par tâche. Pour de plus amples informations, veuillez consulter Découpage des tâches pour les modèles de tâches.

Pour exécuter ce bundle, vous avez besoin d'un parc géré par des services avec des GPU NVIDIA et au moins 32 Go de RAM, ainsi que d'une file d'attente avec un environnement de file d'attente conda qui lit CondaPackages les paramètres et les tâches. CondaChannels Depuis le job_bundles répertoire du référentiel d'échantillons, soumettez la tâche :

deadline bundle gui-submit vllm_batch

Vous pouvez enchaîner la sortie dans le Générez des images par lots avec un modèle de diffusion sur Deadline Cloud bundle pour transformer le texte généré en images légendées.

Pour une procédure pas à pas complète qui couvre la configuration de la ferme, le format d'entrée, la taille des morceaux et l'affichage des résultats, voir. Exécuter une inférence LLM par lots avec vLLM