View a markdown version of this page

Führen Sie eine Batch-LLM-Inferenz mit vLLM in Deadline Cloud aus - Deadline Cloud

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Führen Sie eine Batch-LLM-Inferenz mit vLLM in Deadline Cloud aus

Das vllm_batch-Job-Paket auf GitHub führt mithilfe von vLLM eine LLM-Inferenz (Large Language Model) mit hohem Durchsatz für eine JSONL-Datei mit Eingabeaufforderungen durch. Der Job verteilt sich über eine GPU-Flotte, jede Aufforderung erhält eine LLM-Antwort, und in einem Aggregatschritt wird alles in einer JSONL-Datei und einem eigenständigen HTML-Viewer zusammengefasst. Das Paket bewältigt peinlich parallele Offline-Workloads wie Inhaltsgenerierung, Bewertungsdatensätze, Übersetzung, Extraktion und Klassifizierung.

Das Paket verwendet die Deadline Cloud-Funktion zum Aufteilen von Aufgaben, um Eingabeaufforderungen in Batch-Aufgaben zu gruppieren, und eine Schrittumgebung zum Öffnen der Stellenbeschreibung, um das Modell einmal pro Mitarbeiter statt einmal pro Aufgabe zu laden. Weitere Informationen finden Sie unter Aufgabenteilung für Jobvorlagen.

Um dieses Paket ausführen zu können, benötigen Sie eine vom Service verwaltete Flotte mit NVIDIA-GPUs und mindestens 32 GB RAM sowie eine Warteschlange mit einer Conda-Warteschlangenumgebung, die Lese- und Jobparameter liest. CondaPackages CondaChannels Senden Sie den Job aus dem job_bundles Verzeichnis des Beispiel-Repositorys ab:

deadline bundle gui-submit vllm_batch

Sie können die Ausgabe im Generieren Sie Bilder stapelweise mit einem Diffusionsmodell in Deadline Cloud Paket zusammenfassen, um generierten Text in Bilder mit Untertiteln umzuwandeln.

Eine vollständige Anleitung zur Einrichtung der Farm, zum Eingabeformat, zur Größe von Blöcken und zum Anzeigen der Ergebnisse finden Sie unter. Führen Sie eine Batch-LLM-Inferenz mit vLLM aus