Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Führen Sie eine Batch-LLM-Inferenz mit vLLM in Deadline Cloud aus
Das vllm_batch-Job-Paket auf GitHub
Das Paket verwendet die Deadline Cloud-Funktion zum Aufteilen von Aufgaben, um Eingabeaufforderungen in Batch-Aufgaben zu gruppieren, und eine Schrittumgebung zum Öffnen der Stellenbeschreibung, um das Modell einmal pro Mitarbeiter statt einmal pro Aufgabe zu laden. Weitere Informationen finden Sie unter Aufgabenteilung für Jobvorlagen.
Um dieses Paket ausführen zu können, benötigen Sie eine vom Service verwaltete Flotte mit NVIDIA-GPUs und mindestens 32 GB RAM sowie eine Warteschlange mit einer Conda-Warteschlangenumgebung, die Lese- und Jobparameter liest. CondaPackages CondaChannels Senden Sie den Job aus dem job_bundles Verzeichnis des Beispiel-Repositorys ab:
deadline bundle gui-submit vllm_batch
Sie können die Ausgabe im Generieren Sie Bilder stapelweise mit einem Diffusionsmodell in Deadline Cloud Paket zusammenfassen, um generierten Text in Bilder mit Untertiteln umzuwandeln.
Eine vollständige Anleitung zur Einrichtung der Farm, zum Eingabeformat, zur Größe von Blöcken und zum Anzeigen der Ergebnisse finden Sie unter. Führen Sie eine Batch-LLM-Inferenz mit vLLM aus