Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Esegui l'inferenza LLM in batch con vLLM su Deadline Cloud
Il job bundle vllm_batch su GitHub
Il pacchetto utilizza la funzionalità di suddivisione delle attività di Deadline Cloud per raggruppare i prompt in attività in batch e un ambiente di fasi Open Job Description per caricare il modello una volta per lavoratore anziché una volta per attività. Per ulteriori informazioni, consulta Suddivisione delle attività per i modelli di lavoro.
Per eseguire questo pacchetto, è necessaria una flotta gestita dai servizi con GPU NVIDIA e almeno 32 GB di RAM e una coda con un ambiente di coda conda in grado di leggere i parametri dei processi. CondaPackages CondaChannels Dalla directory del repository degli esempi, invia il lavoro: job_bundles
deadline bundle gui-submit vllm_batch
Puoi concatenare l'output nel Genera immagini in batch con un modello di diffusione su Deadline Cloud pacchetto per trasformare il testo generato in immagini con didascalie.
Per una procedura dettagliata che include la configurazione della farm, il formato di input, il dimensionamento dei blocchi e la visualizzazione dei risultati, consulta. Esegui l'inferenza LLM in batch con vLLM