

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Esegui l'inferenza LLM in batch con vLLM su Deadline Cloud
<a name="examples-jb-vllm-batch"></a>

Il job bundle [ vllm\_batch su GitHub ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_batch) esegue l'inferenza LLM (Large Language Model) ad alto rendimento su un file JSONL di prompt utilizzando vLLM. Il processo si svolge su una flotta di GPU, ogni prompt riceve una risposta LLM e un passaggio aggregato racchiude tutto in un file JSONL più un visualizzatore HTML autonomo. Il pacchetto gestisce carichi di lavoro offline e imbarazzantemente paralleli come generazione di contenuti, set di dati di valutazione, traduzione, estrazione e classificazione.

Il pacchetto utilizza la funzionalità di suddivisione delle attività di Deadline Cloud per raggruppare i prompt in attività in batch e un ambiente di fasi Open Job Description per caricare il modello una volta per lavoratore anziché una volta per attività. Per ulteriori informazioni, consulta [Suddivisione delle attività per i modelli di lavoro](build-job-bundle-chunking.md).

Per eseguire questo pacchetto, è necessaria una flotta gestita dai servizi con GPU NVIDIA e almeno 32 GB di RAM e una coda con un ambiente di coda conda in grado di leggere i parametri dei processi. `CondaPackages` `CondaChannels` Dalla directory del repository degli esempi, invia il lavoro: `job_bundles`

```
deadline bundle gui-submit vllm_batch
```

Puoi concatenare l'output nel [Genera immagini in batch con un modello di diffusione su Deadline Cloud](examples-jb-text-to-image-batch.md) pacchetto per trasformare il testo generato in immagini con didascalie.

Per una procedura dettagliata che include la configurazione della farm, il formato di input, il dimensionamento dei blocchi e la visualizzazione dei risultati, consulta. [Esegui l'inferenza LLM in batch con vLLM](tutorial-vllm-batch.md)