

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

# Execute inferência de LLM em lote com vLLM no Deadline Cloud
<a name="examples-jb-vllm-batch"></a>

O pacote de tarefas [ vllm\_batch on GitHub ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_batch) executa inferência de modelo de linguagem grande (LLM) de alto rendimento em um arquivo JSONL de solicitações usando vLLM. O trabalho se espalha por uma frota de GPU, cada solicitação recebe uma resposta LLM e uma etapa agregada empacota tudo em um arquivo JSONL, além de um visualizador de HTML independente. O pacote lida com cargas de trabalho off-line e embaraçosamente paralelas, como geração de conteúdo, conjuntos de dados de avaliação, tradução, extração e classificação.

O pacote usa o recurso de fragmentação de tarefas do Deadline Cloud para agrupar solicitações em tarefas em lote e um ambiente de etapas Open Job Description para carregar o modelo uma vez por trabalhador em vez de uma vez por tarefa. Para obter mais informações, consulte [Divisão de tarefas para modelos de trabalho](build-job-bundle-chunking.md).

Para executar esse pacote, você precisa de uma frota gerenciada por serviços com GPUs NVIDIA e pelo menos 32 GB de RAM, além de uma fila com um ambiente de fila conda que leia e apresente parâmetros de trabalho. `CondaPackages` `CondaChannels` No `job_bundles` diretório do repositório de amostras, envie o trabalho:

```
deadline bundle gui-submit vllm_batch
```

Você pode encadear a saída no [Gere imagens em lote com um modelo de difusão no Deadline Cloud](examples-jb-text-to-image-batch.md) pacote para transformar o texto gerado em imagens legendadas.

Para obter um passo a passo completo que abrange a configuração da fazenda, o formato de entrada, o tamanho dos pedaços e a visualização dos resultados, consulte. [Execute inferência LLM em lote com vLLM](tutorial-vllm-batch.md)