View a markdown version of this page

Execute inferência de LLM em lote com vLLM no Deadline Cloud - Deadline Cloud

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Execute inferência de LLM em lote com vLLM no Deadline Cloud

O pacote de tarefas vllm_batch on GitHub executa inferência de modelo de linguagem grande (LLM) de alto rendimento em um arquivo JSONL de solicitações usando vLLM. O trabalho se espalha por uma frota de GPU, cada solicitação recebe uma resposta LLM e uma etapa agregada empacota tudo em um arquivo JSONL, além de um visualizador de HTML independente. O pacote lida com cargas de trabalho off-line e embaraçosamente paralelas, como geração de conteúdo, conjuntos de dados de avaliação, tradução, extração e classificação.

O pacote usa o recurso de fragmentação de tarefas do Deadline Cloud para agrupar solicitações em tarefas em lote e um ambiente de etapas Open Job Description para carregar o modelo uma vez por trabalhador em vez de uma vez por tarefa. Para obter mais informações, consulte Divisão de tarefas para modelos de trabalho.

Para executar esse pacote, você precisa de uma frota gerenciada por serviços com GPUs NVIDIA e pelo menos 32 GB de RAM, além de uma fila com um ambiente de fila conda que leia e apresente parâmetros de trabalho. CondaPackages CondaChannels No job_bundles diretório do repositório de amostras, envie o trabalho:

deadline bundle gui-submit vllm_batch

Você pode encadear a saída no Gere imagens em lote com um modelo de difusão no Deadline Cloud pacote para transformar o texto gerado em imagens legendadas.

Para obter um passo a passo completo que abrange a configuração da fazenda, o formato de entrada, o tamanho dos pedaços e a visualização dos resultados, consulte. Execute inferência LLM em lote com vLLM