As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Execute inferência de LLM em lote com vLLM no Deadline Cloud
O pacote de tarefas vllm_batch on GitHub
O pacote usa o recurso de fragmentação de tarefas do Deadline Cloud para agrupar solicitações em tarefas em lote e um ambiente de etapas Open Job Description para carregar o modelo uma vez por trabalhador em vez de uma vez por tarefa. Para obter mais informações, consulte Divisão de tarefas para modelos de trabalho.
Para executar esse pacote, você precisa de uma frota gerenciada por serviços com GPUs NVIDIA e pelo menos 32 GB de RAM, além de uma fila com um ambiente de fila conda que leia e apresente parâmetros de trabalho. CondaPackages CondaChannels No job_bundles diretório do repositório de amostras, envie o trabalho:
deadline bundle gui-submit vllm_batch
Você pode encadear a saída no Gere imagens em lote com um modelo de difusão no Deadline Cloud pacote para transformar o texto gerado em imagens legendadas.
Para obter um passo a passo completo que abrange a configuração da fazenda, o formato de entrada, o tamanho dos pedaços e a visualização dos resultados, consulte. Execute inferência LLM em lote com vLLM