

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 在 Deadline Cloud 上使用 vLLM 运行批量 LLM 推理
<a name="examples-jb-vllm-batch"></a>

上的 [ vllm\_batch 作业包使用 vLLM 对包含提示的 JSONL 文件 GitHub](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_batch)运行高吞吐量大语言模型 (LLM) 推理。这项工作分散在 GPU 队列中，每个提示都会获得 LLM 响应，汇总步骤将所有内容打包到一个 JSONL 文件和一个独立的 HTML 查看器中。该套装可处理离线、令人尴尬的并行工作负载，例如内容生成、评估数据集、翻译、提取和分类。

该套件使用 Deadline Cloud 任务分块功能将提示分组为批处理任务，并使用 Open Job Description 步骤环境为每个工作人员加载一次模型，而不是每个任务加载一次。有关更多信息，请参阅 [作业模板的任务分块](build-job-bundle-chunking.md)。

要运行此套件，您需要一个具有 NVIDIA GPU 和至少 32 GB RAM 的服务管理队列，以及一个具有可读取`CondaPackages`和`CondaChannels`作业参数的 conda 队列环境的队列。从示例存储库的`job_bundles`目录中提交作业：

```
deadline bundle gui-submit vllm_batch
```

您可以将输出链接到[在 Deadline Cloud 上使用扩散模型批量生成图像](examples-jb-text-to-image-batch.md)包中，将生成的文本转换为带字幕的图像。

有关涵盖农场设置、输入格式、区块大小和查看结果的完整演练，请参阅。[使用 vLLM 运行批处理 LLM 推理](tutorial-vllm-batch.md)