View a markdown version of this page

在 Deadline Cloud 上使用 vLLM 运行批量 LLM 推理 - 截止日期云

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在 Deadline Cloud 上使用 vLLM 运行批量 LLM 推理

上的 vllm_batch 作业包使用 vLLM 对包含提示的 JSONL 文件 GitHub运行高吞吐量大语言模型 (LLM) 推理。这项工作分散在 GPU 队列中,每个提示都会获得 LLM 响应,汇总步骤将所有内容打包到一个 JSONL 文件和一个独立的 HTML 查看器中。该套装可处理离线、令人尴尬的并行工作负载,例如内容生成、评估数据集、翻译、提取和分类。

该套件使用 Deadline Cloud 任务分块功能将提示分组为批处理任务,并使用 Open Job Description 步骤环境为每个工作人员加载一次模型,而不是每个任务加载一次。有关更多信息,请参阅 作业模板的任务分块

要运行此套件,您需要一个具有 NVIDIA GPU 和至少 32 GB RAM 的服务管理队列,以及一个具有可读取CondaPackagesCondaChannels作业参数的 conda 队列环境的队列。从示例存储库的job_bundles目录中提交作业:

deadline bundle gui-submit vllm_batch

您可以将输出链接到在 Deadline Cloud 上使用扩散模型批量生成图像包中,将生成的文本转换为带字幕的图像。

有关涵盖农场设置、输入格式、区块大小和查看结果的完整演练,请参阅。使用 vLLM 运行批处理 LLM 推理