本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
在 Deadline Cloud 上使用 vLLM 运行批量 LLM 推理
上的 vllm_batch 作业包使用 vLLM 对包含提示的 JSONL 文件 GitHub
该套件使用 Deadline Cloud 任务分块功能将提示分组为批处理任务,并使用 Open Job Description 步骤环境为每个工作人员加载一次模型,而不是每个任务加载一次。有关更多信息,请参阅 作业模板的任务分块。
要运行此套件,您需要一个具有 NVIDIA GPU 和至少 32 GB RAM 的服务管理队列,以及一个具有可读取CondaPackages和CondaChannels作业参数的 conda 队列环境的队列。从示例存储库的job_bundles目录中提交作业:
deadline bundle gui-submit vllm_batch
您可以将输出链接到在 Deadline Cloud 上使用扩散模型批量生成图像包中,将生成的文本转换为带字幕的图像。
有关涵盖农场设置、输入格式、区块大小和查看结果的完整演练,请参阅。使用 vLLM 运行批处理 LLM 推理