

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 在截止日期雲端上使用 vLLM 執行批次 LLM 推論
<a name="examples-jb-vllm-batch"></a>

[GitHub 上的 vllm\_batch 任務套件](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_batch)會使用 vLLM 在提示的 JSONL 檔案上執行高輸送量大型語言模型 (LLM) 推論。任務粉絲跨越 GPU 機群，每個提示都會取得 LLM 回應，而彙總步驟會將所有內容封裝成 JSONL 檔案，以及獨立的 HTML 檢視器。套件可處理離線、尷尬且平行的工作負載，例如內容產生、評估資料集、翻譯、擷取和分類。

套件使用截止日期雲端任務區塊功能，將提示分組為批次任務，並使用開放任務描述步驟環境，為每個工作者載入模型一次，而不是每個任務載入一次。如需詳細資訊，請參閱[任務範本的任務區塊](build-job-bundle-chunking.md)。

若要執行此套件，您需要具有 NVIDIA GPUs 和至少 32 GB RAM 的服務受管機群，以及具有讀取`CondaPackages`和`CondaChannels`任務參數之 conda 佇列環境的佇列。從範例儲存庫的 `job_bundles`目錄中，提交任務：

```
deadline bundle gui-submit vllm_batch
```

您可以將輸出鏈結至[在截止日期雲端上使用擴散模型批次產生映像](examples-jb-text-to-image-batch.md)套件，將產生的文字轉換為字幕影像。

如需涵蓋陣列設定、輸入格式、區塊大小和檢視結果的完整演練，請參閱 [使用 vLLM 執行批次 LLM 推論](tutorial-vllm-batch.md)。