View a markdown version of this page

在截止日期雲端上使用 vLLM 執行批次 LLM 推論 - 截止日期雲端

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

在截止日期雲端上使用 vLLM 執行批次 LLM 推論

GitHub 上的 vllm_batch 任務套件會使用 vLLM 在提示的 JSONL 檔案上執行高輸送量大型語言模型 (LLM) 推論。任務粉絲跨越 GPU 機群,每個提示都會取得 LLM 回應,而彙總步驟會將所有內容封裝成 JSONL 檔案,以及獨立的 HTML 檢視器。套件可處理離線、尷尬且平行的工作負載,例如內容產生、評估資料集、翻譯、擷取和分類。

套件使用截止日期雲端任務區塊功能,將提示分組為批次任務,並使用開放任務描述步驟環境,為每個工作者載入模型一次,而不是每個任務載入一次。如需詳細資訊,請參閱任務範本的任務區塊

若要執行此套件,您需要具有 NVIDIA GPUs 和至少 32 GB RAM 的服務受管機群,以及具有讀取CondaPackagesCondaChannels任務參數之 conda 佇列環境的佇列。從範例儲存庫的 job_bundles目錄中,提交任務:

deadline bundle gui-submit vllm_batch

您可以將輸出鏈結至在截止日期雲端上使用擴散模型批次產生映像套件,將產生的文字轉換為字幕影像。

如需涵蓋陣列設定、輸入格式、區塊大小和檢視結果的完整演練,請參閱 使用 vLLM 執行批次 LLM 推論