翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Deadline Cloud で vLLM を使用してバッチ LLM 推論を実行する
GitHub の vllm_batch ジョブバンドル
このバンドルでは、Deadline Cloud タスクチャンキング機能を使用してプロンプトをバッチタスクにグループ化し、Open Job Description ステップ環境を使用して、タスクごとに 1 回ではなくワーカーごとに 1 回モデルをロードします。詳細については、「ジョブテンプレートのタスクチャンキング」を参照してください。
このバンドルを実行するには、NVIDIA GPUs と 32 GB 以上の RAM を備えたサービスマネージドフリート、および CondaPackages とCondaChannelsジョブパラメータを読み取る conda キュー環境を備えたキューが必要です。サンプルリポジトリの job_bundles ディレクトリから、ジョブを送信します。
deadline bundle gui-submit vllm_batch
出力をDeadline Cloud で拡散モデルを使用してイメージをバッチで生成するバンドルにチェーンして、生成されたテキストを字幕付きイメージに変換できます。
ファームのセットアップ、入力形式、チャンクサイズ、結果の表示に関する詳細なチュートリアルについては、「」を参照してくださいvLLM を使用してバッチ LLM 推論を実行する。