View a markdown version of this page

Deadline Cloud で vLLM を使用してバッチ LLM 推論を実行する - Deadline クラウド

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Deadline Cloud で vLLM を使用してバッチ LLM 推論を実行する

GitHub の vllm_batch ジョブバンドルは、vLLM を使用してプロンプトの JSONL ファイルに対して高スループットの大規模言語モデル (LLM) 推論を実行します。ジョブは GPU フリート全体でファンアウトし、すべてのプロンプトが LLM レスポンスを受け取り、集約ステップはすべて JSONL ファイルと自己完結型の HTML ビューワーにパッケージ化されます。バンドルは、コンテンツ生成、評価データセット、翻訳、抽出、分類など、オフラインで非常に並列なワークロードを処理します。

このバンドルでは、Deadline Cloud タスクチャンキング機能を使用してプロンプトをバッチタスクにグループ化し、Open Job Description ステップ環境を使用して、タスクごとに 1 回ではなくワーカーごとに 1 回モデルをロードします。詳細については、「ジョブテンプレートのタスクチャンキング」を参照してください。

このバンドルを実行するには、NVIDIA GPUs と 32 GB 以上の RAM を備えたサービスマネージドフリート、および CondaPackagesCondaChannelsジョブパラメータを読み取る conda キュー環境を備えたキューが必要です。サンプルリポジトリの job_bundles ディレクトリから、ジョブを送信します。

deadline bundle gui-submit vllm_batch

出力をDeadline Cloud で拡散モデルを使用してイメージをバッチで生成するバンドルにチェーンして、生成されたテキストを字幕付きイメージに変換できます。

ファームのセットアップ、入力形式、チャンクサイズ、結果の表示に関する詳細なチュートリアルについては、「」を参照してくださいvLLM を使用してバッチ LLM 推論を実行する