

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

# Deadline Cloud で vLLM を使用してバッチ LLM 推論を実行する
<a name="examples-jb-vllm-batch"></a>

[GitHub の vllm\_batch ジョブバンドル](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_batch)は、vLLM を使用してプロンプトの JSONL ファイルに対して高スループットの大規模言語モデル (LLM) 推論を実行します。ジョブは GPU フリート全体でファンアウトし、すべてのプロンプトが LLM レスポンスを受け取り、集約ステップはすべて JSONL ファイルと自己完結型の HTML ビューワーにパッケージ化されます。バンドルは、コンテンツ生成、評価データセット、翻訳、抽出、分類など、オフラインで非常に並列なワークロードを処理します。

このバンドルでは、Deadline Cloud タスクチャンキング機能を使用してプロンプトをバッチタスクにグループ化し、Open Job Description ステップ環境を使用して、タスクごとに 1 回ではなくワーカーごとに 1 回モデルをロードします。詳細については、「[ジョブテンプレートのタスクチャンキング](build-job-bundle-chunking.md)」を参照してください。

このバンドルを実行するには、NVIDIA GPUs と 32 GB 以上の RAM を備えたサービスマネージドフリート、および `CondaPackages` と`CondaChannels`ジョブパラメータを読み取る conda キュー環境を備えたキューが必要です。サンプルリポジトリの `job_bundles` ディレクトリから、ジョブを送信します。

```
deadline bundle gui-submit vllm_batch
```

出力を[Deadline Cloud で拡散モデルを使用してイメージをバッチで生成する](examples-jb-text-to-image-batch.md)バンドルにチェーンして、生成されたテキストを字幕付きイメージに変換できます。

ファームのセットアップ、入力形式、チャンクサイズ、結果の表示に関する詳細なチュートリアルについては、「」を参照してください[vLLM を使用してバッチ LLM 推論を実行する](tutorial-vllm-batch.md)。