View a markdown version of this page

Jalankan inferensi LLM batch dengan vLLM di Deadline Cloud - Awan Batas Waktu

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Jalankan inferensi LLM batch dengan vLLM di Deadline Cloud

Bundel pekerjaan vllm_batch menjalankan inferensi model bahasa besar (LLM) throughput tinggi pada file prompt JSONL menggunakan vLLM. GitHub Penggemar pekerjaan di seluruh armada GPU, setiap prompt mendapat respons LLM, dan langkah agregat mengemas semuanya ke dalam file JSONL ditambah penampil HTML mandiri. Bundel menangani beban kerja offline dan paralel yang memalukan seperti pembuatan konten, kumpulan data evaluasi, terjemahan, ekstraksi, dan klasifikasi.

Bundel menggunakan fitur pemotongan tugas Deadline Cloud untuk mengelompokkan prompt ke dalam tugas batch, dan lingkungan langkah Deskripsi Pekerjaan Terbuka untuk memuat model sekali per pekerja, bukan sekali per tugas. Untuk informasi selengkapnya, lihat Pemotongan tugas untuk templat pekerjaan.

Untuk menjalankan bundel ini, Anda memerlukan armada yang dikelola layanan dengan GPU NVIDIA dan setidaknya 32 GB RAM, dan antrian dengan lingkungan antrian conda yang membaca CondaPackages dan parameter pekerjaan. CondaChannels Dari job_bundles direktori repositori sampel, kirimkan pekerjaan:

deadline bundle gui-submit vllm_batch

Anda dapat mengrantai output ke dalam Hasilkan gambar dalam batch dengan model difusi di Deadline Cloud bundel untuk mengubah teks yang dihasilkan menjadi gambar berteks.

Untuk panduan lengkap yang mencakup pengaturan pertanian, format input, ukuran potongan, dan melihat hasilnya, lihat. Jalankan inferensi LLM batch dengan vLLM