Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Jalankan inferensi LLM batch dengan vLLM di Deadline Cloud
Bundel pekerjaan vllm_batch menjalankan inferensi model bahasa besar (LLM) throughput tinggi pada file prompt JSONL menggunakan vLLM. GitHub
Bundel menggunakan fitur pemotongan tugas Deadline Cloud untuk mengelompokkan prompt ke dalam tugas batch, dan lingkungan langkah Deskripsi Pekerjaan Terbuka untuk memuat model sekali per pekerja, bukan sekali per tugas. Untuk informasi selengkapnya, lihat Pemotongan tugas untuk templat pekerjaan.
Untuk menjalankan bundel ini, Anda memerlukan armada yang dikelola layanan dengan GPU NVIDIA dan setidaknya 32 GB RAM, dan antrian dengan lingkungan antrian conda yang membaca CondaPackages dan parameter pekerjaan. CondaChannels Dari job_bundles direktori repositori sampel, kirimkan pekerjaan:
deadline bundle gui-submit vllm_batch
Anda dapat mengrantai output ke dalam Hasilkan gambar dalam batch dengan model difusi di Deadline Cloud bundel untuk mengubah teks yang dihasilkan menjadi gambar berteks.
Untuk panduan lengkap yang mencakup pengaturan pertanian, format input, ukuran potongan, dan melihat hasilnya, lihat. Jalankan inferensi LLM batch dengan vLLM