Bantu meningkatkan halaman ini
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Untuk berkontribusi pada panduan pengguna ini, pilih GitHub tautan Edit halaman ini di yang terletak di panel kanan setiap halaman.
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menyiapkan cluster Amazon EKS untuk beban AI/ML kerja
Tip
Daftar
Bagian ini memandu Anda dalam membuat cluster Amazon EKS yang siap menjalankan beban kerja inferensi, termasuk komputasi dengan GPU, tumpukan pemantauan, dan penyimpanan Amazon S3 untuk bobot model, bersama dengan izin IAM yang diperlukan. AWS
Gambaran umum arsitektur
Pengaturan membuat infrastruktur berikut:
-
Kluster EKS dengan GPU-enabled node — A Karpenter-managed NodePool yang secara dinamis menyediakan inst G-family ans GPU menggunakan kapasitas Spot dengan On-Demand fallback.
-
Tumpukan pemantauan — Prometheus mengikis metrik cluster, node, dan GPU dan menulisnya dari jarak jauh ke Amazon Managed Service for Prometheus (AMP). Grafana menyediakan dasbor untuk visualisasi. Eksportir NVIDIA DCGM menambahkan GPU-specific metrik termasuk pemanfaatan, memori, suhu, daya tarik, bandwidth NVLink, dan aktivitas tensor.
-
Bucket S3 bobot model — Bucket Amazon S3 untuk menyimpan bobot model, dengan asosiasi EKS Pod Identity yang memberikan read/write akses pod beban kerja.
Opsi komputasi cluster
Panduan ini menyediakan dua jalur untuk menyiapkan cluster Anda. Pilih satu dan ikuti secara konsisten melalui semua langkah.
-
Mode Otomatis EKS — Perintah tunggal menyediakan cluster EKS dengan Mode Otomatis EKS diaktifkan. Semua komponen yang diperlukan disediakan di luar kotak termasuk Karpenter-based penskalaan otomatis, agen pemantauan simpul EKS, penarikan wadah cepat dengan SOCI, dan plugin perangkat NVIDIA.
-
Self-managed Karpenter - Anda menginstal dan mengkonfigurasi setiap komponen secara eksplisit: Karpenter via
eksctl, perbaikan node otomatis melalui gerbang fiturnya, agen pemantauan simpul EKS sebagai add-on EKS, dan plugin perangkat NVIDIA melalui Helm. Anda juga membuat kustomEC2NodeClassyang menggunakan EKS-optimized NVIDIA AL2023 AMI dan mengonfigurasi SOCI.
Apa yang akan Anda atur
| Langkah | Deskripsi |
|---|---|
|
Buat cluster |
Menyediakan bidang kontrol EKS dan komponen tingkat cluster yang diperlukan untuk beban kerja GPU. |
|
Buat node GPU yang disediakan secara dinamis |
Tentukan GPU dinamis NodePool yang menyediakan instans G-family GPU saat beban kerja dijadwalkan. |
|
Uji dengan pod sampel |
Validasi penyiapan dari ujung ke ujung dengan menjalankan |
|
Tambahkan kapasitas cadangan (opsional) |
Lampirkan Reservasi On-Demand Kapasitas (ODCR) ke reservasi Anda terlebih NodeClass dahulu dengan fallback. Spot/On-Demand |
|
Instal pemantauan |
Terapkan kube-prometheus-stack (Prometheus + Grafana) dengan remote write ke AMP, ditambah NVIDIA DCGM Exporter untuk metrik GPU. |
|
Buat ember bobot model |
Buat bucket S3 dan konfigurasikan EKS Pod Identity sehingga pod beban kerja dapat membaca dan menulis bobot model. |
Memulai
Untuk petunjuk langkah demi langkah menggunakan AWS CLI, lihatMenyiapkan cluster Amazon EKS untuk AI/ML beban kerja menggunakan CLI. Untuk petunjuk langkah demi langkah menggunakan Terraform, lihat. Menyiapkan cluster Amazon EKS untuk AI/ML beban kerja menggunakan Terraform