View a markdown version of this page

Menyiapkan cluster Amazon EKS untuk beban AI/ML kerja - Amazon EKS

Bantu meningkatkan halaman ini

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Untuk berkontribusi pada panduan pengguna ini, pilih GitHub tautan Edit halaman ini di yang terletak di panel kanan setiap halaman.

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Menyiapkan cluster Amazon EKS untuk beban AI/ML kerja

Tip

Daftar untuk AI/ML lokakarya Amazon EKS mendatang.

Bagian ini memandu Anda dalam membuat cluster Amazon EKS yang siap menjalankan beban kerja inferensi, termasuk komputasi dengan GPU, tumpukan pemantauan, dan penyimpanan Amazon S3 untuk bobot model, bersama dengan izin IAM yang diperlukan. AWS

Gambaran umum arsitektur

Pengaturan membuat infrastruktur berikut:

  • Kluster EKS dengan GPU-enabled node — A Karpenter-managed NodePool yang secara dinamis menyediakan inst G-family ans GPU menggunakan kapasitas Spot dengan On-Demand fallback.

  • Tumpukan pemantauan — Prometheus mengikis metrik cluster, node, dan GPU dan menulisnya dari jarak jauh ke Amazon Managed Service for Prometheus (AMP). Grafana menyediakan dasbor untuk visualisasi. Eksportir NVIDIA DCGM menambahkan GPU-specific metrik termasuk pemanfaatan, memori, suhu, daya tarik, bandwidth NVLink, dan aktivitas tensor.

  • Bucket S3 bobot model — Bucket Amazon S3 untuk menyimpan bobot model, dengan asosiasi EKS Pod Identity yang memberikan read/write akses pod beban kerja.

Opsi komputasi cluster

Panduan ini menyediakan dua jalur untuk menyiapkan cluster Anda. Pilih satu dan ikuti secara konsisten melalui semua langkah.

  • Mode Otomatis EKS — Perintah tunggal menyediakan cluster EKS dengan Mode Otomatis EKS diaktifkan. Semua komponen yang diperlukan disediakan di luar kotak termasuk Karpenter-based penskalaan otomatis, agen pemantauan simpul EKS, penarikan wadah cepat dengan SOCI, dan plugin perangkat NVIDIA.

  • Self-managed Karpenter - Anda menginstal dan mengkonfigurasi setiap komponen secara eksplisit: Karpenter viaeksctl, perbaikan node otomatis melalui gerbang fiturnya, agen pemantauan simpul EKS sebagai add-on EKS, dan plugin perangkat NVIDIA melalui Helm. Anda juga membuat kustom EC2NodeClass yang menggunakan EKS-optimized NVIDIA AL2023 AMI dan mengonfigurasi SOCI.

Apa yang akan Anda atur

Langkah Deskripsi

Buat cluster

Menyediakan bidang kontrol EKS dan komponen tingkat cluster yang diperlukan untuk beban kerja GPU.

Buat node GPU yang disediakan secara dinamis

Tentukan GPU dinamis NodePool yang menyediakan instans G-family GPU saat beban kerja dijadwalkan.

Uji dengan pod sampel

Validasi penyiapan dari ujung ke ujung dengan menjalankan nvidia-smi pod yang memicu Karpenter untuk menyediakan GPU-enabled node.

Tambahkan kapasitas cadangan (opsional)

Lampirkan Reservasi On-Demand Kapasitas (ODCR) ke reservasi Anda terlebih NodeClass dahulu dengan fallback. Spot/On-Demand

Instal pemantauan

Terapkan kube-prometheus-stack (Prometheus + Grafana) dengan remote write ke AMP, ditambah NVIDIA DCGM Exporter untuk metrik GPU.

Buat ember bobot model

Buat bucket S3 dan konfigurasikan EKS Pod Identity sehingga pod beban kerja dapat membaca dan menulis bobot model.

Memulai

Untuk petunjuk langkah demi langkah menggunakan AWS CLI, lihatMenyiapkan cluster Amazon EKS untuk AI/ML beban kerja menggunakan CLI. Untuk petunjuk langkah demi langkah menggunakan Terraform, lihat. Menyiapkan cluster Amazon EKS untuk AI/ML beban kerja menggunakan Terraform