

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Amazon SageMaker HyperPod
<a name="sagemaker-hyperpod"></a>

SageMaker HyperPod ti aiuta a fornire cluster resilienti per l'esecuzione di carichi di lavoro di machine learning (ML) e lo sviluppo di modelli all'avanguardia come Large Language Models (LLM), diffusion model e Foundation Models (FM). Accelera lo sviluppo di FM eliminando gli oneri indifferenziati legati alla creazione e alla manutenzione di cluster di elaborazione su larga scala alimentati da migliaia di acceleratori come AWS Trainium e le unità di elaborazione grafica (GPU) NVIDIA A100 e H100. Quando gli acceleratori si guastano, le funzionalità di resilienza di SageMaker HyperPod Monitor the cluster rilevano e sostituiscono automaticamente l'hardware difettoso in modo che tu possa concentrarti sull'esecuzione dei carichi di lavoro ML.

Per iniziare, controlla[Prerequisiti per l'utilizzo SageMaker HyperPod](sagemaker-hyperpod-prerequisites.md), [AWS Identity and Access Management per SageMaker HyperPod](sagemaker-hyperpod-prerequisites-iam.md) configura e scegli una delle seguenti opzioni di orchestrator supportate da. SageMaker HyperPod

**Supporto per Slurm in SageMaker HyperPod **

SageMaker HyperPod fornisce supporto per l'esecuzione di carichi di lavoro di machine learning su cluster resilienti integrandosi con Slurm, un gestore di carichi di lavoro open source. Il supporto di Slurm SageMaker HyperPod consente una perfetta orchestrazione dei cluster tramite la configurazione del cluster Slurm, consentendo di configurare nodi head, login e worker sui cluster Questa integrazione facilita anche la pianificazione dei lavori per l'esecuzione dei carichi di Slurm-based lavoro ML sul SageMaker HyperPod cluster, nonché l'accesso diretto ai nodi del cluster per la pianificazione dei lavori. Con il supporto per la configurazione HyperPod del ciclo di vita, puoi personalizzare l'ambiente di elaborazione dei cluster per soddisfare i tuoi requisiti specifici. Inoltre, sfruttando le librerie di formazione distribuite di Amazon SageMaker AI, puoi ottimizzare le prestazioni dei cluster sulle AWS risorse di calcolo e di rete. Per ulteriori informazioni, consulta [Orchestrazione SageMaker HyperPod dei cluster con Slurm](sagemaker-hyperpod-slurm.md). 

**Supporto Amazon EKS in SageMaker HyperPod **

SageMaker HyperPod si integra inoltre con Amazon EKS per consentire la formazione su larga scala dei modelli di base su cluster di calcolo resilienti e di lunga durata. Ciò consente agli utenti amministratori del cluster di effettuare il provisioning HyperPod dei cluster e collegarli a un piano di controllo EKS, consentendo la gestione dinamica della capacità, l'accesso diretto alle istanze del cluster e le funzionalità di resilienza. Per i data scientist, il supporto di Amazon EKS HyperPod consente l'esecuzione di carichi di lavoro containerizzati per la formazione dei modelli di base, l'inferenza sul cluster EKS e l'utilizzo della funzionalità di ripresa automatica dei lavori per la formazione di Kubeflow. PyTorch L'architettura prevede una mappatura 1 a 1 tra un cluster EKS (piano di controllo) e un cluster (nodi di lavoro) all'interno di un VPC, fornendo una HyperPod soluzione strettamente integrata per l'esecuzione di carichi di lavoro ML su larga scala. Per ulteriori informazioni, consulta [Orchestrazione dei cluster con Amazon EKS SageMaker HyperPod](sagemaker-hyperpod-eks.md).

**UltraServers con HyperPod **

HyperPod with UltraServers offre potenza di calcolo AI integrando i superchip NVIDIA in un'infrastruttura coesa e ad alte prestazioni. Ogni NVL72 UltraServer combina 18 istanze con 72 GPU NVIDIA Blackwell interconnesse tramite NVLink, consentendo un'inferenza più rapida e prestazioni di formazione più rapide rispetto alle istanze della generazione precedente. Questa architettura è particolarmente utile per le organizzazioni che lavorano con modelli di base con trilioni di parametri, poiché la memoria GPU unificata consente a interi modelli di rimanere all'interno di un singolo dominio NVLink, eliminando i colli di bottiglia di rete tra nodi. HyperPod migliora questo vantaggio hardware con una pianificazione intelligente basata sulla topologia che ottimizza il posizionamento dei carichi di lavoro, la sostituzione automatica delle istanze per ridurre al minimo le interruzioni e opzioni di distribuzione flessibili che supportano configurazioni di risorse dedicate e condivise. Per i team che si spingono oltre i limiti delle dimensioni e delle prestazioni dei modelli, questa integrazione fornisce la base computazionale necessaria per addestrare e implementare i modelli di IA più avanzati con un’efficienza senza precedenti.

SageMaker HyperPod ottimizza automaticamente il posizionamento delle istanze nel tuo. UltraServers Per impostazione predefinita, HyperPod dà la priorità a tutte le istanze in una UltraServer prima di utilizzarne una diversa. Ad esempio, se desideri 14 istanze e ne hai 2 UltraServers nel tuo piano, SageMaker AI utilizza tutte le istanze della prima. UltraServer Se desideri 20 istanze, SageMaker AI utilizza tutte le 18 istanze della prima UltraServer e poi ne utilizza altre 2 della seconda.

## Regioni AWS supportato da SageMaker HyperPod
<a name="sagemaker-hyperpod-available-regions"></a>

SageMaker HyperPod è disponibile di seguito Regioni AWS. 
+ us-east-1
+ us-east-2
+ us-west-1
+ us-west-2
+ eu-central-1
+ eu-north-1
+ eu-west-1
+ eu-west-2
+ eu-south-2
+ ap-south-1
+ ap-south-2
+ ap-southeast-1
+ ap-southeast-2
+ ap-southeast-3
+ ap-southeast-4
+ ap-northeast-1
+ ap-northeast-2
+ sa-east-1

**Topics**
+ [Regioni AWS supportato da SageMaker HyperPod](#sagemaker-hyperpod-available-regions)
+ [Guida SageMaker HyperPod introduttiva ad Amazon](sagemaker-hyperpod-quickstart.md)
+ [Prerequisiti per l'utilizzo SageMaker HyperPod](sagemaker-hyperpod-prerequisites.md)
+ [AWS Identity and Access Management per SageMaker HyperPod](sagemaker-hyperpod-prerequisites-iam.md)
+ [Gestito dal cliente AWS KMS key crittografia per SageMaker HyperPod](smcluster-cmk.md)
+ [SageMaker HyperPod ricette](sagemaker-hyperpod-recipes.md)
+ [Orchestrazione SageMaker HyperPod dei cluster con Slurm](sagemaker-hyperpod-slurm.md)
+ [Orchestrazione dei cluster con Amazon EKS SageMaker HyperPod](sagemaker-hyperpod-eks.md)
+ [Utilizzo della pianificazione basata sulla topologia in Amazon SageMaker HyperPod](sagemaker-hyperpod-topology.md)
+ [Distribuzione di modelli su Amazon SageMaker HyperPod](sagemaker-hyperpod-model-deployment.md)
+ [SageMaker HyperPod riferimento agli eventi del cluster](sagemaker-hyperpod-cluster-events-reference.md)
+ [HyperPod in Studio](sagemaker-hyperpod-studio.md)
+ [SageMaker HyperPod riferimenti](sagemaker-hyperpod-ref.md)
+ [Note sulla SageMaker HyperPod versione di Amazon](sagemaker-hyperpod-release-notes.md)
+ [SageMaker HyperPod Amazon AMI](sagemaker-hyperpod-release-ami.md)