View a markdown version of this page

Bewertung - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Bewertung

Nach dem Training bestätigt die Evaluierung, dass Ihr benutzerdefiniertes Modell die für Ihren Anwendungsfall wichtigen Kennzahlen verbessert. So können Sie Regressionen vor der Bereitstellung erkennen und Techniken objektiv vergleichen. Die Evaluierung ist sowohl über den Serverless- als auch über den Recipes-Pfad verfügbar. Infrastrukturoptionen

Serverlose Evaluierung

Reichen Sie Bewertungsaufträge über dieselbe serverlose Infrastruktur ein, die für die Schulung verwendet wird. Verfügbar über die Studio-Benutzeroberfläche (Jobs → Modellevaluierung) oder Python das SDK.

Eine ausführliche Anleitung finden Sie in den Evaluierungs-Workflows unterServerlose Modellanpassung.

SageMaker KI-Ausbildung, Jobs und HyperPod Bewertung

Führen Sie die Bewertung mithilfe von Rezepten mit den folgenden Evaluierungstypen durch:

Deterministische Bewertung

Vergleichen Sie Ihr Modell anhand von Standardaufgaben wie MMLU, MMLU Pro, BBH, GPQA , MATH und IFeval. Unterstützt Zero-Shot-, Few-Shot- und Chain-of-Thought-Strategien.

LLM-as-Judge Bewertung

Verwenden Sie ein anderes LLM, um die Ergebnisse Ihres Modells anhand subjektiver Kriterien wie Richtigkeit, Vollständigkeit, Treue und Hilfsbereitschaft zu bewerten.

Benutzerdefinierte Datensatzbewertung

Evaluieren Sie anhand Ihres eigenen Datensatzes mithilfe benutzerdefinierter Metriken oder voreingestellter Belohnungsfunktionen (,). prime_math prime_code

Rezepte für die Bewertung und Konfiguration finden Sie in der Dokumentation zu SageMaker KI-Rezepten.