Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Bewertung
Nach dem Training bestätigt die Evaluierung, dass Ihr benutzerdefiniertes Modell die für Ihren Anwendungsfall wichtigen Kennzahlen verbessert. So können Sie Regressionen vor der Bereitstellung erkennen und Techniken objektiv vergleichen. Die Evaluierung ist sowohl über den Serverless- als auch über den Recipes-Pfad verfügbar. Infrastrukturoptionen
Serverlose Evaluierung
Reichen Sie Bewertungsaufträge über dieselbe serverlose Infrastruktur ein, die für die Schulung verwendet wird. Verfügbar über die Studio-Benutzeroberfläche (Jobs → Modellevaluierung) oder Python das SDK.
Eine ausführliche Anleitung finden Sie in den Evaluierungs-Workflows unterServerlose Modellanpassung.
SageMaker KI-Ausbildung, Jobs und HyperPod Bewertung
Führen Sie die Bewertung mithilfe von Rezepten mit den folgenden Evaluierungstypen durch:
- Deterministische Bewertung
Vergleichen Sie Ihr Modell anhand von Standardaufgaben wie MMLU, MMLU Pro, BBH, GPQA , MATH und IFeval. Unterstützt Zero-Shot-, Few-Shot- und Chain-of-Thought-Strategien.
- LLM-as-Judge Bewertung
Verwenden Sie ein anderes LLM, um die Ergebnisse Ihres Modells anhand subjektiver Kriterien wie Richtigkeit, Vollständigkeit, Treue und Hilfsbereitschaft zu bewerten.
- Benutzerdefinierte Datensatzbewertung
Evaluieren Sie anhand Ihres eigenen Datensatzes mithilfe benutzerdefinierter Metriken oder voreingestellter Belohnungsfunktionen (,).
prime_mathprime_code
Rezepte für die Bewertung und Konfiguration finden Sie in der Dokumentation zu SageMaker KI-Rezepten.