

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

# 評価
<a name="customizing-models-evaluation"></a>

トレーニング後、評価では、カスタマイズされたモデルがユースケースにとって重要なメトリクスを改善し、デプロイ前にリグレッションをキャッチし、手法を客観的に比較するのに役立ちます。評価は、[サーバーレス](customize-model.md)パスと[レシピ](customizing-models-infrastructure.md)パスの両方で使用できます。

## サーバーレス評価
<a name="evaluation-serverless"></a>

トレーニングに使用したのと同じ[サーバーレス](customize-model.md)インフラストラクチャを使用して評価ジョブを送信します。**Studio UI** (ジョブ → モデル評価) または Python SDK を介して使用できます。

詳細な手順については、「」の評価ワークフローを参照してください[サーバーレスモデルのカスタマイズ](customize-model.md)。

## SageMaker AI トレーニングジョブと HyperPod の評価
<a name="evaluation-self-managed"></a>

以下の評価タイプの**レシピ**を使用して評価を実行します。

決定論的評価  
*MMLU*、*MMLU Pro*、*BBH*、*GPQA*、*MATH*、*IFEval* などの標準タスクでモデルをベンチマークします。ゼロショット、数ショット、およびchain-of-thought戦略をサポートします。

LLM-as-Judge 評価  
別の LLM を使用して、正確性、完全性、信頼性、有用性などの主観的な基準に基づいてモデルの出力を評価します。

カスタムデータセット評価  
カスタムメトリクスまたはプリセット報酬関数 (`prime_math`、) を使用して、独自のデータセットで を評価します`prime_code`。

評価レシピと設定については、[SageMaker AI レシピのドキュメント](https://docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-hyperpod-recipes.html)を参照してください。