

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Evaluasi
<a name="customizing-models-evaluation"></a>

Setelah pelatihan, evaluasi mengonfirmasi bahwa model khusus Anda meningkatkan metrik yang penting untuk kasus penggunaan Anda, membantu Anda menangkap regresi sebelum penerapan dan membandingkan teknik secara objektif. Evaluasi tersedia melalui [ jalur [ Tanpa Server ](customize-model.md) dan ](customizing-models-infrastructure.md) Resep.

## Evaluasi tanpa server
<a name="evaluation-serverless"></a>

Kirim pekerjaan evaluasi melalui [ infrastruktur ](customize-model.md) Tanpa Server yang sama yang digunakan untuk pelatihan. Tersedia melalui ** Studio UI ** (Pekerjaan → Evaluasi model) atau Python SDK.

Untuk petunjuk terperinci, lihat alur kerja evaluasi di[Kustomisasi model tanpa server](customize-model.md).

## SageMaker Pekerjaan dan HyperPod evaluasi Pelatihan AI
<a name="evaluation-self-managed"></a>

Jalankan evaluasi menggunakan ** Resep ** dengan jenis evaluasi berikut:

Evaluasi deterministik  
Tolok ukur model Anda pada tugas standar termasuk * MMLU*, * MMLU Pro, * BBH, * GPQA*, * MAT * H*, dan If * Eval. * * Mendukung strategi zero-shot, few-shot, dan rantai pemikiran.

LLM-as-Judge evaluasi  
Gunakan LLM lain untuk mengevaluasi output model Anda pada kriteria subjektif seperti kebenaran, kelengkapan, kesetiaan, dan bantuan.

Evaluasi kumpulan data kustom  
Evaluasi pada dataset Anda sendiri menggunakan metrik khusus atau fungsi hadiah yang telah ditetapkan (`prime_math`,`prime_code`).

Untuk resep evaluasi dan konfigurasi, lihat dokumentasi Resep [ SageMaker AI](https://docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-hyperpod-recipes.html).