Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Evaluasi
Setelah pelatihan, evaluasi mengonfirmasi bahwa model khusus Anda meningkatkan metrik yang penting untuk kasus penggunaan Anda, membantu Anda menangkap regresi sebelum penerapan dan membandingkan teknik secara objektif. Evaluasi tersedia melalui jalur Tanpa Server dan Resep.
Evaluasi tanpa server
Kirim pekerjaan evaluasi melalui infrastruktur Tanpa Server yang sama yang digunakan untuk pelatihan. Tersedia melalui Studio UI (Pekerjaan → Evaluasi model) atau Python SDK.
Untuk petunjuk terperinci, lihat alur kerja evaluasi diKustomisasi model tanpa server.
SageMaker Pekerjaan dan HyperPod evaluasi Pelatihan AI
Jalankan evaluasi menggunakan Resep dengan jenis evaluasi berikut:
- Evaluasi deterministik
Tolok ukur model Anda pada tugas standar termasuk MMLU, MMLU Pro, BBH, GPQA, MAT H, dan If Eval. Mendukung strategi zero-shot, few-shot, dan rantai pemikiran.
- LLM-as-Judge evaluasi
Gunakan LLM lain untuk mengevaluasi output model Anda pada kriteria subjektif seperti kebenaran, kelengkapan, kesetiaan, dan bantuan.
- Evaluasi kumpulan data kustom
Evaluasi pada dataset Anda sendiri menggunakan metrik khusus atau fungsi hadiah yang telah ditetapkan (
prime_math,prime_code).
Untuk resep evaluasi dan konfigurasi, lihat dokumentasi Resep SageMaker AI.