Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
RFT
Penguatan Fine-Tuning (RFT) menggunakan pembelajaran penguatan untuk mengoptimalkan perilaku model berdasarkan sinyal hadiah daripada contoh input-output eksplisit. Amazon SageMaker AI mendukung dua varian RFT: RLVR (Reinforcement Learning with Verified Rewards) dan RLAIF (Reinforcement Learning from AI Feedback).
RLVR
RLVR menggunakan fungsi hadiah berbasis kode yang secara terprogram memverifikasi apakah output model benar. Paling cocok untuk tugas dengan jawaban yang benar atau salah secara objektif.
Kapan harus digunakan
Tugas Anda memiliki jawaban yang benar yang dapat diverifikasi (matematika, kode, pertanyaan faktual)
Anda dapat menulis fungsi penilaian yang mengevaluasi kebenaran respons
Anda ingin meningkatkan akurasi faktual dan mengurangi halusinasi
Format dataset
Setiap catatan berisi metadata model prompt dan hadiah. Fungsi hadiah mengevaluasi respons yang dihasilkan model selama pelatihan.
{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }
Bidang wajib:
prompt— array objek pesan denganroledancontentreward_model.style— diatur"rule"untuk verifikasi terprogramreward_model.ground_truth— jawaban yang benar untuk verifikasi
Fungsi hadiah yang telah ditetapkan
gsm8k— Verifikasi matematika sekolah dasarprime_code— Verifikasi kebenaran kodeprime_math— Verifikasi penalaran matematis
Hiperparameter RLVR LoRa
catatan
Tabel di bawah ini menunjukkan hyperparameter yang tersedia saat Anda menggunakan kustomisasi model tanpa server. Hyperparameter lainnya telah ditetapkan oleh Amazon SageMaker AI menggunakan default yang dioptimalkan. Saat Anda menggunakan SageMaker Pekerjaan Pelatihan AI atau HyperPod, Anda dapat mengakses daftar lengkap hyperparameter yang tersedia di resep. Lihat repositori Resep SageMaker AI
| Parameter | Tipe | Diperlukan? | Rentang/Nilai | Deskripsi |
|---|---|---|---|---|
preset_reward_function | string | Diperlukan | gsm8k, kode_utama, matematika_utama | Fungsi hadiah preset untuk verifikasi. |
learning_rate | float | Diperlukan | 1e-07—1e-03 | Ukuran langkah untuk pembaruan berat. Atur lebih rendah untuk RL (misalnya, 1e-5). |
lr_warmup_steps_ratio | float | Diperlukan | 0—1 | Fraksi langkah untuk pemanasan LR. |
max_epochs | integer | Diperlukan | 1–100 | Jumlah lintasan melalui dataset. |
global_batch_size | integer | Diperlukan | 128, 256, 512, 1024 | Total sampel per langkah pengoptimal. |
max_prompt_length | integer | Diperlukan | 512—16384 | Token maksimum untuk porsi cepat. |
weight_decay | float | Diperlukan | 0,0-1,0 | Koefisien regularisasi L2. |
clip_ratio | float | Diperlukan | 0,1—1,5 | Parameter kliping GRPO. Membatasi perubahan kebijakan per pembaruan. |
kl_loss_coef | float | Diperlukan | 0—0,1 | Bobot penalti divergensi KL. Mencegah penyimpangan kebijakan. |
rollout_n | integer | Diperlukan | 1, 2, 4, 8, 16, 32 | Tanggapan kandidat per prompt selama peluncuran. |
rollout_temperature | float | Diperlukan | 0,01—2,0 | Suhu untuk pembuatan peluncuran. |
lora_rank | integer | Diperlukan | 8, 16, 32, 64, 128 | LoRAperingkat. Dimensi matriks peringkat rendah. |
lora_alpha | integer | Diperlukan | 16, 32, 64, 128, 256 | LoRAfaktor penskalaan. Timbangan LR yang efektif sebagai alpha/rank. |
warmup_steps | integer | Diperlukan | -1—100 | Langkah pemanasan absolut (-1 untuk otomatis). |
min_lr | float | Diperlukan | 0,0-1,0 | LanTAI tingkat pembelajaran minimum. |
clip_ratio_high | float | Diperlukan | 0,0-0,5 | Ambang kliping atas. |
clip_ratio_low | float | Diperlukan | 0,0-0,5 | Ambang kliping yang lebih rendah. |
temperature | float | Diperlukan | 0,0-2,0 | Suhu pengambilan sampel untuk evaluasi. |
use_kl_loss | boolean | Diperlukan | benar, salah | Tambahkan penalti divergensi KL ke kerugian. |
train_val_split_ratio | float | Opsional | 0,0-1,0 | Train/validation berpisah. |
Hiperparameter RLVR FFT
Parameter yang sama dengan RLVR LoRa tanpa lora_rank dan. lora_alpha
RLAIF
RLAIF menggunakan LLM lain sebagai juri untuk mengevaluasi respons model berdasarkan prompt penghargaan bahasa alami. Paling cocok untuk tugas dengan kriteria kualitas subjektif yang sulit untuk dievaluasi secara terprogram.
Kapan harus digunakan
Kriteria kualitas Anda subjektif (bantuan, keamanan, nada)
Anda dapat menggambarkan seperti apa “baik” dalam bahasa alami
Anda ingin menskalakan umpan balik di luar apa yang dapat diberikan anotasi manusia
Format dataset
Setiap catatan berisi metadata model prompt dan hadiah. Hakim LLM mengevaluasi respons yang dihasilkan model selama pelatihan.
{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }
Bidang yang wajib diisi:
prompt— array objek pesan denganroledancontentreward_model.style— diatur ke"llmj"untuk LLM-as-judgereward_model.ground_truth— penilaian referensi untuk kalibrasi
Templat hakim
Templat juri preset berikut disediakan dalam wadah pelatihan. Pilih satu menggunakan judge_prompt_template hyperparameter.
cot.jinja— Chain-of-thought evaluasievaluate.jinja— Evaluasi kualitas umumfaithfulness.jinja— Kesetiaan terhadap bahan sumbersummarize.jinja— Kualitas ringkasangrader.jinja— Rubric-based penilaian
Hiperparameter RLAIF LoRa
Parameter yang sama dengan RLVR LoRa dengan perbedaan sebagai berikut:
| Parameter | Tipe | Diperlukan? | Rentang/Nilai | Deskripsi |
|---|---|---|---|---|
judge_prompt_template | string | Opsional | cot.jinja, evaluate.jinja, kesetiaan.jinja, meringkas.jinja, grader.jinja | Template untuk evaluasi hakim LLM. Menggantipreset_reward_function. |
Hiperparameter RLAIF FFT
Parameter yang sama dengan RLAIF LoRa tanpa lora_rank dan. lora_alpha