View a markdown version of this page

RFT - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

RFT

Penguatan Fine-Tuning (RFT) menggunakan pembelajaran penguatan untuk mengoptimalkan perilaku model berdasarkan sinyal hadiah daripada contoh input-output eksplisit. Amazon SageMaker AI mendukung dua varian RFT: RLVR (Reinforcement Learning with Verified Rewards) dan RLAIF (Reinforcement Learning from AI Feedback).

RLVR

RLVR menggunakan fungsi hadiah berbasis kode yang secara terprogram memverifikasi apakah output model benar. Paling cocok untuk tugas dengan jawaban yang benar atau salah secara objektif.

Kapan harus digunakan

  • Tugas Anda memiliki jawaban yang benar yang dapat diverifikasi (matematika, kode, pertanyaan faktual)

  • Anda dapat menulis fungsi penilaian yang mengevaluasi kebenaran respons

  • Anda ingin meningkatkan akurasi faktual dan mengurangi halusinasi

Format dataset

Setiap catatan berisi metadata model prompt dan hadiah. Fungsi hadiah mengevaluasi respons yang dihasilkan model selama pelatihan.

{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }

Bidang wajib:

  • prompt— array objek pesan dengan role dan content

  • reward_model.style— diatur "rule" untuk verifikasi terprogram

  • reward_model.ground_truth— jawaban yang benar untuk verifikasi

Fungsi hadiah yang telah ditetapkan

  • gsm8k— Verifikasi matematika sekolah dasar

  • prime_code— Verifikasi kebenaran kode

  • prime_math— Verifikasi penalaran matematis

Hiperparameter RLVR LoRa

catatan

Tabel di bawah ini menunjukkan hyperparameter yang tersedia saat Anda menggunakan kustomisasi model tanpa server. Hyperparameter lainnya telah ditetapkan oleh Amazon SageMaker AI menggunakan default yang dioptimalkan. Saat Anda menggunakan SageMaker Pekerjaan Pelatihan AI atau HyperPod, Anda dapat mengakses daftar lengkap hyperparameter yang tersedia di resep. Lihat repositori Resep SageMaker AI untuk mendapatkan resep dan mengakses semua hyperparameter.

Parameter Tipe Diperlukan? Rentang/Nilai Deskripsi
preset_reward_functionstringDiperlukan gsm8k, kode_utama, matematika_utamaFungsi hadiah preset untuk verifikasi.
learning_ratefloatDiperlukan 1e-07—1e-03Ukuran langkah untuk pembaruan berat. Atur lebih rendah untuk RL (misalnya, 1e-5).
lr_warmup_steps_ratiofloatDiperlukan 0—1Fraksi langkah untuk pemanasan LR.
max_epochsintegerDiperlukan 1–100Jumlah lintasan melalui dataset.
global_batch_sizeintegerDiperlukan 128, 256, 512, 1024Total sampel per langkah pengoptimal.
max_prompt_lengthintegerDiperlukan 512—16384Token maksimum untuk porsi cepat.
weight_decayfloatDiperlukan 0,0-1,0Koefisien regularisasi L2.
clip_ratiofloatDiperlukan 0,1—1,5Parameter kliping GRPO. Membatasi perubahan kebijakan per pembaruan.
kl_loss_coeffloatDiperlukan 0—0,1Bobot penalti divergensi KL. Mencegah penyimpangan kebijakan.
rollout_nintegerDiperlukan 1, 2, 4, 8, 16, 32Tanggapan kandidat per prompt selama peluncuran.
rollout_temperaturefloatDiperlukan 0,01—2,0Suhu untuk pembuatan peluncuran.
lora_rankintegerDiperlukan 8, 16, 32, 64, 128LoRAperingkat. Dimensi matriks peringkat rendah.
lora_alphaintegerDiperlukan 16, 32, 64, 128, 256LoRAfaktor penskalaan. Timbangan LR yang efektif sebagai alpha/rank.
warmup_stepsintegerDiperlukan -1—100Langkah pemanasan absolut (-1 untuk otomatis).
min_lrfloatDiperlukan 0,0-1,0LanTAI tingkat pembelajaran minimum.
clip_ratio_highfloatDiperlukan 0,0-0,5Ambang kliping atas.
clip_ratio_lowfloatDiperlukan 0,0-0,5Ambang kliping yang lebih rendah.
temperaturefloatDiperlukan 0,0-2,0Suhu pengambilan sampel untuk evaluasi.
use_kl_lossbooleanDiperlukan benar, salahTambahkan penalti divergensi KL ke kerugian.
train_val_split_ratiofloatOpsional0,0-1,0Train/validation berpisah.

Hiperparameter RLVR FFT

Parameter yang sama dengan RLVR LoRa tanpa lora_rank dan. lora_alpha

RLAIF

RLAIF menggunakan LLM lain sebagai juri untuk mengevaluasi respons model berdasarkan prompt penghargaan bahasa alami. Paling cocok untuk tugas dengan kriteria kualitas subjektif yang sulit untuk dievaluasi secara terprogram.

Kapan harus digunakan

  • Kriteria kualitas Anda subjektif (bantuan, keamanan, nada)

  • Anda dapat menggambarkan seperti apa “baik” dalam bahasa alami

  • Anda ingin menskalakan umpan balik di luar apa yang dapat diberikan anotasi manusia

Format dataset

Setiap catatan berisi metadata model prompt dan hadiah. Hakim LLM mengevaluasi respons yang dihasilkan model selama pelatihan.

{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }

Bidang yang wajib diisi:

  • prompt— array objek pesan dengan role dan content

  • reward_model.style— diatur ke "llmj" untuk LLM-as-judge

  • reward_model.ground_truth— penilaian referensi untuk kalibrasi

Templat hakim

Templat juri preset berikut disediakan dalam wadah pelatihan. Pilih satu menggunakan judge_prompt_template hyperparameter.

  • cot.jinja— Chain-of-thought evaluasi

  • evaluate.jinja— Evaluasi kualitas umum

  • faithfulness.jinja— Kesetiaan terhadap bahan sumber

  • summarize.jinja— Kualitas ringkasan

  • grader.jinja— Rubric-based penilaian

Hiperparameter RLAIF LoRa

Parameter yang sama dengan RLVR LoRa dengan perbedaan sebagai berikut:

ParameterTipeDiperlukan?Rentang/NilaiDeskripsi
judge_prompt_templatestringOpsionalcot.jinja, evaluate.jinja, kesetiaan.jinja, meringkas.jinja, grader.jinjaTemplate untuk evaluasi hakim LLM. Menggantipreset_reward_function.

Hiperparameter RLAIF FFT

Parameter yang sama dengan RLAIF LoRa tanpa lora_rank dan. lora_alpha