

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# RFT
<a name="customizing-models-rft"></a>

Reinforcement Fine-Tuning (RFT) utilizza l'apprendimento per rinforzo per ottimizzare il comportamento del modello sulla base di segnali di ricompensa piuttosto che di esempi espliciti di input-output. Amazon SageMaker AI supporta due varianti RFT: RLVR (Reinforcement Learning with Verifiable Rewards) e RLAIF (Reinforcement Learning from AI Feedback).

## RLVR
<a name="technique-rlvr"></a>

RLVR utilizza una funzione di ricompensa basata su codice che verifica in modo programmatico se gli output del modello sono corretti. Ideale per attività con risposte oggettivamente giuste o sbagliate.

### Quando utilizzarlo
<a name="rlvr-when-to-use"></a>
+ La tua attività ha risposte corrette verificabili (matematica, codice, domande concrete)
+ Puoi scrivere una funzione di punteggio che valuti la correttezza delle risposte
+ Vuoi migliorare l'accuratezza dei fatti e ridurre le allucinazioni

### Formato del set di dati
<a name="rlvr-dataset-format"></a>

Ogni record contiene i metadati del modello di richiesta e ricompensa. La funzione di ricompensa valuta le risposte generate dal modello durante l'allenamento.

```
{
  "data_source": "openai/gsm8k",
  "prompt": [
    {
      "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".",
      "role": "user"
    }
  ],
  "ability": "math",
  "reward_model": {
    "ground_truth": "72",
    "style": "rule"
  }
}
```

Campi obbligatori:
+ `prompt`— matrice di oggetti messaggio con `role` e `content`
+ `reward_model.style`— impostato su `"rule"` per la verifica programmatica
+ `reward_model.ground_truth`— la risposta corretta per la verifica

### Funzioni di ricompensa preimpostate
<a name="rlvr-preset-reward-functions"></a>
+ `gsm8k`— Verifica matematica scolastica
+ `prime_code`— Verifica della correttezza del codice
+ `prime_math`— Verifica del ragionamento matematico

### Iperparametri RLVR LoRa
<a name="hyperparameters-rlvr-lora-rft"></a>

**Nota**  
Le tabelle seguenti mostrano gli iperparametri disponibili quando si utilizza la personalizzazione del modello serverless. [Personalizzazione del modello serverless](customize-model.md) Altri iperparametri sono preimpostati da Amazon SageMaker AI utilizzando valori predefiniti ottimizzati. Quando utilizzi [ SageMaker AI Training Jobs ](customizing-models-training-jobs.md) or [ HyperPod](customizing-models-hyperpod.md), puoi accedere all'elenco completo degli iperparametri disponibili nelle ricette. Consulta il repository [ SageMaker AI Recipes ](https://github.com/aws/sagemaker-hyperpod-recipes) per ottenere una ricetta e accedere a tutti gli iperparametri.


| Parametro | Tipo | Obbligatorio? | Intervallo/valori | Description | 
| --- | --- | --- | --- | --- | 
| preset\_reward\_function | stringa | Campo obbligatorio | gsm8k, prime\_code, prime\_math | Funzione di ricompensa preimpostata per la verifica. | 
| learning\_rate | virgola mobile | Campo obbligatorio | 1e-07—1e-03 | Dimensione del gradino per l'aggiornamento del peso. Impostare un valore più basso per RL (ad esempio, 1e-5). | 
| lr\_warmup\_steps\_ratio | virgola mobile | Campo obbligatorio | 0—1 | Frazione di passaggi per il riscaldamento LR. | 
| max\_epochs | intero | Campo obbligatorio | 1-100 | Numero di passaggi nel set di dati. | 
| global\_batch\_size | intero | Campo obbligatorio | 128, 256, 512, 1024 | Campioni totali per fase di ottimizzazione. | 
| max\_prompt\_length | intero | Campo obbligatorio | 512—16384 | Numero massimo di token per la porzione richiesta. | 
| weight\_decay | virgola mobile | Campo obbligatorio | 0.0 - 1.0 | Coefficiente di regolarizzazione L2. | 
| clip\_ratio | virgola mobile | Campo obbligatorio | 0,1—1,5 | Parametro di ritaglio GRPO. Limita la modifica della politica per aggiornamento. | 
| kl\_loss\_coef | virgola mobile | Campo obbligatorio | 0—0,1 | Peso della penalità di divergenza KL. Impedisce la deriva delle politiche. | 
| rollout\_n | intero | Campo obbligatorio | 1, 2, 4, 8, 16, 32 | Risposte dei candidati per richiesta durante le implementazioni. | 
| rollout\_temperature | virgola mobile | Campo obbligatorio | 0,01—2,0 | Temperatura per la generazione del rollout. | 
| lora\_rank | intero | Campo obbligatorio | 8, 16, 32, 64, 128 | LoRArango. Dimensionalità delle matrici di basso rango. | 
| lora\_alpha | intero | Campo obbligatorio | 16, 32, 64, 128, 256 | LoRAfattore di scala. L'LR effettivo si ridimensiona come. alpha/rank | 
| warmup\_steps | intero | Campo obbligatorio | -1—100 | Fasi di riscaldamento assolute (-1 per auto). | 
| min\_lr | virgola mobile | Campo obbligatorio | 0.0 - 1.0 | Frequenza minima di apprendimento. | 
| clip\_ratio\_high | virgola mobile | Campo obbligatorio | 0,0—0,5 | Soglia di ritaglio superiore. | 
| clip\_ratio\_low | virgola mobile | Campo obbligatorio | 0,0—0,5 | Soglia di ritaglio inferiore. | 
| temperature | virgola mobile | Campo obbligatorio | 0,0-2,0 | Temperatura di campionamento per la valutazione. | 
| use\_kl\_loss | booleano | Campo obbligatorio | true, false | Aggiungi la penalità di divergenza KL alla perdita. | 
| train\_val\_split\_ratio | virgola mobile | Facoltativo | 0.0 - 1.0 | Train/validation dividere. | 

### Iperparametri FFT RLVR
<a name="hyperparameters-rlvr-fft-rft"></a>

Stessi parametri di RLVR LoRa senza e. `lora_rank` `lora_alpha`

## RAIF
<a name="technique-rlaif"></a>

RLAIF utilizza un altro LLM come giudice per valutare le risposte del modello sulla base di una richiesta di ricompensa in linguaggio naturale. Ideale per attività con criteri di qualità soggettivi difficili da valutare programmaticamente.

### Quando utilizzarlo
<a name="rlaif-when-to-use"></a>
+ I tuoi criteri di qualità sono soggettivi (disponibilità, sicurezza, tono)
+ Puoi descrivere l'aspetto di «buono» in linguaggio naturale
+ Vuoi scalare il feedback oltre a quello che può fornire l'annotazione umana

### Formato del set di dati
<a name="rlaif-dataset-format"></a>

Ogni record contiene i metadati del modello di richiesta e ricompensa. Il giudice LLM valuta le risposte generate dal modello durante la formazione.

```
{
  "data_source": "WeOpenML/PandaLM",
  "prompt": [
    {
      "role": "user",
      "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..."
    }
  ],
  "ability": "pairwise-judging",
  "reward_model": {
    "style": "llmj",
    "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..."
  }
}
```

Campi obbligatori:
+ `prompt`— matrice di oggetti messaggio con `role` e `content`
+ `reward_model.style`— impostato su `"llmj"` for LLM-as-judge
+ `reward_model.ground_truth`— giudizio di riferimento per la calibrazione

### Modelli Judge
<a name="rlaif-judge-templates"></a>

I seguenti modelli di giudice preimpostati sono forniti nel contenitore di formazione. Selezionane uno utilizzando l'`judge_prompt_template`iperparametro.
+ `cot.jinja`— valutazione Chain-of-thought 
+ `evaluate.jinja`— Valutazione generale della qualità
+ `faithfulness.jinja`— Fedeltà al materiale originale
+ `summarize.jinja`— Qualità del riepilogo
+ `grader.jinja`— valutazione Rubric-based 

### Iperparametri RLAIF LoRa
<a name="hyperparameters-rlaif-lora-rft"></a>

Stessi parametri di RLVR LoRa con la seguente differenza:


| Parametro | Tipo | Obbligatorio? | Intervallo/valori | Description | 
| --- | --- | --- | --- | --- | 
| judge\_prompt\_template | stringa | Facoltativo | cot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinja | Modello per la valutazione dei giudici del LLM. Sostituiscepreset\_reward\_function. | 

### Iperparametri FFT RLAIF
<a name="hyperparameters-rlaif-fft-rft"></a>

Stessi parametri di RLAIF LoRa senza e. `lora_rank` `lora_alpha`