

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Personalizzazione continua
<a name="customizing-models-continuous"></a>

Con la personalizzazione ** continua**, puoi basarti su un modello precedentemente personalizzato applicando una formazione aggiuntiva, con una tecnica * diversa * o con la * stessa tecnica * con nuovi dati. Ad esempio, iniziate con [ SFT per ](customizing-models-sft.md) insegnare la conoscenza del dominio, quindi applicate il [ DPO ](customizing-models-dpo.md) per allinearvi alle preferenze dell'utente, quindi applicate [ RLVR ](customizing-models-rft.md) per migliorare l'accuratezza dei fatti.

**Importante**  
La personalizzazione continua è diversa da MTRL (Reinforcement Learning). [Multi-turn apprendimento per rinforzo](model-customize-mtrl.md) Multi-Turn La personalizzazione continua concatena i lavori di formazione tra le tecniche. MTRL forma gli agenti per attività di utilizzo degli strumenti in più fasi nell'ambito di un unico lavoro di formazione.

## Come funziona
<a name="continuous-how-it-works"></a>
+ Carica i pesi degli [ adattatori ](customizing-models-lora.md) LoRa ottenuti da un precedente lavoro di formazione
+ Reimposta l'ottimizzatore, lo scheduler e il contapassi (nuovo allenamento con nuove tecniche o dati)
+ Il risultato del lavoro precedente diventa il punto di partenza per il nuovo ciclo di formazione

**Nota**  
La personalizzazione continua è attualmente disponibile tramite [ MTRL ](model-customize-mtrl.md) e i flussi di lavoro di personalizzazione continua utilizzando solo l'SDK. Python È supportato dal tipo di formazione LoRa. [LoRA](customizing-models-lora.md) La personalizzazione continua tra diverse tecniche con [ FFT non ](customizing-models-fft.md) è supportata.

## Transizioni tecniche supportate
<a name="continuous-supported-transitions"></a>

La tabella seguente mostra tutte le combinazioni supportate per la personalizzazione continua:


| Dalla tecnica | Alla tecnica | Supportata | 
| --- | --- | --- | 
| SFT | DPO | ✓ | 
| SFT | RLVR | ✓ | 
| SFT | RAIF | ✓ | 
| SFT | SFT (nuovi dati) | ✓ | 
| SFT | MTRL | ✓ | 
| DPO | DPO (nuovi dati) | ✓ | 
| DPO | RLVR | ✓ | 
| DPO | RAIF | ✓ | 
| DPO | SFT | ✓ | 
| RLVR | DPO | ✓ | 
| RLVR | RLVR (nuovi dati) | ✓ | 
| RAIF | DPO | ✓ | 
| RAIF | RLAIF (nuovi dati) | ✓ | 

## Personalizzazione continua e formazione del curriculum
<a name="continuous-vs-resume"></a>


|  | Personalizzazione continua | Riprendi la formazione | 
| --- | --- | --- | 
| Tecnica  | Tecnica diversa o stessa | Solo stessa tecnica | 
| Stato dell'ottimizzatore  | Reset (nuovo inizio) | Ripristinato dal checkpoint | 
| Caso d'uso | Tecniche a catena (SFT → DPO → RLVR) | Continua l'allenamento interrotto | 
| Tipo di allenamento  | [Solo LoRa ](customizing-models-lora.md) | [Solo LoRa ](customizing-models-lora.md) | 

## Nozioni di base
<a name="continuous-getting-started"></a>

La personalizzazione continua è disponibile tramite l'PythonSDK. Fornisci il percorso di output di un precedente lavoro di formazione come metodo `resume_from_path` per la tecnica successiva.

```
from sagemaker.modules.train import DPOTrainer

# Continue from a previous SFT job with DPO
trainer = DPOTrainer(
    model_id="meta-textgeneration-llama-3-1-8b-instruct",
    train_data="s3://my-bucket/dpo-preferences.jsonl",
    resume_from_path="s3://my-bucket/previous-sft-output/",
    hyperparameters={
        "max_epochs": 2,
        "learning_rate": 1e-5,
        "lora_rank": 16,
    }
)
trainer.train()
```

## Flussi di lavoro di esempio
<a name="continuous-example-workflows"></a>

SFT → DPO  
Insegna prima la conoscenza del dominio, poi allinea le tue conoscenze alle preferenze dell'utente

SFT → RLVR  
Insegna prima il formato delle attività, quindi ottimizza per la correttezza dei fatti

SFT → DPO → RLVR  
Pipeline completa: conoscenza → preferenze → precisione

SFT → MTRL  
Insegna le capacità di base, quindi allenati per attività agentiche a più turni

DPO → DPO (nuovi dati)  
Perfeziona le preferenze in modo iterativo con nuovi dati di feedback