

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Personnalisation continue
<a name="customizing-models-continuous"></a>

Grâce à la personnalisation ** continue**, vous pouvez vous appuyer sur un modèle précédemment personnalisé en appliquant une formation supplémentaire, soit avec une technique * différente, * soit avec la * même technique * avec de nouvelles données. Par exemple, commencez par [ SFT ](customizing-models-sft.md) pour enseigner les connaissances du domaine, puis appliquez le [ DPO ](customizing-models-dpo.md) pour l'aligner sur les préférences de l'utilisateur, puis appliquez la [ RLVR ](customizing-models-rft.md) pour améliorer la précision des faits.

**Important**  
La personnalisation continue est différente de la technologie [ MTRL ](model-customize-mtrl.md) (apprentissage Multi-Turn par renforcement). La personnalisation continue permet d'enchaîner les tâches de formation selon les techniques. MTRL forme les agents à des tâches d'utilisation d'outils en plusieurs étapes dans le cadre d'une seule tâche de formation.

## Comment ça marche
<a name="continuous-how-it-works"></a>
+ Charge les poids [ de l'](customizing-models-lora.md)adaptateur LoRa provenant d'un entraînement précédent
+ Réinitialise l'optimiseur, le planificateur et le compteur de pas (nouvel entraînement avec de nouvelles techniques ou données)
+ Le résultat de l'emploi précédent devient le point de départ de la nouvelle série de formation

**Note**  
La personnalisation continue est actuellement disponible via la [ MTRL ](model-customize-mtrl.md) et les workflows de personnalisation continue utilisant uniquement le Python SDK. Il est compatible avec le type [ d'](customizing-models-lora.md)entraînement LoRa. La personnalisation continue entre différentes techniques avec la [ FFT n'](customizing-models-fft.md)est pas prise en charge.

## Transitions techniques prises en charge
<a name="continuous-supported-transitions"></a>

Le tableau suivant répertorie toutes les combinaisons prises en charge pour une personnalisation continue :


| À partir de la technique | À la technique | Pris en charge | 
| --- | --- | --- | 
| SFT | DPO | ✓ | 
| SFT | RLVR | ✓ | 
| SFT | RLAIF | ✓ | 
| SFT | SFT (nouvelles données) | ✓ | 
| SFT | MTRL | ✓ | 
| DPO | DPO (nouvelles données) | ✓ | 
| DPO | RLVR | ✓ | 
| DPO | RLAIF | ✓ | 
| DPO | SFT | ✓ | 
| RLVR | DPO | ✓ | 
| RLVR | RLVR (nouvelles données) | ✓ | 
| RLAIF | DPO | ✓ | 
| RLAIF | RLAIF (nouvelles données) | ✓ | 

## Personnalisation continue ou formation aux CV
<a name="continuous-vs-resume"></a>


|  | Personnalisation continue | Reprendre la formation | 
| --- | --- | --- | 
| Technique  | Technique différente ou identique | Même technique uniquement | 
| État de l'optimiseur  | Réinitialiser (nouveau départ) | Restauré depuis un point de contrôle | 
| Cas d'utilisation | Techniques en chaîne (SFT → DPO → RLVR) | Poursuivre l'entraînement interrompu | 
| Type de formation  | [LoRa uniquement ](customizing-models-lora.md) | [LoRa uniquement ](customizing-models-lora.md) | 

## Prise en main
<a name="continuous-getting-started"></a>

La personnalisation continue est disponible via le Python SDK. Indiquez le chemin de sortie d'un travail de formation précédent `resume_from_path` pour la technique suivante.

```
from sagemaker.modules.train import DPOTrainer

# Continue from a previous SFT job with DPO
trainer = DPOTrainer(
    model_id="meta-textgeneration-llama-3-1-8b-instruct",
    train_data="s3://my-bucket/dpo-preferences.jsonl",
    resume_from_path="s3://my-bucket/previous-sft-output/",
    hyperparameters={
        "max_epochs": 2,
        "learning_rate": 1e-5,
        "lora_rank": 16,
    }
)
trainer.train()
```

## Exemples de flux de travail
<a name="continuous-example-workflows"></a>

SFT → DPO  
Enseignez d'abord les connaissances du domaine, puis adaptez-vous aux préférences de l'utilisateur

SFT → RLVR  
Enseignez d'abord le format des tâches, puis optimisez-le pour des raisons d'exactitude factuelle

SFT → DPO → RLVR  
Pipeline complète — connaissances → préférences → précision

SFT → MTRL  
Enseignez les compétences de base, puis entraînez-vous à effectuer des tâches agentiques à plusieurs tours

DPO → DPO (nouvelles données)  
Affinez les préférences de manière itérative grâce à de nouvelles données de feedback