Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Personnalisation continue
Grâce à la personnalisation continue, vous pouvez vous appuyer sur un modèle précédemment personnalisé en appliquant une formation supplémentaire, soit avec une technique différente, soit avec la même technique avec de nouvelles données. Par exemple, commencez par SFT pour enseigner les connaissances du domaine, puis appliquez le DPO pour l'aligner sur les préférences de l'utilisateur, puis appliquez la RLVR pour améliorer la précision des faits.
Important
La personnalisation continue est différente de la technologie MTRL (apprentissage Multi-Turn par renforcement). La personnalisation continue permet d'enchaîner les tâches de formation selon les techniques. MTRL forme les agents à des tâches d'utilisation d'outils en plusieurs étapes dans le cadre d'une seule tâche de formation.
Comment ça marche
Charge les poids de l'adaptateur LoRa provenant d'un entraînement précédent
Réinitialise l'optimiseur, le planificateur et le compteur de pas (nouvel entraînement avec de nouvelles techniques ou données)
Le résultat de l'emploi précédent devient le point de départ de la nouvelle série de formation
Note
Transitions techniques prises en charge
Le tableau suivant répertorie toutes les combinaisons prises en charge pour une personnalisation continue :
| À partir de la technique | À la technique | Pris en charge |
|---|---|---|
| SFT | DPO | ✓ |
| SFT | RLVR | ✓ |
| SFT | RLAIF | ✓ |
| SFT | SFT (nouvelles données) | ✓ |
| SFT | MTRL | ✓ |
| DPO | DPO (nouvelles données) | ✓ |
| DPO | RLVR | ✓ |
| DPO | RLAIF | ✓ |
| DPO | SFT | ✓ |
| RLVR | DPO | ✓ |
| RLVR | RLVR (nouvelles données) | ✓ |
| RLAIF | DPO | ✓ |
| RLAIF | RLAIF (nouvelles données) | ✓ |
Personnalisation continue ou formation aux CV
| Personnalisation continue | Reprendre la formation | |
|---|---|---|
| Technique | Technique différente ou identique | Même technique uniquement |
| État de l'optimiseur | Réinitialiser (nouveau départ) | Restauré depuis un point de contrôle |
| Cas d'utilisation | Techniques en chaîne (SFT → DPO → RLVR) | Poursuivre l'entraînement interrompu |
| Type de formation | LoRa uniquement | LoRa uniquement |
Prise en main
La personnalisation continue est disponible via le Python SDK. Indiquez le chemin de sortie d'un travail de formation précédent resume_from_path pour la technique suivante.
from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()
Exemples de flux de travail
- SFT → DPO
Enseignez d'abord les connaissances du domaine, puis adaptez-vous aux préférences de l'utilisateur
- SFT → RLVR
Enseignez d'abord le format des tâches, puis optimisez-le pour des raisons d'exactitude factuelle
- SFT → DPO → RLVR
Pipeline complète — connaissances → préférences → précision
- SFT → MTRL
Enseignez les compétences de base, puis entraînez-vous à effectuer des tâches agentiques à plusieurs tours
- DPO → DPO (nouvelles données)
Affinez les préférences de manière itérative grâce à de nouvelles données de feedback