View a markdown version of this page

Personnalisation continue - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Personnalisation continue

Grâce à la personnalisation continue, vous pouvez vous appuyer sur un modèle précédemment personnalisé en appliquant une formation supplémentaire, soit avec une technique différente, soit avec la même technique avec de nouvelles données. Par exemple, commencez par SFT pour enseigner les connaissances du domaine, puis appliquez le DPO pour l'aligner sur les préférences de l'utilisateur, puis appliquez la RLVR pour améliorer la précision des faits.

Important

La personnalisation continue est différente de la technologie MTRL (apprentissage Multi-Turn par renforcement). La personnalisation continue permet d'enchaîner les tâches de formation selon les techniques. MTRL forme les agents à des tâches d'utilisation d'outils en plusieurs étapes dans le cadre d'une seule tâche de formation.

Comment ça marche

  • Charge les poids de l'adaptateur LoRa provenant d'un entraînement précédent

  • Réinitialise l'optimiseur, le planificateur et le compteur de pas (nouvel entraînement avec de nouvelles techniques ou données)

  • Le résultat de l'emploi précédent devient le point de départ de la nouvelle série de formation

Note

La personnalisation continue est actuellement disponible via la MTRL et les workflows de personnalisation continue utilisant uniquement le Python SDK. Il est compatible avec le type d'entraînement LoRa. La personnalisation continue entre différentes techniques avec la FFT n'est pas prise en charge.

Transitions techniques prises en charge

Le tableau suivant répertorie toutes les combinaisons prises en charge pour une personnalisation continue :

À partir de la technique À la technique Pris en charge
SFTDPO
SFTRLVR
SFTRLAIF
SFTSFT (nouvelles données)
SFTMTRL
DPODPO (nouvelles données)
DPORLVR
DPORLAIF
DPOSFT
RLVRDPO
RLVRRLVR (nouvelles données)
RLAIFDPO
RLAIFRLAIF (nouvelles données)

Personnalisation continue ou formation aux CV

Personnalisation continue Reprendre la formation
Technique Technique différente ou identique Même technique uniquement
État de l'optimiseur Réinitialiser (nouveau départ) Restauré depuis un point de contrôle
Cas d'utilisation Techniques en chaîne (SFT → DPO → RLVR) Poursuivre l'entraînement interrompu
Type de formation LoRa uniquement LoRa uniquement

Prise en main

La personnalisation continue est disponible via le Python SDK. Indiquez le chemin de sortie d'un travail de formation précédent resume_from_path pour la technique suivante.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Exemples de flux de travail

SFT → DPO

Enseignez d'abord les connaissances du domaine, puis adaptez-vous aux préférences de l'utilisateur

SFT → RLVR

Enseignez d'abord le format des tâches, puis optimisez-le pour des raisons d'exactitude factuelle

SFT → DPO → RLVR

Pipeline complète — connaissances → préférences → précision

SFT → MTRL

Enseignez les compétences de base, puis entraînez-vous à effectuer des tâches agentiques à plusieurs tours

DPO → DPO (nouvelles données)

Affinez les préférences de manière itérative grâce à de nouvelles données de feedback