Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Techniques de personnalisation
Les techniques de personnalisation définissent la manière dont votre modèle apprend à partir des données. Chaque technique nécessite un format de jeu de données différent et possède ses propres hyperparamètres. Choisissez en fonction des données dont vous disposez et du comportement que vous souhaitez adopter.
SFT(Supervisé Fine-Tuning) — Entraînez-vous sur des paires de réponses rapides étiquetées. Idéal pour enseigner un style, un format ou des connaissances de domaine spécifiques à un modèle.
DPO(Optimisation des préférences directes) — Entraînez-vous sur les paires de réponses préférées et rejetées. Idéal pour s'aligner sur les préférences humaines et éviter les résultats indésirables.
RFT(Renforcement Fine-Tuning) — Optimisation via des signaux de récompense : vérification basée sur le code (RLVR) ou par un juge LLM (RLAIF). Idéal pour améliorer l'exactitude des faits ou la qualité subjective.
Multi-turn apprentissage par renforcement(Apprentissage Multi-Turn par renforcement) — Formez les agents à des tâches agentiques en plusieurs étapes dans un contexte croissant.
Personnalisation continue(Personnalisation continue) — Enchaînez plusieurs techniques de manière séquentielle (par exemple, SFT → DPO → RLVR). Nécessite le type d'entraînement LoRa.
Chaque technique peut être combinée avec un type d'entraînement LoRa ou FFT. Voir Types de formation pour plus de détails sur la façon de choisir entre eux.