

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Kontinuierliche Anpassung
<a name="customizing-models-continuous"></a>

Bei der ** kontinuierlichen Anpassung ** können Sie auf einem zuvor angepassten Modell aufbauen, indem Sie zusätzliche Schulungen durchführen — entweder mit einer * anderen Technik * oder mit * derselben Technik * mit neuen Daten. Beginnen Sie beispielsweise mit [ SFT, um Fachwissen ](customizing-models-sft.md) zu vermitteln, wenden Sie dann [ DPO an, ](customizing-models-dpo.md) um es an den Benutzerpräferenzen auszurichten, und wenden Sie dann [ RLVR an, um die sachliche Genauigkeit ](customizing-models-rft.md) zu verbessern.

**Wichtig**  
Kontinuierliche Anpassung unterscheidet sich von [Multi-turn verstärkendes Lernen](model-customize-mtrl.md) MTRL (Reinforcement Learning). Multi-Turn Kontinuierliche Anpassung verbindet Trainingsjobs mit verschiedenen Techniken. MTRL schult Agenten im Rahmen eines einzigen Schulungsauftrags für Aufgaben, bei denen Werkzeuge in mehreren Schritten eingesetzt werden müssen.

## Funktionsweise
<a name="continuous-how-it-works"></a>
+ [Lädt ](customizing-models-lora.md) LoRa-Adaptergewichte aus einem früheren Trainingsjob
+ Setzt den Optimierer, den Scheduler und den Schrittzähler zurück (neues Training mit neuer Technik oder Daten)
+ Die Ausgabe des vorherigen Jobs wird zum Ausgangspunkt für den neuen Trainingslauf

**Anmerkung**  
Kontinuierliche Anpassungen sind derzeit über die [ MTRL ](model-customize-mtrl.md) und Workflows zur kontinuierlichen Anpassung nur über das Python SDK möglich. Es wird mit dem [ LoRa-Trainingstyp ](customizing-models-lora.md) unterstützt. Eine kontinuierliche Anpassung verschiedener Techniken mit [ FFT ](customizing-models-fft.md) wird nicht unterstützt.

## Unterstützte Technikübergänge
<a name="continuous-supported-transitions"></a>

Die folgende Tabelle zeigt alle unterstützten Kombinationen für die kontinuierliche Anpassung:


| Aus der Technik | Zur Technik | Unterstützt | 
| --- | --- | --- | 
| SFT | DPO | ✓ | 
| SFT | RLVR | ✓ | 
| SFT | RALIF | ✓ | 
| SFT | SFT (neue Daten) | ✓ | 
| SFT | MTRL | ✓ | 
| DPO | DPO (neue Daten) | ✓ | 
| DPO | RLVR | ✓ | 
| DPO | RALIF | ✓ | 
| DPO | SFT | ✓ | 
| RLVR | DPO | ✓ | 
| RLVR | RLVR (neue Daten) | ✓ | 
| RLAIF | DPO | ✓ | 
| RLAIF | RLAIF (neue Daten) | ✓ | 

## Kontinuierliche Anpassung im Vergleich zur Wiederaufnahme des Trainings
<a name="continuous-vs-resume"></a>


|  | Kontinuierliche Anpassung | Schulung wieder aufnehmen | 
| --- | --- | --- | 
| Technik  | Andere oder gleiche Technik | Nur dieselbe Technik | 
| Status des Optimierers  | Zurücksetzen (Neustart) | Vom Checkpoint wiederhergestellt | 
| Anwendungsfall | Kettentechniken (SFT → DPO → RLVR) | Unterbrochenes Training fortsetzen | 
| Art des Trainings  | [Nur LoRa ](customizing-models-lora.md) | [Nur LoRa ](customizing-models-lora.md) | 

## Erste Schritte
<a name="continuous-getting-started"></a>

Kontinuierliche Anpassungen sind über das Python SDK möglich. Geben Sie den Ausgabepfad eines vorherigen Trainingsjobs als den `resume_from_path` für die nächste Technik an.

```
from sagemaker.modules.train import DPOTrainer

# Continue from a previous SFT job with DPO
trainer = DPOTrainer(
    model_id="meta-textgeneration-llama-3-1-8b-instruct",
    train_data="s3://my-bucket/dpo-preferences.jsonl",
    resume_from_path="s3://my-bucket/previous-sft-output/",
    hyperparameters={
        "max_epochs": 2,
        "learning_rate": 1e-5,
        "lora_rank": 16,
    }
)
trainer.train()
```

## Beispiel-Workflows
<a name="continuous-example-workflows"></a>

STF → DPO  
Vermitteln Sie zuerst Fachkenntnisse und orientieren Sie sich dann an den Benutzerpräferenzen

SFT → RLVR  
Bringen Sie zuerst das Aufgabenformat bei und optimieren Sie es dann auf sachliche Richtigkeit

SFT → DPO → RLVR  
Vollständige Pipeline — Wissen → Einstellungen → Genauigkeit

SFT → MTRL  
Vermitteln Sie grundlegende Fähigkeiten und trainieren Sie anschließend für Agentenaufgaben mit mehreren Runden

DPO → DPO (neue Daten)  
Verfeinern Sie Ihre Präferenzen iterativ mit neuen Feedback-Daten