

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Kustomisasi berkelanjutan
<a name="customizing-models-continuous"></a>

Dengan kustomisasi ** berkelanjutan**, Anda dapat membangun model yang sebelumnya disesuaikan dengan menerapkan pelatihan tambahan — baik dengan teknik yang * berbeda * atau teknik * yang sama * dengan data baru. Misalnya, mulailah dengan [ SFT ](customizing-models-sft.md) untuk mengajarkan pengetahuan domain, kemudian terapkan [ DPO ](customizing-models-dpo.md) untuk menyelaraskan dengan preferensi pengguna, lalu terapkan [ RLVR ](customizing-models-rft.md) untuk meningkatkan akurasi faktual.

**penting**  
Kustomisasi berkelanjutan berbeda dari [ MTRL ](model-customize-mtrl.md) (Reinfor Multi-Turn cement Learning). Pekerjaan pelatihan rantai kustomisasi berkelanjutan lintas teknik. MTRL melatih agen untuk tugas penggunaan alat multi-langkah dalam satu pekerjaan pelatihan.

## Cara kerjanya
<a name="continuous-how-it-works"></a>
+ Memu [ at bobot ](customizing-models-lora.md) adaptor LoRa dari pekerjaan pelatihan sebelumnya
+ Mengatur ulang pengoptimal, penjadwal, dan penghitung langkah (pelatihan baru dengan teknik atau data baru)
+ Output pekerjaan sebelumnya menjadi titik awal untuk menjalankan pelatihan baru

**catatan**  
Kustomisasi berkelanjutan saat ini tersedia melalui [ MTRL ](model-customize-mtrl.md) dan alur kerja kustomisasi berkelanjutan hanya menggunakan SDK. Python Ini didukung dengan jenis [ pelatihan ](customizing-models-lora.md) LoRa. Kustomisasi berkelanjutan di berbagai teknik dengan [ FFT ](customizing-models-fft.md) tidak didukung.

## Transisi teknik yang didukung
<a name="continuous-supported-transitions"></a>

Tabel berikut menunjukkan semua kombinasi yang didukung untuk penyesuaian berkelanjutan:


| Dari teknik | Untuk teknik | Didukung | 
| --- | --- | --- | 
| SFT | DPO | ✓ | 
| SFT | RLVR | ✓ | 
| SFT | RLAIF | ✓ | 
| SFT | SFT (data baru) | ✓ | 
| SFT | MTRL | ✓ | 
| DPO | DPO (data baru) | ✓ | 
| DPO | RLVR | ✓ | 
| DPO | RLAIF | ✓ | 
| DPO | SFT | ✓ | 
| RLVR | DPO | ✓ | 
| RLVR | RLVR (data baru) | ✓ | 
| RLAIF | DPO | ✓ | 
| RLAIF | RLAIF (data baru) | ✓ | 

## Kustomisasi berkelanjutan vs pelatihan resume
<a name="continuous-vs-resume"></a>


|  | Kustomisasi berkelanjutan | Lanjutkan pelatihan | 
| --- | --- | --- | 
| Teknik  | Teknik yang berbeda atau sama | Teknik yang sama saja | 
| Status pengoptimal  | Setel ulang (awal baru) | Dipulihkan dari pos pemeriksaan | 
| Kasus penggunaan  | Teknik rantai (SFT → DPO → RLVR) | Lanjutkan pelatihan yang terputus | 
| Jenis pelatihan  | [LoRa](customizing-models-lora.md)Hanya LoRa | [LoRa](customizing-models-lora.md)Hanya LoRa | 

## Memulai
<a name="continuous-getting-started"></a>

Kustomisasi berkelanjutan tersedia melalui Python SDK. Berikan jalur keluaran dari pekerjaan pelatihan sebelumnya sebagai teknik berikutnya. `resume_from_path`

```
from sagemaker.modules.train import DPOTrainer

# Continue from a previous SFT job with DPO
trainer = DPOTrainer(
    model_id="meta-textgeneration-llama-3-1-8b-instruct",
    train_data="s3://my-bucket/dpo-preferences.jsonl",
    resume_from_path="s3://my-bucket/previous-sft-output/",
    hyperparameters={
        "max_epochs": 2,
        "learning_rate": 1e-5,
        "lora_rank": 16,
    }
)
trainer.train()
```

## Contoh alur kerja
<a name="continuous-example-workflows"></a>

SFT → DPO  
Ajarkan pengetahuan domain terlebih dahulu, lalu selaraskan dengan preferensi pengguna

SFT → RLVR  
Ajarkan format tugas terlebih dahulu, lalu optimalkan untuk kebenaran faktual

SFT → DPO → RLVR  
Pipa penuh — pengetahuan → preferensi → akurasi

SFT → MTRL  
Ajarkan kemampuan dasar, lalu latih untuk tugas agen multi-putaran

DPO → DPO (data baru)  
Perbaiki preferensi secara berulang dengan data umpan balik baru