

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# 지속적인 사용자 지정
<a name="customizing-models-continuous"></a>

**지속적인 사용자 지정**을 사용하면 *다른 기술을* 사용하거나 새 데이터를 사용하는 *동일한 기술을* 사용하여 추가 훈련을 적용하여 이전에 사용자 지정된 모델을 구축할 수 있습니다. 예를 들어 [SFT](customizing-models-sft.md)로 시작하여 도메인 지식을 가르친 다음 사용자 기본 설정에 맞게 [DPO](customizing-models-dpo.md)를 적용한 다음 [RLVR](customizing-models-rft.md)을 적용하여 사실적 정확도를 개선합니다.

**중요**  
지속적인 사용자 지정은 [MTRL](model-customize-mtrl.md)(다중 회전 강화 학습)과 다릅니다. 지속적인 사용자 지정은 여러 기법에 걸쳐 훈련 작업을 연결합니다. MTRL은 단일 훈련 작업 내에서 다단계 도구 사용 작업에 대해 에이전트를 훈련합니다.

## 작동 방식
<a name="continuous-how-it-works"></a>
+ 이전 훈련 작업에서 [LoRA](customizing-models-lora.md) 어댑터 가중치를 로드합니다.
+ 옵티마이저, 스케줄러 및 단계 카운터를 재설정합니다(새로운 기법 또는 데이터로 새로 훈련).
+ 이전 작업의 출력이 새 훈련 실행의 시작점이 됩니다.

**참고**  
지속적 사용자 지정은 현재 Python SDK만 사용하는 [MTRL](model-customize-mtrl.md) 및 지속적 사용자 지정 워크플로를 통해 사용할 수 있습니다. [LoRA](customizing-models-lora.md) 훈련 유형에서 지원됩니다. [FFT](customizing-models-fft.md)를 사용한 다양한 기법에 대한 지속적인 사용자 지정은 지원되지 않습니다.

## 지원되는 기술 전환
<a name="continuous-supported-transitions"></a>

다음 표에는 지속적인 사용자 지정을 위해 지원되는 모든 조합이 나와 있습니다.


| 기법에서 | 기술을 사용하려면 | 지원됨 | 
| --- | --- | --- | 
| SFT | DPO | ✓ | 
| SFT | RLVR | ✓ | 
| SFT | RLAIF | ✓ | 
| SFT | SFT(새 데이터) | ✓ | 
| SFT | MTRL | ✓ | 
| DPO | DPO(새 데이터) | ✓ | 
| DPO | RLVR | ✓ | 
| DPO | RLAIF | ✓ | 
| DPO | SFT | ✓ | 
| RLVR | DPO | ✓ | 
| RLVR | RLVR(새 데이터) | ✓ | 
| RLAIF | DPO | ✓ | 
| RLAIF | RLAIF(새 데이터) | ✓ | 

## 지속적인 사용자 지정과 훈련 재개
<a name="continuous-vs-resume"></a>


|  | 지속적인 사용자 지정 | 훈련 재개 | 
| --- | --- | --- | 
| 기법 | 다른 기법 또는 동일한 기법 | 동일한 기법만 | 
| 최적화 프로그램 상태 | 재설정(새로 시작) | 체크포인트에서 복원됨 | 
| 사용 사례: | 체인 기법(SFT → DPO → RLVR) | 중단된 훈련 계속 | 
| 훈련 유형 | [LoRA](customizing-models-lora.md) 전용 | [LoRA](customizing-models-lora.md) 전용 | 

## 시작하기
<a name="continuous-getting-started"></a>

Python SDK를 통해 지속적인 사용자 지정을 사용할 수 있습니다. 다음 기술을 `resume_from_path` 위한 로 이전 훈련 작업의 출력 경로를 제공합니다.

```
from sagemaker.modules.train import DPOTrainer

# Continue from a previous SFT job with DPO
trainer = DPOTrainer(
    model_id="meta-textgeneration-llama-3-1-8b-instruct",
    train_data="s3://my-bucket/dpo-preferences.jsonl",
    resume_from_path="s3://my-bucket/previous-sft-output/",
    hyperparameters={
        "max_epochs": 2,
        "learning_rate": 1e-5,
        "lora_rank": 16,
    }
)
trainer.train()
```

## 워크플로 예제
<a name="continuous-example-workflows"></a>

SFT → DPO  
먼저 도메인 지식을 학습한 다음 사용자 기본 설정에 맞게 조정

SFT → RLVR  
작업 형식을 먼저 학습한 다음 사실적 정확성을 위해 최적화

SFT → DPO → RLVR  
전체 파이프라인 - 지식 → 기본 설정 → 정확도

SFT → MTRL  
기본 기능을 학습한 다음 멀티턴 에이전트 작업을 훈련합니다.

DPO → DPO(새 데이터)  
새로운 피드백 데이터로 기본 설정을 반복적으로 구체화