View a markdown version of this page

지속적인 사용자 지정 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

지속적인 사용자 지정

지속적인 사용자 지정을 사용하면 다른 기술을 사용하거나 새 데이터를 사용하는 동일한 기술을 사용하여 추가 훈련을 적용하여 이전에 사용자 지정된 모델을 구축할 수 있습니다. 예를 들어 SFT로 시작하여 도메인 지식을 가르친 다음 사용자 기본 설정에 맞게 DPO를 적용한 다음 RLVR을 적용하여 사실적 정확도를 개선합니다.

중요

지속적인 사용자 지정은 MTRL(다중 회전 강화 학습)과 다릅니다. 지속적인 사용자 지정은 여러 기법에 걸쳐 훈련 작업을 연결합니다. MTRL은 단일 훈련 작업 내에서 다단계 도구 사용 작업에 대해 에이전트를 훈련합니다.

작동 방식

  • 이전 훈련 작업에서 LoRA 어댑터 가중치를 로드합니다.

  • 옵티마이저, 스케줄러 및 단계 카운터를 재설정합니다(새로운 기법 또는 데이터로 새로 훈련).

  • 이전 작업의 출력이 새 훈련 실행의 시작점이 됩니다.

참고

지속적 사용자 지정은 현재 Python SDK만 사용하는 MTRL 및 지속적 사용자 지정 워크플로를 통해 사용할 수 있습니다. LoRA 훈련 유형에서 지원됩니다. FFT를 사용한 다양한 기법에 대한 지속적인 사용자 지정은 지원되지 않습니다.

지원되는 기술 전환

다음 표에는 지속적인 사용자 지정을 위해 지원되는 모든 조합이 나와 있습니다.

기법에서 기술을 사용하려면 지원됨
SFTDPO
SFTRLVR
SFTRLAIF
SFTSFT(새 데이터)
SFTMTRL
DPODPO(새 데이터)
DPORLVR
DPORLAIF
DPOSFT
RLVRDPO
RLVRRLVR(새 데이터)
RLAIFDPO
RLAIFRLAIF(새 데이터)

지속적인 사용자 지정과 훈련 재개

지속적인 사용자 지정 훈련 재개
기법 다른 기법 또는 동일한 기법 동일한 기법만
최적화 프로그램 상태 재설정(새로 시작) 체크포인트에서 복원됨
사용 사례: 체인 기법(SFT → DPO → RLVR) 중단된 훈련 계속
훈련 유형 LoRA 전용 LoRA 전용

시작하기

Python SDK를 통해 지속적인 사용자 지정을 사용할 수 있습니다. 다음 기술을 resume_from_path 위한 로 이전 훈련 작업의 출력 경로를 제공합니다.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

워크플로 예제

SFT → DPO

먼저 도메인 지식을 학습한 다음 사용자 기본 설정에 맞게 조정

SFT → RLVR

작업 형식을 먼저 학습한 다음 사실적 정확성을 위해 최적화

SFT → DPO → RLVR

전체 파이프라인 - 지식 → 기본 설정 → 정확도

SFT → MTRL

기본 기능을 학습한 다음 멀티턴 에이전트 작업을 훈련합니다.

DPO → DPO(새 데이터)

새로운 피드백 데이터로 기본 설정을 반복적으로 구체화