기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
Deadline Cloud에서 vLLM을 사용하여 배치 LLM 추론 실행
GitHub의 vllm_batch 작업 번들
번들은 Deadline Cloud 작업 청킹 기능을 사용하여 프롬프트를 일괄 작업으로 그룹화하고, Open Job Description 단계 환경을 사용하여 작업당 한 번이 아닌 작업자당 한 번 모델을 로드합니다. 자세한 내용은 작업 템플릿에 대한 작업 청킹 단원을 참조하십시오.
이 번들을 실행하려면 NVIDIA GPUs와 최소 32GB RAM이 있는 서비스 관리형 플릿과 CondaPackages 및 CondaChannels 작업 파라미터를 읽는 conda 대기열 환경이 있는 대기열이 필요합니다. 샘플 리포지토리의 job_bundles 디렉터리에서 작업을 제출합니다.
deadline bundle gui-submit vllm_batch
출력을 Deadline Cloud에서 확산 모델을 사용하여 일괄적으로 이미지 생성 번들에 연결하여 생성된 텍스트를 캡션된 이미지로 변환할 수 있습니다.
팜 설정, 입력 형식, 청크 크기 조정 및 결과 보기에 대한 전체 연습은 섹션을 참조하세요vLLM을 사용하여 배치 LLM 추론 실행.