View a markdown version of this page

Deadline Cloud에서 vLLM을 사용하여 배치 LLM 추론 실행 - 기한 클라우드

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Deadline Cloud에서 vLLM을 사용하여 배치 LLM 추론 실행

GitHub의 vllm_batch 작업 번들은 vLLM을 사용하는 프롬프트의 JSONL 파일에서 처리량이 많은 대규모 언어 모델(LLM) 추론을 실행합니다. 작업은 GPU 플릿을 팬아웃하고, 모든 프롬프트는 LLM 응답을 받으며, 집계 단계는 모든 것을 JSONL 파일과 독립형 HTML 뷰어로 패키징합니다. 번들은 콘텐츠 생성, 평가 데이터 세트, 번역, 추출 및 분류와 같은 오프라인의 당혹스러운 병렬 워크로드를 처리합니다.

번들은 Deadline Cloud 작업 청킹 기능을 사용하여 프롬프트를 일괄 작업으로 그룹화하고, Open Job Description 단계 환경을 사용하여 작업당 한 번이 아닌 작업자당 한 번 모델을 로드합니다. 자세한 내용은 작업 템플릿에 대한 작업 청킹 단원을 참조하십시오.

이 번들을 실행하려면 NVIDIA GPUs와 최소 32GB RAM이 있는 서비스 관리형 플릿과 CondaPackagesCondaChannels 작업 파라미터를 읽는 conda 대기열 환경이 있는 대기열이 필요합니다. 샘플 리포지토리의 job_bundles 디렉터리에서 작업을 제출합니다.

deadline bundle gui-submit vllm_batch

출력을 Deadline Cloud에서 확산 모델을 사용하여 일괄적으로 이미지 생성 번들에 연결하여 생성된 텍스트를 캡션된 이미지로 변환할 수 있습니다.

팜 설정, 입력 형식, 청크 크기 조정 및 결과 보기에 대한 전체 연습은 섹션을 참조하세요vLLM을 사용하여 배치 LLM 추론 실행.