View a markdown version of this page

계층 2: 승인된 파운데이션 모델 및 도구 세트 - AWS 권장 가이드

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

계층 2: 승인된 파운데이션 모델 및 도구 세트

조직이 생성형 AI 채택의 초기 단계를 탐색함에 따라 단일 모델이 모든 사용 사례를 효과적으로 해결할 수 없다는 것을 빠르게 깨닫습니다. 다양한 모델이 다양한 도메인과 작업에서 우수하므로 기업은 각 특정 애플리케이션의 기능, 비용 및 성능의 균형을 맞춰야 합니다. 이러한 현실로 인해 파운데이션 모델 액세스에 유연하지만 제어되는 접근 방식이 필요합니다.

이 섹션은 다음 주제를 포함합니다:

모델 실험 및 사용자 지정

Amazon Bedrock은 다양한 파운데이션 모델을 실험하는 데 도움이 되도록 설계되었으며 확장 가능한 프로덕션 배포를 지원합니다. Amazon Bedrock 지식 기반을 사용하면 end-to-end 검색 증강 생성(RAG) 워크플로를 구축할 수 있는 완전 관리형 솔루션을 사용할 수 있습니다. 또한 Amazon Bedrock은 예약 여행부터 인벤토리 관리에 이르기까지 코드 없이 복잡한 작업을 실행할 수 있는 관리형 에이전트를 지원합니다. 서버리스이므로 Amazon Bedrock은 인프라 관리 문제를 줄이고 다른와 안전하게 통합합니다 AWS 서비스.

또한 Amazon Bedrock을 사용하여 자체 독점 데이터로 파운데이션 모델을 비공개로 사용자 지정하고 조직 내 사용자가 안전하게 사용할 수 있도록 할 수 있습니다. 자세한 내용은 Amazon Bedrock 설명서의 사용 사례의 성능을 개선하도록 모델 사용자 지정을 참조하세요. 액세스 관리를 위해 AWS Identity and Access Management (IAM)는 Amazon Bedrock과 통합되어 세분화된 액세스 제어를 구성할 수 있습니다. 제어는 특정 모델을 활성화하고 액세스할 수 있는 사용자를 결정합니다. 자세한 내용은 이 안내서의 계층 3:의 생성형 AI 플랫폼을 위한 보안 및 거버넌스 AWS 섹션을 참조하세요.

모델 평가

조직이 생성형 AI 프로토타입에서 프로덕션으로 진행함에 따라 파운데이션 모델에 대한 엄격한 평가 프로세스를 수립하는 것이 중요합니다. 개방형 벤치마크는 모델 성능에 대한 일반적인 인사이트를 제공하지만 특정 엔터프라이즈 요구 사항에 대한 모델의 적합성을 결정할 때는 부족한 경우가 많습니다. 맞춤형 평가 전략은 사용자가 조직의 고유한 요구 사항에 맞는 가장 적합한 모델을 선택하는 데 도움이 됩니다.

사용자 지정 모델 평가의 목표

사용자 지정 평가 접근 방식은 조직이 다음을 수행하는 데 도움이 됩니다.

  • 비즈니스 관련 작업의 성능 평가 - 모델이 엔터프라이즈 사용 사례와 직접 관련된 작업을 얼마나 잘 처리하는지 평가합니다.

  • 잠재적 편향 및 제한 식별 - 모델이 편향을 보이거나 실패할 수 있는 영역을 감지하여 모델이 실제 배포에 적합한지 확인할 수 있습니다.

  • 모델과 관련 지표 비교 - 조직의 우선순위와 목표에 맞는 지표를 사용하여 다양한 모델을 비교합니다.

  • 정보에 입각한 모델 선택 - 모델 선택, 미세 조정 및 프로덕션 환경 배포에 대한 데이터 기반 결정을 내립니다.

모델 평가 지표 선택

효과적인 모델 평가는 모델 성능에 대한 전체적인 보기를 제공하는 다양한 기술을 활용합니다. 이러한 기술을 통해 조직은 모델의 기술적 정확도뿐만 아니라 엔터프라이즈별 요구 사항에 부합하는지 평가할 수 있습니다. 모델을 평가하려면 정량적 지표와 정성적 지표를 결합하여 성능을 결정하고 편향을 식별하며 모델을 선택합니다. 조직은 모델 적합성에 대한 포괄적인 보기를 얻기 위해 실측 정보 기반 지표(참조 데이터 포함)와 유연한 지표(참조 데이터 제외)를 모두 사용해야 합니다. AI에서 실측은 사실적이며 모델 평가에 사용할 수 있도록 모델 훈련 중에 보류되는 데이터를 말합니다.

참조 데이터가 있는 경우 실측 정보 기반 지표를 사용합니다. 이러한 지표는 구체적이고 정량적인 평가를 제공합니다. 한편, 실측 정보가 없는 기법은 유연성을 제공할 수 있습니다. 이러한 기법은 미리 정의된 정답을 사용할 수 없는 경우에도 가독성 및 완전성과 같은 차원에서 모델을 평가하는 데 도움이 됩니다.

실측 데이터를 기반으로 한 지표

참조 데이터를 사용할 수 있는 경우 실측 정보 기반 지표는 정량적 평가를 제공할 수 있습니다. 다음 지표는 정량적 성능 평가를 제공합니다.

  • ROUGE-L 점수 - ROUGE-L이라고도 하는 가장 긴 공통 하위 시퀀스(LCS)에 대한 기스팅 평가(ROUGE)를 위한 재현율 중심 과소 조사는 생성된 텍스트와 참조 텍스트 사이의 가장 긴 공통 하위 시퀀스를 측정합니다. 지표는 일관성과 콘텐츠 중복을 평가합니다.

  • 코사인 유사성 -이 지표는 텍스트 간의 의미론적 유사성을 평가합니다. 모델의 컨텍스트 이해에 대한 인사이트를 제공합니다.

  • METEOR 점수 - 명시적 순서 지정(METEOR) 점수로 번역을 평가하기 위한 지표는 단어 정렬과 의미 체계 일치를 결합하여 콘텐츠 정확도와 의미에 대한 균형 잡힌 평가를 제공합니다.

  • 이진 유사성 -이 지표는 정확히 일치하는지 확인하므로 명령 생성과 같이 정확한 출력이 필요한 작업에 특히 유용합니다.

  • LLM-as-a-judge 점수 -이 지표는 또 다른 대규모 언어 모델(LLM)을 사용하여 정의된 규모로 유사성을 평가합니다. 품질에 대한 미묘한 평가를 제공합니다.

Amazon SageMaker Clarify 및 Amazon Bedrock에는 모델을 평가하는 데 도움이 되는 기능이 포함되어 있습니다. 모델 평가 작업을 자동화하여 모델 위험과 응답 품질을 정량화할 수 있습니다. 자세한 내용은 모델의 편향 평가, 설명 및 감지Amazon Bedrock 리소스의 성능 평가를 참조하세요.

실측 데이터가 없는 지표

참조 데이터를 사용할 수 없거나 보완적인 접근 방식으로 LLM-as-a-judge 기술을 사용할 수 있습니다. 별도의 모델을 사용하여 비즈니스에 중요한 차원을 기반으로 생성형 AI 솔루션의 출력을 평가합니다. 이 기법은 다양한 모델 품질을 평가할 수 있는 유연성을 제공합니다. 자세한 내용은 Amazon Bedrock 설명서의 다른 LLM을 판사로 사용하여 모델 성능 평가를 참조하세요.

계산된 지표를 사용하여 검색 증강 생성(RAG) 시스템이 데이터 소스에서 관련 정보를 얼마나 효과적으로 검색하는지, 생성된 응답이 질문에 얼마나 효과적으로 답변하는지 평가할 수 있습니다. RAG 평가 결과를 통해 다양한 Amazon Bedrock 지식 기반과 기타 RAG 소스를 비교한 다음 애플리케이션에 가장 적합한 지식 기반 또는 RAG 시스템을 선택할 수 있습니다. 자세한 내용은 Amazon Bedrock 설명서의 RAG 소스 성능 평가를 참조하세요.

실제 모델 평가 기법

엔터프라이즈 요구 사항을 모델 기능과 효과적으로 일치시키려면 강력한 평가 기준 세트를 사용하여 모델 평가 프로세스를 지시합니다. 이러한 기준은 정확성과 완전성부터 사실성 및 민감한 데이터 처리에 이르기까지 다양한 우선 순위를 다룹니다. 각 기준은 실행 가능한 인사이트를 제공하기 위해 특정 기법에 부합합니다. 예를 들어 사실적 정확도가 중요한 경우 ROUGE-L 점수 또는 코사인 유사성과 같은 지표는 구체적이고 정량화 가능한 벤치마크를 제공합니다. 반대로 LLM-as-a-judge와 같은 기법을 사용하여 가독성과 신선도를 평가합니다. 이러한 기법은 조직 표준에 맞는 유연하고 정성적인 인사이트를 제공합니다. 모델 평가를 위한 주요 차원은 다음과 같습니다.

  • 정확성 - 제공된 정보의 정확성을 검증합니다.

  • 완전성 - 응답의 깊이와 범위를 확인합니다.

  • 가독성 - 명확성과 이해 용이성 평가

  • 정보의 신선도 - 콘텐츠가 관련성이 있고 최신인지 확인합니다.

  • 민감한 데이터 금지 - 기밀 정보의 적절한 처리를 확인합니다.

  • 정확도 - 사실적 정보와의 일치를 측정합니다.

  • 일관성 - 논리적 흐름 및 일관성을 검사합니다.

  • 사실성 - 콘텐츠의 신뢰성을 확인합니다.

  • 포괄성 - 적용 범위의 범위와 철저성을 평가합니다.

이러한 명확한 기준에 모델 평가 기술을 고정하면 특정 목적에 맞게 모델을 철저히 심사할 수 있습니다. 이 구조화된 접근 방식은 모델을 엔터프라이즈 목표, 규정 준수 요구 사항 및 사용자 기대치에 맞게 조정합니다. 또한 프로덕션 환경에서 대규모로 생성형 AI 애플리케이션을 배포하기 위한 강력한 기반을 마련합니다.

구현 권장 사항

효과적인 파운데이션 모델 전략을 수립하려면 다음 권장 사항을 고려하세요.

  • 명확한 역할, 책임 및 의사 결정 프로세스가 있는 모델 거버넌스 위원회를 구성합니다.

  • 파운데이션 모델을 조직 전체에서 사용할 수 있게 되기 전에 파운데이션 모델을 평가하기 위한 평가 기준 및 점수 매기기 메커니즘을 개발합니다.

  • 가장 큰 파운데이션 모델이 항상 사용 사례에 가장 적합한 모델은 아닙니다. 최상위 모델로 proof-of-concept 개발을 시작하여 비즈니스 가치를 검증한 다음 비용 최적화를 위해 소규모 모델을 체계적으로 평가합니다.

  • 추론 지연 시간, 처리량, 오류율, 추론당 비용 등의 주요 지표를 추적하는 대시보드를 개발합니다.

  • 실험 프로세스 및 평가 기준을 포함하여 사용 사례에 적합한 모델을 선택하는 방법에 대한 명확한 지침을 팀에 제공합니다.