As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Camada 2: conjunto aprovado de modelos e ferramentas de fundação
À medida que as organizações navegam pelos estágios iniciais da adoção generativa da IA, elas rapidamente percebem que nenhum modelo único pode abordar todos os casos de uso de forma eficaz. Modelos diferentes se destacam em vários domínios e tarefas, e as empresas precisam equilibrar capacidade, custo e desempenho para cada aplicativo específico. Essa realidade impulsiona a necessidade de uma abordagem flexível, porém controlada, para o acesso ao modelo básico.
Esta seção contém os seguintes tópicos:
Experimentação e personalização de modelos
O Amazon Bedrock foi projetado para ajudar você a experimentar vários modelos básicos e oferece suporte a implantações de produção escaláveis. Com o Amazon Bedrock Knowledge Bases, você tem uma solução totalmente gerenciada para criar fluxos de trabalho de end-to-end Retrieval Augmented Generation (RAG). O Amazon Bedrock também oferece suporte a agentes gerenciados que podem executar tarefas complexas sem código, desde a reserva de viagens até o gerenciamento de inventário. Por ser sem servidor, o Amazon Bedrock reduz as preocupações com o gerenciamento da infraestrutura e se integra com segurança a outras. Serviços da AWS
Além disso, você pode usar o Amazon Bedrock para personalizar de forma privada os modelos básicos com seus próprios dados proprietários e disponibilizá-los com segurança para os usuários da sua organização. Para obter mais informações, consulte Personalizar seu modelo para melhorar seu desempenho para seu caso de uso na documentação do Amazon Bedrock. Para gerenciamento de acesso, o AWS Identity and Access Management (IAM) se integra ao Amazon Bedrock para que você possa configurar um controle de acesso refinado. Os controles determinam quais usuários podem ativar e acessar modelos específicos. Para obter mais informações, consulte Camada 3: Segurança e governança para plataformas generativas de IA em AWS neste guia.
Avaliação de modelos
À medida que sua organização progride dos protótipos generativos de IA para a produção, é essencial estabelecer processos de avaliação rigorosos para os modelos básicos. Embora os benchmarks abertos ofereçam informações gerais sobre o desempenho do modelo, eles geralmente não conseguem determinar a adequação de um modelo às necessidades específicas da empresa. Estratégias de avaliação personalizadas ajudam os usuários a selecionar o modelo mais adequado que se alinha aos requisitos exclusivos de sua organização.
Objetivos da avaliação do modelo personalizado
Uma abordagem de avaliação personalizada ajuda as organizações a fazer o seguinte:
-
Avalie o desempenho em tarefas relevantes para os negócios — Avalie o quão bem os modelos lidam com tarefas diretamente relacionadas aos casos de uso da sua empresa.
-
Identifique possíveis vieses e limitações — Detecte áreas em que os modelos possam apresentar vieses ou falhar para garantir que o modelo seja adequado para implantação no mundo real.
-
Compare modelos com métricas relevantes — Compare modelos diferentes usando métricas que alinham suas prioridades e objetivos organizacionais.
-
Faça uma seleção informada de modelos — tome decisões baseadas em dados sobre seleção, ajuste fino e implantação de modelos em ambientes de produção.
Escolhendo métricas de avaliação do modelo
A avaliação eficaz do modelo baseia-se em uma combinação de técnicas que fornecem uma visão holística do desempenho do modelo. Com essas técnicas, as organizações podem avaliar não apenas a precisão técnica de um modelo, mas também seu alinhamento com as necessidades específicas da empresa. Para avaliar um modelo, você combina métricas quantitativas e qualitativas para determinar o desempenho, identificar vieses e escolher um modelo. As organizações devem usar métricas baseadas na verdade (com dados de referência) e métricas flexíveis (sem dados de referência) para obter uma visão abrangente da adequação do modelo. Na IA, a verdade fundamental se refere aos dados que são factuais e são retidos durante o treinamento do modelo para que você possa usá-los na avaliação do modelo.
Use métricas baseadas na verdade se existirem dados de referência. Essas métricas fornecem avaliações quantitativas concretas. Enquanto isso, técnicas sem fundamento podem oferecer flexibilidade. Essas técnicas ajudam você a avaliar modelos em dimensões como legibilidade e integridade, mesmo quando respostas corretas predefinidas não estão disponíveis.
Métricas baseadas em dados reais
Se os dados de referência estiverem disponíveis, as métricas baseadas na verdade podem fornecer avaliações quantitativas. As métricas a seguir fornecem avaliações quantitativas de desempenho:
-
Pontuação ROUGE-L — O substituto orientado ao recall para avaliação de gisting (ROUGE) para a subsequência comum mais longa (LCS), também conhecido como ROUGE-L, mede a maior subsequência comum entre textos gerados e de referência. A métrica avalia a coerência e a sobreposição de conteúdo.
-
Similaridade de cosseno — Essa métrica avalia a semelhança semântica entre textos. Ele fornece informações sobre a compreensão contextual do modelo.
-
Pontuação METEOR — A métrica para avaliação da tradução com ordenação explícita (METEOR) combina alinhamento de palavras e correspondência semântica para fornecer uma avaliação equilibrada da precisão e significado do conteúdo.
-
Similaridade binária — Essa métrica verifica as correspondências exatas, tornando-a particularmente útil para tarefas que exigem saídas precisas, como geração de comandos.
-
LLM-as-a-judge pontuação — Essa métrica usa outro modelo de linguagem grande (LLM) para avaliar a similaridade em uma escala definida. Ele oferece uma avaliação diferenciada da qualidade.
O Amazon SageMaker Clarify e o Amazon Bedrock incluem recursos para ajudar você a avaliar modelos. Eles podem automatizar os trabalhos de avaliação do modelo para que você possa quantificar os riscos do modelo e a qualidade da resposta. Para obter mais informações, consulte Avaliar, explicar e detectar viés nos modelos e Avaliar o desempenho dos recursos do Amazon Bedrock.
Métricas sem dados reais básicos
Quando os dados de referência não estão disponíveis ou como uma abordagem complementar, você pode usar a LLM-as-a-judge técnica. Ele usa um modelo separado para avaliar os resultados de uma solução generativa de IA com base em dimensões que são importantes para os negócios. Essa técnica oferece flexibilidade para avaliar várias qualidades do modelo. Para obter mais informações, consulte Avaliar o desempenho do modelo usando outro LLM como juiz na documentação do Amazon Bedrock.
Você pode usar métricas computadas para avaliar a eficácia com que um sistema de geração aumentada via recuperação (RAG) recupera informações relevantes das fontes de dados e a eficácia das respostas geradas para as perguntas. Os resultados de uma avaliação de RAG permitem que você compare diferentes bases de conhecimento do Amazon Bedrock e outras fontes de RAG e, em seguida, escolha a melhor base de conhecimento ou sistema de RAG para sua aplicação. Para obter mais informações, consulte Avaliar o desempenho das fontes de RAG na documentação do Amazon Bedrock.
Técnicas de avaliação de modelos na prática
Para combinar efetivamente as necessidades da empresa com os recursos do modelo, use um conjunto robusto de critérios de avaliação para direcionar o processo de avaliação do modelo. Esses critérios abrangem um espectro de prioridades, desde a exatidão e integridade até a factualidade e o tratamento de dados confidenciais. Cada critério se alinha a técnicas específicas para fornecer insights acionáveis. Por exemplo, quando a precisão factual é crítica, métricas como a pontuação ROUGE-L ou a similaridade do cosseno fornecem referências concretas e quantificáveis. Por outro lado, use técnicas LLM-as-a-judge para avaliar a legibilidade e o frescor. Essas técnicas oferecem insights flexíveis e qualitativos adaptados aos padrões organizacionais. As principais dimensões para avaliar modelos incluem:
-
Exatidão — Valida a precisão das informações fornecidas
-
Integridade — Verifica a profundidade e a cobertura das respostas
-
Legibilidade — avalia a clareza e a facilidade de compreensão
-
Atualidade das informações — Verifica se o conteúdo é relevante e atual
-
Supressão de dados confidenciais — Verifica o manuseio adequado de informações confidenciais
-
Precisão — mede o alinhamento com informações factuais
-
Coerência — examina o fluxo lógico e a consistência
-
Fatualidade — Verifica a veracidade do conteúdo
-
Abrangência — Avalia o escopo e a abrangência da cobertura
Ao ancorar as técnicas de avaliação de modelos nesses critérios claros, você pode examinar minuciosamente os modelos para suas finalidades específicas. Essa abordagem estruturada alinha os modelos às metas corporativas, aos requisitos de conformidade e às expectativas dos usuários. Também estabelece uma base sólida para a implantação de aplicativos generativos de IA em grande escala em ambientes de produção.
Recomendações de implementação
Para estabelecer uma estratégia eficaz de modelo básico, considere as seguintes recomendações:
-
Forme um comitê de governança modelo que tenha funções, responsabilidades e processos de tomada de decisão claros.
-
Desenvolva critérios de avaliação e mecanismos de pontuação para a avaliação dos modelos básicos antes que eles estejam disponíveis para uso em toda a organização.
-
Lembre-se de que o maior modelo básico nem sempre é necessariamente o melhor modelo para seu caso de uso. Comece proof-of-concept o desenvolvimento com modelos de primeira linha para validar o valor comercial e, em seguida, avalie sistematicamente modelos menores para otimização de custos.
-
Desenvolva painéis para monitorar as principais métricas, como latência de inferência, taxa de transferência, taxas de erro e custo por inferência.
-
Forneça orientações claras às equipes sobre como selecionar o modelo certo para seu caso de uso, incluindo processos de experimentação e critérios de avaliação.