Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Capa 2: conjunto aprobado de modelos y herramientas de cimentación
A medida que las organizaciones atraviesan las primeras etapas de la adopción generativa de la IA, se dan cuenta rápidamente de que ningún modelo único puede abordar todos los casos de uso de manera eficaz. Los diferentes modelos se destacan en varios dominios y tareas, y las empresas deben equilibrar la capacidad, el costo y el rendimiento para cada aplicación específica. Esta realidad impulsa la necesidad de un enfoque flexible, pero controlado, para el acceso al modelo básico.
Esta sección contiene los siguientes temas:
Experimentación y personalización de modelos
Amazon Bedrock está diseñado para ayudarlo a experimentar con varios modelos básicos y admite implementaciones de producción escalables. Con las bases de conocimiento de Amazon Bedrock, dispone de una solución totalmente gestionada para crear flujos de trabajo de end-to-end recuperación y generación aumentada (RAG). Amazon Bedrock también es compatible con los agentes gestionados que pueden ejecutar tareas complejas sin necesidad de código, desde la reserva de viajes hasta la gestión del inventario. Como no tiene servidores, Amazon Bedrock reduce los problemas de administración de la infraestructura y se integra de forma segura con otras. Servicios de AWS
Además, puede utilizar Amazon Bedrock para personalizar de forma privada los modelos básicos con sus propios datos patentados y ponerlos a disposición de los usuarios de su organización de forma segura. Para obtener más información, consulte Personalice su modelo para mejorar su rendimiento para su caso de uso en la documentación de Amazon Bedrock. Para la administración de acceso, AWS Identity and Access Management (IAM) se integra con Amazon Bedrock para que pueda configurar un control de acceso detallado. Los controles determinan qué usuarios pueden habilitar modelos específicos y acceder a ellos. Para obtener más información, consulte la sección Capa 3: Seguridad y gobernanza para plataformas de IA generativa en AWS de esta guía.
Evaluación de modelos
A medida que su organización pasa de los prototipos de IA generativos a la producción, es esencial establecer procesos de evaluación rigurosos para los modelos básicos. Si bien los puntos de referencia abiertos ofrecen información general sobre el rendimiento de los modelos, suelen ser insuficientes a la hora de determinar la idoneidad de un modelo para las necesidades empresariales específicas. Las estrategias de evaluación personalizadas ayudan a los usuarios a seleccionar el modelo más adecuado que se ajuste a los requisitos exclusivos de su organización.
Objetivos de la evaluación de modelos personalizados
Un enfoque de evaluación personalizado ayuda a las organizaciones a hacer lo siguiente:
-
Evalúe el rendimiento de las tareas relevantes para la empresa: evalúe qué tan bien los modelos gestionan las tareas directamente relacionadas con los casos de uso empresarial.
-
Identifique los posibles sesgos y limitaciones: detecte las áreas en las que los modelos pueden presentar sesgos o fallar para asegurarse de que el modelo es adecuado para su implementación en el mundo real.
-
Compare los modelos con las métricas relevantes: compare diferentes modelos mediante el uso de métricas que alineen las prioridades y los objetivos de su organización.
-
Realice una selección de modelos informada: tome decisiones basadas en datos sobre la selección, el ajuste y la implementación de los modelos en los entornos de producción.
Elegir las métricas de evaluación del modelo
La evaluación eficaz del modelo se basa en una combinación de técnicas que proporcionan una visión holística del rendimiento del modelo. Con estas técnicas, las organizaciones pueden evaluar no solo la precisión técnica de un modelo, sino también su alineación con las necesidades específicas de la empresa. Para evaluar un modelo, se combinan métricas cuantitativas y cualitativas para determinar el rendimiento, identificar los sesgos y elegir un modelo. Las organizaciones deben utilizar tanto métricas basadas en la verdad básica (con datos de referencia) como métricas flexibles (sin datos de referencia) para obtener una visión integral de la idoneidad del modelo. En la IA, la verdad fundamental se refiere a los datos que están basados en hechos y que se ocultan durante el entrenamiento con el modelo para poder usarlos en la evaluación del modelo.
Utilice métricas basadas en la verdad fundamental si existen datos de referencia. Estas métricas proporcionan evaluaciones cuantitativas concretas. Mientras tanto, las técnicas sin datos fiables pueden ofrecer flexibilidad. Estas técnicas le ayudan a evaluar los modelos en aspectos como la legibilidad y la integridad, incluso cuando no se dispone de respuestas correctas predefinidas.
Métricas basadas en datos reales sobre el terreno
Si hay datos de referencia disponibles, las métricas basadas en la verdad básica pueden proporcionar evaluaciones cuantitativas. Las siguientes métricas proporcionan evaluaciones cuantitativas del rendimiento:
-
Puntuación ROUGE-L: la subsecuencia común más larga (LCS), también conocida como ROUGE-L, es decir, la subsecuencia común más larga (ROUGE-L) orientada al recuerdo, mide la subsecuencia común más larga entre los textos generados y los de referencia. La métrica evalúa la coherencia y la superposición de contenido.
-
Similitud de coseno: esta métrica evalúa la similitud semántica entre textos. Proporciona información sobre la comprensión contextual del modelo.
-
Puntuación METEOR: la puntuación métrica para evaluar la traducción con orden explícito (METEOR) combina la alineación de las palabras y la coincidencia semántica para proporcionar una evaluación equilibrada de la precisión y el significado del contenido.
-
Similitud binaria: esta métrica comprueba las coincidencias exactas, lo que la hace especialmente útil para tareas que requieren resultados precisos, como la generación de comandos.
-
LLM-as-a-judge puntuación: esta métrica utiliza otro modelo de lenguaje amplio (LLM) para evaluar la similitud en una escala definida. Ofrece una evaluación matizada de la calidad.
Amazon SageMaker Clarify y Amazon Bedrock incluyen funciones que le ayudan a evaluar los modelos. Pueden automatizar los trabajos de evaluación de modelos para que pueda cuantificar los riesgos del modelo y la calidad de la respuesta. Para obtener más información, consulte Evaluar, explicar y detectar sesgos en los modelos y Evaluar el rendimiento de los recursos de Amazon Bedrock.
Métricas sin datos fidedignos
Cuando los datos de referencia no estén disponibles, o como enfoque complementario, puede utilizar la LLM-as-a-judge técnica. Utiliza un modelo independiente para evaluar los resultados de una solución de IA generativa en función de las dimensiones que son importantes para la empresa. Esta técnica proporciona flexibilidad para evaluar las distintas calidades del modelo. Para obtener más información, consulte Evaluar el rendimiento de un modelo utilizando otro LLM como juez en la documentación de Amazon Bedrock.
Puede utilizar métricas calculadas para evaluar la eficacia con la que un sistema de generación aumentada por recuperación (RAG) recupera la información relevante de sus orígenes de datos y la eficacia de las respuestas generadas al responder a las preguntas. Los resultados de una evaluación de RAG le permiten comparar diferentes bases de conocimiento de Amazon Bedrock y otros orígenes de RAG y, a continuación, elegir la base de conocimiento o el mejor sistema de RAG para su aplicación. Para obtener más información, consulte Evaluar el rendimiento de las fuentes RAG en la documentación de Amazon Bedrock.
Modele las técnicas de evaluación en la práctica
Para hacer coincidir eficazmente las necesidades de la empresa con las capacidades del modelo, utilice un conjunto sólido de criterios de evaluación para dirigir el proceso de evaluación del modelo. Estos criterios cubren un espectro de prioridades, desde la exactitud y la integridad hasta la objetividad y el manejo de datos confidenciales. Cada criterio se alinea con técnicas específicas para ofrecer información procesable. Por ejemplo, cuando la precisión de los hechos es fundamental, métricas como la puntuación ROUGE-L o la similitud de coseno proporcionan puntos de referencia concretos y cuantificables. Por el contrario, utilice técnicas como la de evaluar la legibilidad y LLM-as-a-judge la frescura. Estas técnicas ofrecen información flexible y cualitativa adaptada a los estándares de la organización. Las dimensiones clave para evaluar los modelos incluyen:
-
Exactitud: valida la precisión de la información proporcionada
-
Integridad: verifica la profundidad y la cobertura de las respuestas
-
Legibilidad: evalúa la claridad y la facilidad de comprensión
-
Actualidad de la información: comprueba que el contenido sea relevante y actual
-
Supresión de datos confidenciales: comprueba el manejo adecuado de la información confidencial
-
Precisión: mide la alineación con la información fáctica
-
Coherencia: examina el flujo lógico y la coherencia
-
Facticidad: verifica la veracidad del contenido
-
Exhaustividad: evalúa el alcance y la minuciosidad de la cobertura
Al basar las técnicas de evaluación de modelos en estos criterios claros, puede examinar minuciosamente los modelos para determinar sus propósitos específicos. Este enfoque estructurado alinea los modelos con los objetivos empresariales, los requisitos de conformidad y las expectativas de los usuarios. También sienta una base sólida para implementar aplicaciones de IA generativa a escala en entornos de producción.
Recomendaciones de implementación
Para establecer una estrategia modelo básica eficaz, tenga en cuenta las siguientes recomendaciones:
-
Forme un comité de gobierno modelo que tenga funciones, responsabilidades y procesos de toma de decisiones claros.
-
Desarrolle criterios de evaluación y mecanismos de puntuación para la evaluación de los modelos básicos antes de que estén disponibles para su uso en toda la organización.
-
Recuerde que el modelo básico más grande no siempre es necesariamente el mejor modelo para su caso de uso. Comience proof-of-concept el desarrollo con modelos de primer nivel para validar el valor empresarial y, a continuación, evalúe sistemáticamente los modelos más pequeños para optimizar los costos.
-
Desarrolle paneles de control para realizar un seguimiento de las métricas clave, como la latencia de inferencia, el rendimiento, las tasas de error y el costo por inferencia.
-
Proporcione una guía clara a los equipos sobre cómo seleccionar el modelo adecuado para su caso de uso, incluidos los procesos de experimentación y los criterios de evaluación.