本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
第 2 层:经批准的基础模型和工具集
随着组织进入生成式人工智能采用的早期阶段,他们很快意识到,没有一个单一的模型可以有效地解决所有用例。不同的模型在不同的领域和任务中表现出色,企业需要平衡每个特定应用程序的能力、成本和性能。这种现实促使人们需要一种灵活但可控的方法来访问基础模型。
模型实验和定制
Amazon Bedrock 旨在帮助您尝试各种基础模型,它支持可扩展的生产部署。借助 Amazon Bedrock 知识库,您可以通过完全托管的解决方案来构建 end-to-end检索增强生成 (RAG) 工作流程。Amazon Bedrock 还支持托管代理,这些代理无需代码即可执行复杂任务,从预订旅行到管理库存。由于它是无服务器的,Amazon Bedrock 减少了基础设施管理方面的担忧,并且可以安全地与其他服务器集成。 AWS 服务
此外,您可以使用 Amazon Bedrock 使用自己的专有数据私下自定义基础模型,并使其安全地提供给组织内的用户。有关更多信息,请参阅 Amazon Bedrock 文档中的自定义模型以提高其针对您的用例的性能。为了进行访问管理, AWS Identity and Access Management (IAM) 与 Amazon Bedrock 集成,因此您可以配置精细的访问控制。这些控件决定了哪些用户可以启用和访问特定模型。有关更多信息,请参阅本指南中的第 3 层:生成式 AI 平台的安全和治理 AWS。
模型评测
随着您的组织从生成式人工智能原型发展到生产,必须为基础模型建立严格的评估流程。尽管开放基准提供了对模型性能的一般见解,但在确定模型是否适合特定企业需求时,它们往往不够完善。量身定制的评估策略可帮助用户选择符合您组织独特要求的最合适的模型。
定制模型评估的目标
自定义评估方法可以帮助组织执行以下操作:
-
评估业务相关任务的绩效 — 评估模型处理与企业用例直接相关的任务的效果。
-
识别潜在的偏见和局限性 — 检测模型可能存在偏差或失败的区域,以便您可以确保模型适合实际部署。
-
将模型与相关指标进行比较 — 使用与您的组织优先事项和目标保持一致的指标来比较不同的模型。
-
做出明智的模型选择 — 就模型选择、微调和部署到生产环境做出数据驱动的决策。
选择模型评估指标
有效的模型评估借鉴了多种技术,这些技术可以提供模型性能的整体视图。借助这些技术,组织不仅可以评估模型的技术准确性,还可以评估其与企业特定需求的一致性。要评估模型,您需要结合定量和定性指标来确定性能、识别偏差并选择模型。Organizations 应同时使用基于真实情况的指标(含参考数据)和灵活的指标(不包括参考数据)来全面了解模型的适用性。在 AI 中,基本真相是指事实数据,在模型训练期间会隐瞒这些数据,以便您可以将其用于模型评估。
如果存在参考数据,则使用基于真实情况的指标。这些指标提供了具体的定量评估。同时,没有事实根据的技术可以提供灵活性。这些技术可以帮助您在可读性和完整性等维度上评估模型,即使没有预定义的正确答案也是如此。
基于实况数据的指标
如果有参考数据,基于真实情况的指标可以提供定量评估。以下指标提供了量化的绩效评估:
-
ROUGE-L 分数 — 针对最长公共子序列 (LCS)(也称为 ROUGE-L)的以召回为导向的研究用于测量生成的文本和参考文本之间的最长公共子序列。该指标评估一致性和内容重叠情况。
-
余弦相似度 — 该指标评估文本之间的语义相似度。它提供了对模型情境理解的见解。
-
METEOR 分数 — 使用显式排序评估翻译的指标 (METEOR) 评分结合了单词对齐和语义匹配,可对内容的准确性和含义进行平衡的评估。
-
二进制相似度 — 该指标检查是否完全匹配,因此对于需要精确输出的任务(例如命令生成)特别有用。
-
LLM-as-a-judge score — 此指标使用另一种大型语言模型 (LLM) 在定义的尺度上对相似度进行评@@ 分。它对质量进行了细致入微的评估。
Amaz SageMaker on Clarify 和 Amazon Bedrock 包含可帮助您评估模型的功能。他们可以自动执行模型评估工作,以便您可以量化模型风险和响应质量。有关更多信息,请参阅评估、解释和检测模型中的偏差和评估 Amazon Bedrock 资源的性能。
没有实况数据的指标
当参考数据不可用时,或者作为一种补充方法,您可以使用该LLM-as-a-judge 技术。它使用单独的模型根据对业务重要的维度来评估生成式人工智能解决方案的输出。该技术为评估各种模型质量提供了灵活性。有关更多信息,请参阅 Amazon Bedrock 文档中的使用另一个 LLM 作为评判来评估模型性能。
您可以使用计算指标来评测检索增强生成(RAG)系统从您的数据来源中检索相关信息的有效性,以及生成的响应在回答问题方面的有效性。利用 RAG 评测结果,您可以比较不同的 Amazon Bedrock 知识库和其他 RAG 来源,然后为您的应用程序选择最合适的知识库或 RAG 系统。有关更多信息,请参阅 Amazon Bedrock 文档中的评估 RAG 源的性能。
实践中的模型评估技术
为了有效地将企业需求与模型功能相匹配,请使用一组强大的评估标准来指导模型评估过程。这些标准涵盖了一系列优先事项,从正确性和完整性到事实性和敏感数据处理。每个标准都与特定的技术保持一致,以提供可行的见解。例如,当事实准确性至关重要时,ROUGE-L 分数或余弦相似度等指标可提供具体、可量化的基准。相反,使用诸如评估可读性和新鲜度 LLM-as-a-judge之类的技巧。这些技术提供了根据组织标准量身定制的灵活、定性的见解。评估模型的关键维度包括:
-
正确性-验证所提供信息的准确性
-
完整性-验证回复的深度和覆盖范围
-
可读性-评估清晰度和易理解性
-
信息的新鲜度-检查内容的相关性和最新性
-
敏感数据抑制-检查机密信息的处理是否正确
-
准确性-衡量与事实信息的一致性
-
连贯性-检查逻辑流程和一致性
-
事实 — 验证内容的真实性
-
全面性 — 评估覆盖范围和全面性
通过将模型评估技术固定在这些明确的标准中,您可以彻底审查模型的特定用途。这种结构化方法使模型与企业目标、合规性要求和用户期望保持一致。它还为在生产环境中大规模部署生成式 AI 应用程序奠定了坚实的基础。
实施建议
要建立有效的基础模型策略,请考虑以下建议:
-
组建一个具有明确角色、职责和决策流程的模范治理委员会。
-
在基础模型可供整个组织使用之前,制定评估标准和评分机制,以评估基础模型。
-
请记住,最大的基础模型不一定总是最适合您的用例的模型。从顶级模型开始 proof-of-concept开发以验证业务价值,然后系统地评估较小的模型以实现成本优化。
-
开发仪表板以跟踪关键指标,例如推理延迟、吞吐量、错误率和每次推理成本。
-
为团队提供有关如何为其用例选择合适模型的明确指导,包括实验过程和评估标准。