翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
レイヤー 2: 承認された基盤モデルとツールのセット
組織は、生成 AI 導入の初期段階を進むにつれて、すべてのユースケースに効果的に対処できるモデルが 1 つもないことにすぐに気づきます。さまざまなモデルはさまざまなドメインやタスクに優れており、企業は特定のアプリケーションごとに機能、コスト、パフォーマンスのバランスを取る必要があります。この現実により、柔軟で制御された基盤モデルアクセスアプローチの必要性が高まっています。
このセクションは、以下のトピックで構成されます。
モデルの実験とカスタマイズ
Amazon Bedrock は、さまざまな基盤モデルを試すのに役立つように設計されており、スケーラブルな本稼働デプロイをサポートしています。Amazon Bedrock ナレッジベースを使用すると、end-to-endの取得拡張生成 (RAG) ワークフローを構築するためのフルマネージドソリューションを利用できます。Amazon Bedrock は、旅行の予約からインベントリの管理まで、コードなしで複雑なタスクを実行できるマネージドエージェントもサポートしています。Amazon Bedrock はサーバーレスであるため、インフラストラクチャ管理の懸念が軽減され、他の と安全に統合されます AWS のサービス。
さらに、Amazon Bedrock を使用して、独自の専有データを使用して基盤モデルをプライベートにカスタマイズし、組織内のユーザーが安全に利用できるようにします。詳細については、Amazon Bedrock ドキュメントの「モデルをカスタマイズしてユースケースのパフォーマンスを向上させる」を参照してください。アクセス管理のために、 AWS Identity and Access Management (IAM) は Amazon Bedrock と統合されるため、きめ細かなアクセスコントロールを設定できます。コントロールは、どのユーザーが特定のモデルを有効にしてアクセスできるかを決定します。詳細については、このガイドの「レイヤー 3: での生成 AI プラットフォームのセキュリティとガバナンス AWS」を参照してください。
モデル評価
組織が生成 AI プロトタイプから本番稼働に移行するにつれて、基盤モデルの厳格な評価プロセスを確立することが不可欠です。オープンベンチマークはモデルのパフォーマンスに関する一般的なインサイトを提供しますが、特定のエンタープライズニーズに対するモデルの適合性を判断する際に不足することがよくあります。カスタマイズされた評価戦略は、ユーザーが組織の固有の要件に合った最適なモデルを選択するのに役立ちます。
カスタムモデル評価の目的
カスタム評価アプローチは、組織が以下のことを行うのに役立ちます。
-
ビジネス関連のタスクのパフォーマンスを評価する – モデルがエンタープライズユースケースに直接関連するタスクをどの程度適切に処理しているかを評価します。
-
潜在的なバイアスと制限を特定する – モデルがバイアスを示したり失敗したりする可能性のある領域を検出し、モデルが実際のデプロイに適していることを確認できるようにします。
-
モデルを関連するメトリクスと比較する – 組織の優先順位と目標に合ったメトリクスを使用して、さまざまなモデルを比較します。
-
情報に基づいたモデルの選択 — モデルの選択、ファインチューニング、本番環境へのデプロイについて、データ駆動型の意思決定を行います。
モデル評価メトリクスの選択
効果的なモデル評価では、モデルのパフォーマンスを包括的に把握できるさまざまな手法を活用します。これらの手法を使用すると、組織はモデルの技術的精度だけでなく、企業固有のニーズとの整合性も評価できます。モデルを評価するには、定量的メトリクスと定性的メトリクスを組み合わせて、パフォーマンスを判断し、バイアスを特定し、モデルを選択します。組織は、グラウンドトゥルースベースのメトリクス (参照データを含む) と柔軟なメトリクス (参照データを含まない) の両方を使用して、モデルの適合性を包括的に把握する必要があります。AI では、グラウンドトゥルースとは、モデル評価に使用できるように、モデルトレーニング中に事実に基づいて保留されるデータを指します。
参照データが存在する場合は、グラウンドトゥルースベースのメトリクスを使用します。これらのメトリクスは、具体的で定量的評価を提供します。一方、グラウンドトゥルースのない手法は柔軟性を提供します。これらの手法は、事前定義された正しい回答が利用できない場合でも、読みやすさや完全性などのディメンションでモデルを評価するのに役立ちます。
グラウンドトゥルースデータに基づくメトリクス
参照データが利用可能な場合、グラウンドトゥルースベースのメトリクスは定量的評価を提供できます。以下のメトリクスは、定量的パフォーマンス評価を提供します。
-
ROUGE-L スコア – ROUGE-L とも呼ばれる最長共通サブシーケンス (LCS) のギスト評価 (ROUGE) のための再現指向の研究中では、生成されたテキストと参照テキストの間の最長共通サブシーケンスを測定します。メトリクスは、コヒーレンスとコンテンツの重複を評価します。
-
コサイン類似度 – このメトリクスは、テキスト間のセマンティック類似度を評価します。モデルのコンテキスト理解に関するインサイトを提供します。
-
METEOR スコア – 明示的な順序付け (METEOR) スコアリングによる翻訳の評価メトリクスは、単語の整列とセマンティックマッチングを組み合わせて、コンテンツの精度と意味のバランスが取れた評価を提供します。
-
二項類似性 – このメトリクスは完全一致をチェックするため、コマンド生成などの正確な出力を必要とするタスクに特に役立ちます。
-
LLM-as-a-judge スコア – このメトリクスは、別の大規模言語モデル (LLM) を使用して、定義されたスケールで類似性を評価します。品質の微妙な評価を提供します。
Amazon SageMaker Clarify と Amazon Bedrock には、モデルの評価に役立つ機能が含まれています。モデル評価ジョブを自動化して、モデルリスクと応答品質を定量化できます。詳細については、「モデルのバイアスの評価、説明、検出」および「Amazon Bedrock リソースのパフォーマンスの評価」を参照してください。
グラウンドトゥルースデータのないメトリクス
参照データが利用できない場合、または補完的なアプローチとして、LLM-as-a-judge 手法を使用できます。別のモデルを使用して、ビジネスにとって重要なディメンションに基づいて生成 AI ソリューションの出力を評価します。この手法により、さまざまなモデル品質を柔軟に評価できます。詳細については、Amazon Bedrock ドキュメントの「別の LLM を審査員として使用してモデルのパフォーマンスを評価する」を参照してください。
計算されたメトリクスを使用すると、検索拡張生成 (RAG) システムがデータソースから関連情報をどの程度効果的に取得するか、生成されたレスポンスが質問への回答にどの程度効果的であるかを評価できます。RAG 評価の結果を使って、さまざまな Amazon Bedrock ナレッジベースとその他の RAG ソースを比較し、アプリケーションに最適なナレッジベースまたは RAG システムを選択できます。詳細については、Amazon Bedrock ドキュメントの「RAG ソースのパフォーマンスを評価する」を参照してください。
実際のモデル評価手法
企業のニーズをモデル機能と効果的に一致させるには、堅牢な一連の評価基準を使用してモデル評価プロセスを指示します。これらの基準は、正確性と完全性から事実性や機密データ処理まで、さまざまな優先順位を対象としています。各基準は、実用的なインサイトを提供するための特定の手法と一致しています。たとえば、事実の精度が重要な場合、ROUGE-L スコアやコサイン類似度などのメトリクスは、具体的で定量化可能なベンチマークを提供します。逆に、LLM-as-a-judge などの手法を使用して、読みやすさと鮮度を評価します。これらの手法は、組織の標準に合わせた柔軟で定性的なインサイトを提供します。モデルを評価するための主要なディメンションは次のとおりです。
-
正確性 – 提供された情報の精度を検証します
-
完全性 – レスポンスの深さとカバレッジを検証します
-
読みやすさ – 明確さと理解のしやすさを評価します
-
情報の鮮度 – コンテンツが関連性があり、最新であることを確認します
-
機密データの抑制 — 機密情報の適切な処理をチェックする
-
精度 – 事実情報との整合性を測定します。
-
一貫性 – 論理的なフローと一貫性を検証します
-
事実 — コンテンツの真実性を検証する
-
包括性 – カバレッジの範囲と完全性を評価します。
これらの明確な基準にモデル評価手法を固定することで、特定の目的でモデルを徹底的に検証できます。この構造化されたアプローチは、企業目標、コンプライアンス要件、ユーザーの期待にモデルを一致させます。また、生成 AI アプリケーションを本番環境に大規模にデプロイするための強力な基盤も構築されています。
実装に関する推奨事項
効果的な基盤モデル戦略を確立するには、次の推奨事項を考慮してください。
-
明確な役割、責任、意思決定プロセスを持つモデルガバナンス委員会を編成します。
-
組織全体で使用できるようになる前に、基盤モデルを評価するための評価基準とスコアリングメカニズムを開発します。
-
最大の基盤モデルは、必ずしもユースケースに最適なモデルではないことに注意してください。最上位モデルを使用してproof-of-conceptの開発を開始し、ビジネス価値を検証してから、より小さなモデルを体系的に評価してコストを最適化します。
-
推論レイテンシー、スループット、エラー率、推論あたりのコストなどの主要なメトリクスを追跡するダッシュボードを開発します。
-
実験プロセスや評価基準など、ユースケースに適したモデルを選択する方法について、チームに明確なガイダンスを提供します。