View a markdown version of this page

Valutazione dei lotti - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Valutazione dei lotti

La valutazione in batch esegue i valutatori su più sessioni di agenti in un unico processo con orchestrazione lato server. A differenza della valutazione su richiesta, in cui si raccolgono gli intervalli e si chiama personalmente l'API Evaluate, la valutazione in batch gestisce l'individuazione delle sessioni, la raccolta degli intervalli e il punteggio interamente dal lato del servizio. Inviando un lavoro, il servizio elabora tutte le sessioni corrispondenti e restituisce risultati aggregati.

Utilizza la valutazione in batch quando hai bisogno di:

  • Misura una linea di base prima di apportare modifiche al prompt, agli strumenti o al modello del tuo agente.

  • Convalida i miglioramenti confrontando i punteggi prima e dopo una modifica della configurazione.

  • Esegui test di regressione su una serie selezionata di sessioni o scenari.

  • Monitora periodicamente la qualità durante le sessioni di produzione da una finestra temporale specifica.

Come funziona

Un processo di valutazione in batch segue questo flusso:

  1. Si avvia un processo specificando un'origine della sessione (dove trovare le sessioni degli agenti) e una configurazione di valutazione (quali valutatori eseguire). Facoltativamente, fornisci metadati di verità di base per il punteggio basato sui riferimenti.

  2. Il servizio rileva le sessioni dai CloudWatch log in base ai gruppi di log e ai filtri specificati.

  3. Il servizio esegue i valutatori su ogni sessione rilevata. Ogni valutatore assegna un punteggio a ciascuna sessione in modo indipendente. Se viene fornita la verità fondamentale, i valutatori che supportano il punteggio basato sui riferimenti la utilizzano.

  4. Fai un sondaggio per ottenere risultati. Il lavoro passa da PENDING → IN_PROGRESS → COMPLETED (oFAILED). Una volta completata, la risposta include riepiloghi aggregati con punteggi medi per valutatore, conteggi delle sessioni e utilizzo dei token.

  5. Per-session i dettagli sono disponibili nei CloudWatch registri nella posizione specificata nella risposta. outputDataConfig

Confronto con altri tipi di valutazione

Aspetto On-demand Online Archiviazione

Trigger

Caller-initiated, sincrono

Continuo, basato sugli eventi

Caller-initiated, asincrono

Fonte della sessione

Il chiamante fornisce intervalli in linea

Guarda un gruppo di log

Il servizio rileva dai log CloudWatch

Scope

Sessione singola

Tutte le sessioni corrispondono alle regole di campionamento

Sessioni multiple (intervallo di tempo, ID di sessione o gruppo di log completo)

Verità fondamentale

Via evaluationReferenceInputs

Non supportata

Via sessionMetadata con inline ground truth

Risultati

Risposta sincrona

CloudWatch metriche e dashboard

Riepiloghi aggregati con medie per valutatore, più dettagli per sessione in CloudWatch

Caso d’uso

Dev-time controlli a campione, CI/CD

Monitoraggio della produzione

Misurazione, pre/post confronto e test di regressione al basale