Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Valutazione dei lotti
La valutazione in batch esegue i valutatori su più sessioni di agenti in un unico processo con orchestrazione lato server. A differenza della valutazione su richiesta, in cui si raccolgono gli intervalli e si chiama personalmente l'API Evaluate, la valutazione in batch gestisce l'individuazione delle sessioni, la raccolta degli intervalli e il punteggio interamente dal lato del servizio. Inviando un lavoro, il servizio elabora tutte le sessioni corrispondenti e restituisce risultati aggregati.
Utilizza la valutazione in batch quando hai bisogno di:
-
Misura una linea di base prima di apportare modifiche al prompt, agli strumenti o al modello del tuo agente.
-
Convalida i miglioramenti confrontando i punteggi prima e dopo una modifica della configurazione.
-
Esegui test di regressione su una serie selezionata di sessioni o scenari.
-
Monitora periodicamente la qualità durante le sessioni di produzione da una finestra temporale specifica.
Come funziona
Un processo di valutazione in batch segue questo flusso:
-
Si avvia un processo specificando un'origine della sessione (dove trovare le sessioni degli agenti) e una configurazione di valutazione (quali valutatori eseguire). Facoltativamente, fornisci metadati di verità di base per il punteggio basato sui riferimenti.
-
Il servizio rileva le sessioni dai CloudWatch log in base ai gruppi di log e ai filtri specificati.
-
Il servizio esegue i valutatori su ogni sessione rilevata. Ogni valutatore assegna un punteggio a ciascuna sessione in modo indipendente. Se viene fornita la verità fondamentale, i valutatori che supportano il punteggio basato sui riferimenti la utilizzano.
-
Fai un sondaggio per ottenere risultati. Il lavoro passa da
PENDING→IN_PROGRESS→COMPLETED(oFAILED). Una volta completata, la risposta include riepiloghi aggregati con punteggi medi per valutatore, conteggi delle sessioni e utilizzo dei token. -
Per-session i dettagli sono disponibili nei CloudWatch registri nella posizione specificata nella risposta.
outputDataConfig
Confronto con altri tipi di valutazione
| Aspetto | On-demand | Online | Archiviazione |
|---|---|---|---|
|
Trigger |
Caller-initiated, sincrono |
Continuo, basato sugli eventi |
Caller-initiated, asincrono |
|
Fonte della sessione |
Il chiamante fornisce intervalli in linea |
Guarda un gruppo di log |
Il servizio rileva dai log CloudWatch |
|
Scope |
Sessione singola |
Tutte le sessioni corrispondono alle regole di campionamento |
Sessioni multiple (intervallo di tempo, ID di sessione o gruppo di log completo) |
|
Verità fondamentale |
Via |
Non supportata |
Via |
|
Risultati |
Risposta sincrona |
CloudWatch metriche e dashboard |
Riepiloghi aggregati con medie per valutatore, più dettagli per sessione in CloudWatch |
|
Caso d’uso |
Dev-time controlli a campione, CI/CD |
Monitoraggio della produzione |
Misurazione, pre/post confronto e test di regressione al basale |