

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Valutazione dei lotti
<a name="batch-evaluations"></a>

La valutazione in batch esegue i valutatori su più sessioni di agenti in un unico processo con orchestrazione lato server. A differenza della valutazione su richiesta, in cui si raccolgono gli intervalli e si chiama personalmente l'API Evaluate, la valutazione in batch gestisce l'individuazione delle sessioni, la raccolta degli intervalli e il punteggio interamente dal lato del servizio. Inviando un lavoro, il servizio elabora tutte le sessioni corrispondenti e restituisce risultati aggregati.

Utilizza la valutazione in batch quando hai bisogno di:
+  **Misura una linea ** di base prima di apportare modifiche al prompt, agli strumenti o al modello del tuo agente.
+  **Convalida i miglioramenti ** confrontando i punteggi prima e dopo una modifica della configurazione.
+  **Esegui test di regressione ** su una serie selezionata di sessioni o scenari.
+  **Monitora periodicamente la qualità ** durante le sessioni di produzione da una finestra temporale specifica.

<a name="batch-evaluations-how-it-works"></a> **Come funziona** 

Un processo di valutazione in batch segue questo flusso:

1.  **Si avvia un processo ** specificando un'origine della sessione (dove trovare le sessioni degli agenti) e una configurazione di valutazione (quali valutatori eseguire). Facoltativamente, fornisci metadati di verità di base per il punteggio basato sui riferimenti.

1.  **Il servizio rileva le sessioni ** dai CloudWatch log in base ai gruppi di log e ai filtri specificati.

1.  **Il servizio esegue i ** valutatori su ogni sessione rilevata. Ogni valutatore assegna un punteggio a ciascuna sessione in modo indipendente. Se viene fornita la verità fondamentale, i valutatori che supportano il punteggio basato sui riferimenti la utilizzano.

1.  **Fai un sondaggio per ottenere risultati. ** Il lavoro passa da `PENDING` → `IN_PROGRESS` → `COMPLETED` (o`FAILED`). Una volta completata, la risposta include riepiloghi aggregati con punteggi medi per valutatore, conteggi delle sessioni e utilizzo dei token.

1.  **Per-session i dettagli ** sono disponibili nei CloudWatch registri nella posizione specificata nella risposta. `outputDataConfig`

<a name="batch-evaluations-comparison"></a> **Confronto con altri tipi di valutazione ** 


| Aspetto | On-demand | Online | Archiviazione | 
| --- | --- | --- | --- | 
| Trigger | Caller-initiated, sincrono | Continuo, basato sugli eventi | Caller-initiated, asincrono | 
| Fonte della sessione | Il chiamante fornisce intervalli in linea | Guarda un gruppo di log | Il servizio rileva dai log CloudWatch  | 
| Scope | Sessione singola | Tutte le sessioni corrispondono alle regole di campionamento | Sessioni multiple (intervallo di tempo, ID di sessione o gruppo di log completo) | 
| Verità fondamentale | Via `evaluationReferenceInputs`  | Non supportata | Via `sessionMetadata` con inline ground truth | 
| Risultati | Risposta sincrona | CloudWatch metriche e dashboard | Riepiloghi aggregati con medie per valutatore, più dettagli per sessione in CloudWatch | 
| Caso d’uso | Dev-time controlli a campione, CI/CD | Monitoraggio della produzione | Misurazione, pre/post confronto e test di regressione al basale | 

**Topics**
+ [Prerequisiti](batch-evaluations-prereqs.md)
+ [Guida introduttiva alla valutazione dei batch](batch-evaluations-getting-started.md)
+ [Avvia la valutazione in batch](batch-evaluations-start.md)
+ [Ottieni i risultati della valutazione in batch](batch-evaluations-get.md)
+ [Elenca le valutazioni in batch](batch-evaluations-list.md)
+ [Interrompi la valutazione dei batch](batch-evaluations-stop.md)
+ [Eliminare la valutazione in batch](batch-evaluations-delete.md)
+ [Comprensione dei risultati e degli output](batch-evaluations-results.md)
+ [Crittografia di valutazione batch](batch-evaluations-encryption.md)