

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Preparazione dei dati per il CPT su Amazon Nova 2
<a name="nova-data-prep-cpt-2"></a>

Il CPT su Amazon Nova 2 si basa su testo non elaborato per aiutare il modello ad acquisire una conoscenza più approfondita di domini, terminologia e modelli di scrittura specifici. Questa pagina descrive il formato dei dati, le funzionalità supportate, i vincoli e le best practice per la preparazione dei dati di addestramento CPT per i modelli Amazon Nova 2.

**Suggerimento**  
Per convalidare il formato del set di dati prima di iniziare un processo di formazione, consulta. [Strumenti di convalida](nova-data-preparation.md#nova-data-validation-tools)

**Topics**
+ [Formato dei dati](#nova-2-cpt-data-overview)
+ [Ingressi di esempio](#nova-2-cpt-data-examples)
+ [Funzionalità supportate](#nova-2-cpt-supported-features)
+ [General/Text comprensione](#cpt-general-constraints)
+ [Preparazione di set di dati aziendali strutturati per il CPT](#nova-cpt-2-structured-data)
+ [Il modo in cui i dati vengono presentati è importante](#nova-cpt-2-data-presentation)
+ [Esempi di imballaggio per CPT](#nova-cpt-2-packing)

## Formato dei dati
<a name="nova-2-cpt-data-overview"></a>

I set di dati di addestramento e convalida CPT devono essere file JSONL, in cui ogni riga è un oggetto JSON contenente un singolo campo con un valore stringa. `text` Le voci di testo devono contenere contenuti fluidi e di alta qualità che rappresentino il dominio di destinazione.

### testo
<a name="cpt-field-text"></a>

Obbligatorio. Una stringa contenente i contenuti di formazione per questo esempio.

```
{"text": "{{training content}}"}
```

**Nota**  
Quando si utilizza il datamixing, esegui il primo lavoro con. `max_steps=2` Ciò contribuirà a creare ottimizzazioni nel cluster per l'accesso ai dati e a convalidare che tutti i datamix siano disponibili.

## Ingressi di esempio
<a name="nova-2-cpt-data-examples"></a>

Quanto segue mostra un set di dati CPT JSONL di base con più esempi di testo:

```
{"text": "AWS stands for Amazon Web Services"}
{"text": "Amazon SageMaker is a fully managed machine learning service"}
{"text": "Amazon Bedrock is a fully managed service for foundation models"}
```

## Funzionalità supportate
<a name="nova-2-cpt-supported-features"></a>

La tabella seguente riassume il supporto delle funzionalità per CPT su Amazon Nova 2.


**Supporto delle funzionalità CPT**  

| Funzionalità | CPT su Amazon Nova 2 | 
| --- | --- | 
| Comprensione del testo | Supportato su Nova 2.0 Lite. Consulta [General/Text comprensione](#cpt-general-constraints). | 
| Comprensione delle immagini | Non supportata | 
| Comprensione dei video | Non supportata | 
| Comprensione dei documenti | Non supportata | 
| Chiamata tramite strumenti | Non supportata | 
| Ragionamento | Non supportata | 

## General/Text comprensione
<a name="cpt-general-constraints"></a>

Questa sezione riassume i vincoli generali e le best practice per la preparazione dei dati di formazione CPT su Amazon Nova 2.

**Vincoli**


**Vincoli generali dei set di dati**  

| Vincolo | Informazioni | 
| --- | --- | 
| Formato del set di dati | JSONL (un oggetto JSON per riga) con un campo stringa. text | 
| Modalità supportate | Solo testo | 
| Volume di dati consigliato | Decine di miliardi di token di contenuti specifici del dominio per ottenere i migliori risultati. | 

**Best practice**
+ Utilizza contenuti fluidi e di alta qualità che rappresentino il tuo dominio di destinazione.
+ La qualità dei dati di formazione è il fattore determinante più cruciale per il successo della pre-formazione continua. Sebbene i dati CPT siano spesso descritti come «senza etichetta», il modo in cui i dati vengono strutturati, formattati e presentati determina se il modello acquisirà le conoscenze e le competenze richieste per il caso d'uso aziendale.
+ Dopo il CPT, pianificate di eseguire un'ulteriore ottimizzazione delle istruzioni (SFT o RFT) in modo che il modello possa utilizzare le nuove conoscenze acquisite per completare attività utili.

**Esempio di input **

### Text-only campione
<a name="cpt-general-sample"></a>

```
{"text": "AWS stands for Amazon Web Services"}
{"text": "Amazon SageMaker is a fully managed machine learning service"}
{"text": "Amazon Bedrock is a fully managed service for foundation models"}
```

## Preparazione di set di dati aziendali strutturati per il CPT
<a name="nova-cpt-2-structured-data"></a>

La maggior parte delle aziende dispone di ricchi archivi di dati strutturati: cataloghi di prodotti, profili utente, registri delle transazioni, invio di moduli, chiamate API e metadati operativi. A prima vista, questo sembra molto diverso dal testo web non strutturato tipicamente utilizzato nella preformazione standard.

Per imparare in modo efficace dai dati aziendali strutturati, rifletti attentamente sulle attività a valle e progetta la presentazione dei dati in modo da costringere il modello ad apprendere le corrette relazioni predittive.

Per sfruttare appieno il potenziale della formazione preliminare continua, considera:
+ Quali attività deve eseguire il modello al momento dell'inferenza
+ Quali informazioni sono presenti nei dati grezzi
+ Come strutturare i dati in modo che il modello impari a estrarre e manipolare le informazioni correttamente

Il semplice inserimento di dati strutturati nel training non insegnerà al modello a ragionare al riguardo. Modella attivamente la presentazione dei dati per guidare ciò che il modello apprende.

**Dati strutturati per il CPT in letteratura**  
Il CPT può inserire dati di dominio nel modello, ma spesso non riesce a renderli recuperabili e manipolabili quando gli input o le attività cambiano. Gli esperimenti controllati dimostrano che, in assenza di potenziamenti diversificati durante il pretraining, i modelli memorizzano i dati in modi fragili che rimangono difficili da estrarre anche dopo una successiva ottimizzazione delle istruzioni, e raccomandano di iniettare istruzioni come segnali nelle prime fasi dell'addestramento. Per i dati semistrutturati, la serializzazione randomizzata e altri miglioramenti riducono il sovradimensionamento dello schema, motivo per cui il CPT dovrebbe essere intercalato con le attività in stile istruzione anziché essere eseguite prima e IFT successivamente. Un lavoro incentrato sulla finanza ha inoltre rilevato che la combinazione congiunta dei dati CPT e delle istruzioni in batch migliora la generalizzazione e riduce l'oblio rispetto alla ricetta sequenziale. Il rapporto tecnico di Qwen converge sullo stesso modello integrando dati di istruzione di alta qualità nella fase di pre-formazione stessa, il che favorisce l'apprendimento contestuale e preserva il seguito delle istruzioni acquisendo nuove conoscenze di dominio.

L'aumento dei dati per corpora semistrutturati è una leva fondamentale. Il CPT sintetico compatibile con i grafi espande piccoli set di domini in corpora collegati a entità che insegnano esplicitamente relazioni e composti con recupero al momento dell'inferenza. Il CPT congiunto e la combinazione delle istruzioni superano le pipeline sequenziali in ambito finanziario e il bilanciamento con i dati generali riduce il degrado delle competenze generali. Il CPT in un settore su larga scala può inoltre mantenere ampie capacità e persino consentire compromessi mediante la fusione dei modelli, ma indica comunque l'ottimizzazione delle istruzioni come un passo successivo essenziale, rafforzando il valore dell'introduzione di segnali di istruzioni durante il CPT.

**Iniettare la diversità attraverso la randomizzazione e lo shuffling**  
Una strategia generale che aiuta a insegnare il modello in modo efficace a partire dai set di dati strutturati e semistrutturati consiste nel mescolare l'ordine dei campi nei set di dati e persino eliminare casualmente alcune chiavi.

La combinazione dei campi obbliga il modello a leggere il significato di ciascun valore anziché il punto in cui appare e ad apprendere le relazioni tra tutti i campi. Ad esempio, nel caso di un videogioco pubblicato su Amazon Store, quando «Titolo», «Piattaforma», «Prezzo», «Condizione» ed «Edizione» arrivano in diverse permutazioni, il modello non può fare affidamento su «il terzo slot è la piattaforma»; deve associare le etichette ai valori e conoscere le relazioni bilaterali tra gli attributi: titolo ⇄ piattaforma, piattaforma ⇄ prezzo, condizione ⇄ prezzo. Quindi può, ad esempio, dedurre una probabile piattaforma dal nome di un gioco e da un prezzo osservato, o stimare una fascia di prezzo plausibile dati un titolo e una piattaforma.

L'inserimento casuale delle chiavi durante la serializzazione si comporta come una perdita di funzionalità: impedisce il co-adattamento su un campo qualsiasi e obbliga il modello a recuperare le informazioni mancanti dalle prove rimanenti. Se «Platform» è assente, il modello deve selezionarlo dalla stringa del titolo o dal testo di compatibilità; se «Price» è nascosto, deve triangolarlo in base a piattaforma, edizione e condizione. Questo crea simmetria (A→B e B→A), robustezza rispetto agli elenchi disordinati del mondo reale e invarianza dello schema quando i campi mancano, vengono rinominati o riordinati.

Un esempio in stile shopping lo rende concreto. Serializza lo stesso articolo in più modi: «Titolo: 'Elden Ring' \| Piattaforma: PlayStation 5 \| Condizione: usato—Come nuovo \| Prezzo: $34.99" e una permutazione come «Prezzo: $34.99 \| Titolo: 'Elden Ring' \| Condizione: usato—Come nuovo \| Piattaforma: PlayStation 5"—e in alcuni passaggi inserisci «Piattaforma» lasciando «Compatibile con PS5" nella descrizione. Addestra obiettivi complementari come la previsione della piattaforma da {title, price} e la previsione di un bucket di prezzi da {title, platform}. Poiché l'ordine e persino la presenza delle chiavi variano, l'unica strategia stabile consiste nell'apprendere le vere relazioni tra gli attributi piuttosto che memorizzare un modello.

## Il modo in cui i dati vengono presentati è importante
<a name="nova-cpt-2-data-presentation"></a>

Gli LLM imparano prevedendo il prossimo token in base a ciò che hanno già visto. L'ordine dei campi e degli eventi mostrati durante l'addestramento decide cosa può apprendere il modello. Se il formato di addestramento corrisponde all'attività reale, la perdita si ripercuote sui token decisionali esatti. Se i campi vengono raggruppati senza struttura, il modello apprende le scorciatoie o memorizza la popolarità e poi fallisce quando viene chiesto di scegliere tra le opzioni.

Mostra prima la situazione, poi le opzioni, poi la decisione. Se il modello deve anche conoscere i risultati o le spiegazioni, inseriscili dopo la decisione.

## Esempi di imballaggio per CPT
<a name="nova-cpt-2-packing"></a>

**Che cos'è l'imballaggio?**  
Imballare significa riempire ogni finestra della sequenza nei dati di addestramento con più esempi completi in modo che la finestra sia densa di token reali, non di padding.

**Perché è importante**  
Durante l'addestramento, viene impostata una lunghezza massima del contesto (ad esempio, 8.192 token). I batch hanno la forma [dimensione del batch × lunghezza del contesto]. Se un esempio di training è più corto della lunghezza del contesto, le posizioni rimanenti vengono riempite. Il riempimento viene comunque eseguito dai kernel di attenzione e MLP anche se la perdita è mascherata, quindi il calcolo viene pagato per i token privi di segnale di apprendimento.

**Come fare l'imballaggio**  
Per impacchettare più campioni, concatena più campioni di addestramento con un `[DOC]` separatore tra di essi (annota lo spazio prima e dopo`[DOC]`), in modo che l'intera lunghezza rimanga entro la lunghezza del contesto desiderata.

Un esempio di documento compresso ha il seguente aspetto:

```
{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}
```