View a markdown version of this page

Preparación de datos para el CPT en Amazon Nova 2 - Amazon Nova

Preparación de datos para el CPT en Amazon Nova 2

El CPT de Amazon Nova 2 se entrena con texto sin procesar para ayudar al modelo a adquirir un conocimiento más profundo de dominios, terminología y patrones de escritura específicos. En esta página, se describen el formato de los datos, las características compatibles, las restricciones y las prácticas recomendadas para preparar los datos de entrenamiento de CPT para los modelos de Amazon Nova 2.

sugerencia

Para validar el formato de su conjunto de datos antes de iniciar un trabajo de entrenamiento, consulte Herramientas de validación.

Formato de los datos

Los conjuntos de datos de entrenamiento y validación de CPT deben ser archivos JSONL, donde cada línea es un objeto JSON que contiene un solo campo text con un valor de cadena. Las entradas de texto deben incluir contenido fluido y de alta calidad que represente el dominio de destino.

Obligatorio. Una cadena que contiene el contenido de entrenamiento de este ejemplo.

{"text": "training content"}
nota

Cuando utilice la mezcla de datos, ejecute el primer trabajo con max_steps=2. Esto ayudará a crear optimizaciones en el clúster para el acceso a los datos y a validar que todas las mezclas de datos estén disponibles.

Ejemplo de entradas

A continuación, se muestra un conjunto de datos JSONL de CPT básico con varios ejemplos de texto:

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Características admitidas

En la siguiente tabla se resume la compatibilidad de características para CPT en Amazon Nova 2.

Compatibilidad de características de CPT
Característica CPT en Amazon Nova 2
Comprensión de textos Compatible con Nova 2.0 Lite. Consulte Comprensión general/de textos.
Comprensión de imágenes No admitido
Comprensión de videos No admitido
Comprensión de documentos No admitido
Llamada a herramientas No admitido
Razonamiento No admitido

Comprensión general/de textos

En esta sección se resumen las restricciones generales y las prácticas recomendadas para preparar los datos de entrenamiento de CPT en Amazon Nova 2.

Restricciones

Restricciones del conjunto de datos
Restricción Details
Formato de conjuntos de datos JSONL (un objeto JSON por línea) con un campo de cadena text.
Modalidades admitidas Solo texto
Volumen de datos recomendado Decenas de miles de millones de tokens de contenido específico de un dominio para obtener los mejores resultados.

Prácticas recomendadas

  • Utilice contenido fluido y de alta calidad que represente su dominio de destino.

  • La calidad de los datos de entrenamiento es el factor determinante más importante para el éxito del entrenamiento previo continuo. Aunque los datos de CPT se describen a menudo como "sin etiquetar", la forma en que se los estructuran, formatean y presentan determina si el modelo adquirirá los conocimientos y las habilidades necesarios para el caso de uso empresarial.

  • Después de CPT, planifique realizar refinamientos adicionales de instrucciones (SFT o RFT) para que el modelo pueda utilizar los conocimientos recién adquiridos para completar tareas útiles.

Ejemplo de entrada

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Preparación de conjuntos de datos empresariales estructurados para el CPT

La mayoría de las empresas poseen amplios repositorios de datos estructurados: catálogos de productos, perfiles de usuarios, registros de transacciones, envíos de formularios, llamadas a la API y metadatos operativos. A primera vista, su aspecto es muy diferente del texto web no estructurado que se suele utilizar en el entrenamiento previo estándar.

Para aprender eficazmente de los datos empresariales estructurados, piense detenidamente en las tareas descendentes y diseñe la presentación de los datos para obligar al modelo a aprender las relaciones predictivas correctas.

Para aprovechar todo el potencial del entrenamiento previo continuo, tenga en cuenta lo siguiente:

  • Qué tareas debe llevar a cabo el modelo en el momento de la inferencia

  • Qué información está presente en los datos sin procesar

  • Cómo se estructuran los datos para que el modelo aprenda a extraer y manipular la información correctamente

El simple hecho de incluir datos estructurados en el entrenamiento no enseñará al modelo a razonar al respecto. Diseñe activamente la presentación de los datos para guiar lo que aprende el modelo.

Datos estructurados para el CPT en la bibliografía

El CPT puede empaquetar hechos del dominio en el modelo, pero a menudo no logra que esos datos se puedan recuperar o manipular cuando cambian las entradas o las tareas. Los experimentos controlados muestran que, si no se efectúa un aumento de la diversidad durante el entrenamiento previo, los modelos memorizan datos de forma frágil y resulta difícil extraerlos incluso después de ajustar las instrucciones posteriormente, por lo que se recomienda inyectar las instrucciones en forma de señales al principio del entrenamiento. En el caso de los datos semiestructurados, la serialización por asignación al azar y otros aumentos reducen el sobreajuste del esquema, razón por la cual el CPT debería intercalarse con tareas de tipo instructivo en lugar de ejecutarlas primero seguidas de IFT. Un trabajo centrado en las finanzas revela además que la combinación conjunta de los datos de instrucciones y el CPT en trabajos por lotes mejora la generalización y reduce el olvido en comparación con la fórmula secuencial. El informe técnico de Qwen sigue el mismo patrón al integrar datos de instrucciones de alta calidad en el propio entrenamiento previo, lo que impulsa el aprendizaje contextual y conserva el seguimiento de instrucciones mientras se adquieren nuevos conocimientos del dominio.

El aumento de datos para corpus semiestructurados es un factor clave. El CPT basado en grafos sintéticos amplía los conjuntos de dominios pequeños hasta convertirlos en corpus vinculados a entidades que enseñan de forma explícita las relaciones y los compuestos mediante la recuperación en el momento de la inferencia. El CPT conjunto, junto con la combinación de instrucciones, supera a las canalizaciones secuenciales en un dominio de finanzas, mientras que el equilibro del dominio con los datos generales reduce la degradación de las habilidades generales. El CPT de dominio a gran escala también puede retener una amplia capacidad e incluso permitir compensaciones a través de la fusión de modelos, pero se sigue considerando que el ajuste de las instrucciones es el siguiente paso esencial, lo que refuerza el valor de ingresar señales de instrucciones durante el CPT.

Inyección de diversidad mediante la asignación al azar y la mezcla

Una estrategia general que ayuda a enseñar al modelo de manera eficaz a partir de los conjuntos de datos estructurados y semiestructurados consiste en mezclar el orden de los campos de los conjuntos de datos e, incluso, omitir algunas claves de forma aleatoria.

Al mezclar los campos, el modelo debe leer el significado de cada valor en lugar de dónde aparece y aprender las relaciones entre todos los campos. Por ejemplo, en el caso de un videojuego publicado en la tienda de Amazon, cuando “Título”, “Plataforma”, “Precio”, “Estado” y “Edición” aparecen en diferentes combinaciones, el modelo no puede confiar en que “el tercer espacio sea la plataforma”; debe vincular las etiquetas a los valores y aprender las relaciones bilaterales entre los atributos: título ⇄ plataforma, plataforma ⇄ precio, condición ⇄ precio. Por lo tanto, puede, por ejemplo, deducir una plataforma probable a partir del nombre de un juego y un precio observado, o estimar un rango de precios plausible en función de un título y una plataforma.

Si se entregan las claves de forma aleatoria durante la serialización, se produce como si se eliminaran las características: se impide la adaptación simultánea en un campo concreto y se obliga al modelo a recuperar la información que falta a partir de las pruebas restantes. Si no aparece la palabra “Plataforma”, el modelo debe seleccionarla de la cadena de título o del texto de compatibilidad; si “Precio” está oculto, debe separar la plataforma, la edición y el estado. Esto genera simetría (A→B y B→A), robustez ante listados reales desordenados e invariabilidad del esquema cuando faltan campos, se les cambia el nombre o se reordenan.

Un ejemplo de estilo de compra lo concreta. Serialice el mismo objeto de varias formas (“Título: 'Elden Ring' | Plataforma: PlayStation 5 | Estado: Usado, como nuevo | Precio: 34,99 USD” y una permutación como “Precio: 34,99 USD | Título: 'Elden Ring' | Estado: Usado, como nuevo | Plataforma: PlayStation 5”) y, en algunas ocasiones, agregue “Plataforma” y deje “Compatible con PS5” en la descripción. Entrene objetivos complementarios, como predecir la plataforma a partir de {título, precio} y predecir un bucket de precio a partir de {título, plataforma}. Como el orden e incluso la presencia de las claves varían, la única estrategia estable es aprender las verdaderas relaciones entre los atributos en lugar de memorizar una plantilla.

Importancia de la forma en que se presentan los datos

Los LLM aprenden mediante la predicción del siguiente token a partir de lo que ya han visto. El orden de los campos y eventos que se muestran durante el entrenamiento decide lo que el modelo puede aprender. Si el formato de entrenamiento coincide con la tarea real, la pérdida recae en los tokens de decisión exactos. Si los campos se agrupan sin estructura, el modelo aprende los atajos o memoriza su popularidad y, después, falla cuando se le pide que elija entre las opciones.

Muestre primero la situación, después las opciones y, por último, la decisión. Si el modelo también debe conocer los resultados o las explicaciones, colóquelos después de la decisión.

Empaquetado de muestras para el CPT

¿Qué es el empaquetado?

Empaquetar significa llenar cada ventana de secuencia de los datos de entrenamiento con varios ejemplos completos para que la ventana esté llena de tokens reales, no de relleno.

¿Por qué importa?

Durante el entrenamiento, se establece una longitud máxima de contexto (por ejemplo, 8192 tokens). Los lotes tienen la forma de [tamaño del lote × longitud del contexto]. Si un ejemplo de entrenamiento es más corto que la longitud del contexto, las posiciones restantes se rellenan. El relleno se sigue ejecutando en los kernels de atención y MLP, incluso si se oculta la pérdida, por lo que se paga el cálculo por los símbolos que no transmiten ninguna señal de aprendizaje.

¿Cómo se empaqueta?

Para empaquetar varias muestras, concatene varias muestras de entrenamiento con un separador [DOC] entre medio (observe el espacio antes y después de [DOC]) de manera que la longitud total esté por debajo de la longitud de contexto deseada.

Un documento empaquetado de ejemplo tiene el siguiente aspecto:

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}