View a markdown version of this page

Mempersiapkan data untuk CPT di Amazon Nova 2 - Amazon Nova

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mempersiapkan data untuk CPT di Amazon Nova 2

CPT di Amazon Nova 2 melatih teks mentah untuk membantu model memperoleh pengetahuan yang lebih dalam tentang domain, terminologi, dan pola penulisan tertentu. Halaman ini menjelaskan format data, fitur yang didukung, batasan, dan praktik terbaik untuk menyiapkan data pelatihan CPT untuk model Amazon Nova 2.

Tip

Untuk memvalidasi format dataset Anda sebelum memulai pekerjaan pelatihan, lihatAlat validasi.

Format data

Kumpulan data pelatihan dan validasi CPT harus berupa file JSONL, di mana setiap baris adalah objek JSON yang berisi satu text bidang dengan nilai string. Entri teks harus berisi konten berkualitas tinggi yang mengalir secara alami yang mewakili domain target.

Wajib. Sebuah string yang berisi konten pelatihan untuk contoh ini.

{"text": "training content"}
catatan

Saat menggunakan datamixing, jalankan pekerjaan pertama dengan. max_steps=2 Ini akan membantu membuat pengoptimalan di cluster untuk akses data dan memvalidasi bahwa semua datamix tersedia.

Sampel masukan

Berikut ini menunjukkan dataset CPT JSONL dasar dengan beberapa sampel teks:

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Fitur yang didukung

Tabel berikut merangkum dukungan fitur untuk CPT di Amazon Nova 2.

Dukungan fitur CPT
Fitur CPT di Amazon Nova 2
Pemahaman teks Didukung pada Nova 2.0 Lite. Lihat General/Text pengertian.
Pemahaman gambar Tidak didukung
Pemahaman video Tidak didukung
Pemahaman dokumen Tidak didukung
Panggilan alat Tidak didukung
Penalaran Tidak didukung

General/Text pengertian

Bagian ini merangkum kendala umum dan praktik terbaik untuk menyiapkan data pelatihan CPT di Amazon Nova 2.

Batasan

Kendala kumpulan data umum
Kendala Rincian
Format kumpulan data JSONL (satu objek JSON per baris) dengan bidang text string.
Modalitas yang didukung Teks saja
Volume data yang disarankan Puluhan miliar token konten khusus domain untuk hasil terbaik.

Praktik terbaik

  • Gunakan konten berkualitas tinggi yang mengalir secara alami yang mewakili domain target Anda.

  • Kualitas data pelatihan adalah faktor penentu yang paling penting untuk keberhasilan pra-pelatihan berkelanjutan. Sementara data CPT sering digambarkan sebagai “tidak berlabel,” bagaimana data disusun, diformat, dan disajikan menentukan apakah model akan memperoleh pengetahuan dan keterampilan yang diperlukan untuk kasus penggunaan bisnis Anda.

  • Setelah CPT, rencanakan untuk menjalankan penyetelan instruksi tambahan (SFT atau RFT) sehingga model dapat menggunakan pengetahuan yang baru diperoleh untuk menyelesaikan tugas yang berguna.

Sampel masukan

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Mempersiapkan dataset bisnis terstruktur untuk CPT

Sebagian besar bisnis memiliki repositori data terstruktur yang kaya: katalog produk, profil pengguna, log transaksi, pengiriman formulir, panggilan API, dan metadata operasional. Sekilas, ini terlihat sangat berbeda dari teks web tidak terstruktur yang biasanya digunakan dalam pra-pelatihan standar.

Untuk belajar secara efektif dari data bisnis terstruktur, pikirkan baik-baik tentang tugas hilir dan rancang presentasi data untuk memaksa model mempelajari hubungan prediktif yang tepat.

Untuk membuka potensi penuh pra-pelatihan berkelanjutan, pertimbangkan:

  • Tugas apa yang harus dilakukan model pada waktu inferensi

  • Informasi apa yang ada dalam data mentah

  • Bagaimana menyusun data itu sehingga model belajar mengekstrak dan memanipulasi informasi dengan benar

Cukup membuang data terstruktur ke dalam pelatihan tidak akan mengajarkan model untuk bernalar tentang hal itu. Secara aktif membentuk presentasi data untuk memandu apa yang dipelajari model.

Data terstruktur untuk CPT dalam literatur

CPT dapat mengemas fakta domain ke dalam model tetapi sering gagal membuat fakta-fakta tersebut dapat diambil dan dapat dimanipulasi ketika input atau tugas bergeser. Eksperimen terkontrol menunjukkan bahwa tanpa augmentasi yang beragam selama pra-pelatihan, model menghafal fakta dengan cara rapuh yang tetap sulit diekstraksi bahkan setelah penyetelan instruksi selanjutnya, dan mereka merekomendasikan untuk menyuntikkan instruksi seperti sinyal di awal pelatihan. Untuk data semi terstruktur, serialisasi acak dan augmentasi lainnya mengurangi kelebihan skema, itulah sebabnya CPT harus disisipkan dengan tugas gaya instruksi daripada dijalankan terlebih dahulu dan IFT nanti. Pekerjaan yang berfokus pada keuangan lebih lanjut menemukan bahwa bersama-sama mencampur data CPT dan instruksi pada waktu batch meningkatkan generalisasi dan mengurangi lupa versus resep berurutan. Laporan teknis Qwen menyatu pada pola yang sama dengan mengintegrasikan data instruksi berkualitas tinggi ke dalam pra-pelatihan itu sendiri, yang meningkatkan pembelajaran konteks dan mempertahankan pengikut instruksi sambil memperoleh pengetahuan domain baru.

Augmentasi data untuk korpus semi terstruktur adalah tuas kunci. CPT sadar grafik sintetis memperluas kumpulan domain kecil menjadi korpus terkait entitas yang secara eksplisit mengajarkan hubungan dan senyawa dengan pengambilan pada waktu inferensi. Joint CPT plus pencampuran instruksi mengungguli saluran berurutan di bidang keuangan dan menyeimbangkan domain dengan data umum menurunkan degradasi pada keterampilan umum. Domain skala yang sangat besar CPT juga dapat mempertahankan kemampuan yang luas dan bahkan memungkinkan pertukaran melalui penggabungan model, namun masih menunjuk pada penyetelan instruksi sebagai langkah penting berikutnya, memperkuat nilai memperkenalkan sinyal instruksi selama CPT.

Menyuntikkan keragaman melalui pengacakan dan pengocokan

Strategi umum yang membantu mengajarkan model secara efektif dari kumpulan data terstruktur dan semi terstruktur adalah dengan mengocokkan urutan bidang dalam kumpulan data, dan bahkan mengeluarkan beberapa kunci secara acak.

Mengacak bidang memaksa model untuk membaca apa arti setiap nilai alih-alih di mana ia muncul dan mempelajari hubungan antara semua bidang. Misalnya, dalam kasus video game yang diposting di toko amazon, ketika “Judul,” “Platform,” “Harga,” “Kondisi,” dan “Edisi” tiba dalam permutasi yang berbeda, model tidak dapat mengandalkan “slot ketiga adalah platform”; itu harus mengikat label ke nilai dan mempelajari hubungan bilateral antara atribut: judul platform, platform harga, kondisi harga. Jadi, misalnya, dapat menyimpulkan kemungkinan platform dari nama game dan harga yang diamati, atau memperkirakan kisaran harga yang masuk akal dengan judul dan platform.

Menjatuhkan kunci secara acak selama serialisasi bertindak seperti penghentian fitur: ini mencegah adaptasi bersama pada satu bidang dan memaksa model untuk memulihkan informasi yang hilang dari bukti yang tersisa. Jika “Platform” tidak ada, model harus mengambilnya dari string judul atau teks kompatibilitas; jika “Harga” disembunyikan, ia harus melakukan triangulasi dari platform, edisi, dan kondisi. Ini membangun simetri (A → B dan B → A), ketahanan terhadap daftar dunia nyata yang berantakan, dan invarian skema ketika bidang hilang, diganti namanya, atau disusun ulang.

Contoh gaya belanja membuatnya konkret. Serialkan item yang sama dengan beberapa cara—"Judul: 'Elden Ring' | Platform: PlayStation 5 | Kondisi: Digunakan — Seperti Baru | Harga: $34,99" dan permutasi seperti “Harga: $34,99 | Judul: 'Elden Ring' | Kondisi: Digunakan—Seperti Baru | Platform: 5"—dan pada beberapa pass jatuhkan “Platform” sambil meninggalkan “Kompatibel dengan PS5" dalam deskripsi. PlayStation Latih tujuan pelengkap seperti memprediksi platform dari {title, price} dan memprediksi bucket harga dari {title, platform}. Karena urutan dan bahkan keberadaan kunci bervariasi, satu-satunya strategi yang stabil adalah mempelajari hubungan sebenarnya antara atribut daripada menghafal template.

Cara data disajikan penting

LLM belajar dengan memprediksi token berikutnya dari apa yang telah mereka lihat. Urutan bidang dan acara yang ditampilkan selama pelatihan menentukan apa yang dapat dipelajari model. Jika format pelatihan cocok dengan tugas sebenarnya, kerugian mendarat pada token keputusan yang tepat. Jika bidang dilempar bersama tanpa struktur, model mempelajari pintasan atau menghafal popularitas dan kemudian gagal ketika diminta untuk memilih di antara opsi.

Tunjukkan situasinya terlebih dahulu, lalu opsi, lalu keputusan. Jika model juga harus belajar tentang hasil atau penjelasan, letakkan setelah keputusan.

Sampel pengepakan untuk CPT

Apa itu pengepakan?

Pengepakan berarti mengisi setiap jendela urutan dalam data pelatihan dengan beberapa contoh utuh sehingga jendela padat dengan token nyata, bukan padding.

Mengapa itu penting

Selama pelatihan, panjang konteks maksimum ditetapkan (misalnya, 8.192 token). Batch dibentuk menjadi [ukuran batch × panjang konteks]. Jika contoh pelatihan lebih pendek dari panjang konteks, posisi yang tersisa diempuk. Padding masih berjalan melalui perhatian dan kernel MLP bahkan jika kerugian ditutupi, jadi komputasi dibayar untuk token yang tidak membawa sinyal pembelajaran.

Bagaimana melakukan pengepakan

Untuk mengemas beberapa sampel, gabungkan beberapa sampel pelatihan dengan pem [DOC] isah di antara mereka (perhatikan spasi sebelum dan sesudah[DOC]), sehingga panjang penuh tetap dalam panjang konteks yang diinginkan.

Contoh dokumen yang dikemas terlihat seperti ini:

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}