Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Techniken zur Anpassung
Anpassungstechniken definieren, wie Ihr Modell aus Daten lernt. Jede Technik erfordert ein anderes Datensatzformat und hat ihre eigenen Hyperparameter. Wählen Sie basierend darauf, welche Daten Sie haben und welches Verhalten Sie erreichen möchten.
SFT(Betreut Fine-Tuning) — Trainiere anhand von beschrifteten Prompt-Response-Paaren. Am besten geeignet, um modellspezifische Kenntnisse in Bezug auf Stil, Format oder Fachgebiet zu vermitteln.
DPO(Direkte Präferenzoptimierung) — Trainieren Sie anhand bevorzugter und abgelehnter Antwortpaare. Ideal, um sich an menschlichen Präferenzen auszurichten und unerwünschte Ergebnisse zu vermeiden.
RFT(Verstärkung Fine-Tuning) — Optimiere mithilfe von Belohnungssignalen: codebasierte Verifizierung (RLVR) oder ein LLM-Judge (RLAIF). Am besten geeignet, um die sachliche Genauigkeit oder die subjektive Qualität zu verbessern.
Multi-turn verstärkendes Lernen(Multi-Turn Reinforcement Learning) — Trainieren Sie Agenten für mehrstufige Agentenaufgaben mit wachsendem Kontext.
Kontinuierliche Anpassung(Kontinuierliche Anpassung) — Verketten Sie mehrere Techniken sequentiell (z. B. SFT → DPO → RLVR). Erfordert den Trainingstyp LoRa.
Jede Technik kann entweder mit dem LoRa - oder FFT FFT-Trainingstyp kombiniert werden. Einzelheiten Arten von Schulungen zur Auswahl zwischen ihnen finden Sie unter.