

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

# Técnicas de personalização
<a name="customizing-models-techniques"></a>

As técnicas de personalização definem * como * seu modelo aprende com os dados. Cada técnica exige um formato de conjunto de dados diferente e tem seus próprios hiperparâmetros. Escolha com base nos dados que você tem e no comportamento que deseja alcançar.
+ **[SFT](customizing-models-sft.md)**(Supervisionado Fine-Tuning) — Treine em pares de resposta rápida rotulados. Ideal para ensinar um modelo específico de estilo, formato ou conhecimento de domínio.
+ **[DPO](customizing-models-dpo.md)**(Otimização de preferência direta) — Treine com pares de respostas preferenciais versus rejeitadas. Ideal para se alinhar às preferências humanas e evitar resultados indesejáveis.
+ **[RFT](customizing-models-rft.md)**(Reforço Fine-Tuning) — Otimize por meio de sinais de recompensa: verificação baseada em código (**RLVR**) ou um juiz LLM (RLAIF). ** ** Ideal para melhorar a precisão factual ou a qualidade subjetiva.
+ **[Multi-turn aprendizagem por reforço](model-customize-mtrl.md)**(Aprendizado por Multi-Turn reforço) — Treine agentes para tarefas agentes de várias etapas com um contexto crescente.
+ **[Personalização contínua](customizing-models-continuous.md)**(Personalização contínua) — Encadeie várias técnicas sequencialmente (por exemplo, SFT → DPO → RLVR). Requer o tipo [ de ](customizing-models-lora.md) treinamento LoRa.

Cada técnica pode ser combinada com o tipo de [ treinamento [ LoRa ](customizing-models-lora.md) ou ](customizing-models-fft.md) FFT. Consulte [Tipos de treinamento](customizing-models-training-types.md) para obter detalhes sobre como escolher entre eles.