As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Técnicas de personalização
As técnicas de personalização definem como seu modelo aprende com os dados. Cada técnica exige um formato de conjunto de dados diferente e tem seus próprios hiperparâmetros. Escolha com base nos dados que você tem e no comportamento que deseja alcançar.
SFT(Supervisionado Fine-Tuning) — Treine em pares de resposta rápida rotulados. Ideal para ensinar um modelo específico de estilo, formato ou conhecimento de domínio.
DPO(Otimização de preferência direta) — Treine com pares de respostas preferenciais versus rejeitadas. Ideal para se alinhar às preferências humanas e evitar resultados indesejáveis.
RFT(Reforço Fine-Tuning) — Otimize por meio de sinais de recompensa: verificação baseada em código (RLVR) ou um juiz LLM (RLAIF). Ideal para melhorar a precisão factual ou a qualidade subjetiva.
Multi-turn aprendizagem por reforço(Aprendizado por Multi-Turn reforço) — Treine agentes para tarefas agentes de várias etapas com um contexto crescente.
Personalização contínua(Personalização contínua) — Encadeie várias técnicas sequencialmente (por exemplo, SFT → DPO → RLVR). Requer o tipo de treinamento LoRa.
Cada técnica pode ser combinada com o tipo de treinamento LoRa ou FFT. Consulte Tipos de treinamento para obter detalhes sobre como escolher entre eles.