Entrar em Contato

Programa do Curso

Introdução ao Aprendizado por Reforço a partir de Feedback Humano (RLHF)

  • O que é o RLHF e por que é importante.
  • Comparação com métodos de ajuste fino supervisionado.
  • Aplicações do RLHF em sistemas de IA modernos.

Modelagem de Recompensa com Feedback Humano

  • Coleção e estruturação do feedback humano.
  • Construção e treinamento de modelos de recompensa.
  • Avaliação da eficácia dos modelos de recompensa.

Treinamento com Otimização de Política Próxima (PPO)

  • Visão geral dos algoritmos PPO para RLHF.
  • Implementação do PPO com modelos de recompensa.
  • Ajuste iterativo e seguro dos modelos.

Ajuste Fino Prático de Modelos de Linguagem

  • Preparação de conjuntos de dados para fluxos de trabalho de RLHF.
  • Ajuste fino prático de um pequeno LLM (Large Language Model) usando RLHF.
  • Desafios e estratégias de mitigação.

Dimensionamento do RLHF para Sistemas de Produção

  • Considerações sobre infraestrutura e computação.
  • Garantia de qualidade e ciclos de feedback contínuo.
  • Boas práticas para implantação e manutenção.

Considerações Éticas e Mitigação de Vieses

  • Abaordagem de riscos éticos no feedback humano.
  • Estratégias de detecção e correção de vieses.
  • Garantia de alinhamento e saídas seguras.

Estudos de Caso e Exemplos do Mundo Real

  • Estudo de caso: Ajuste fino do ChatGPT com RLHF.
  • Outras implantações bem-sucedidas de RLHF.
  • Lições aprendidas e insights da indústria.

Resumo e Próximos Passos

Requisitos

  • Compreensão dos fundamentos do aprendizado supervisionado e do aprendizado por reforço.
  • Experiência com ajuste fino de modelos e arquiteturas de redes neurais.
  • Familiaridade com programação em Python e frameworks de aprendizado profundo (por exemplo, TensorFlow, PyTorch).

Público-Alvo

  • Engenheiros de aprendizado de máquina.
  • Pesquisadores de IA.
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas