Entrar em Contato

Programa do Curso

1. Introdução ao Aprendizado por Reforço Profundo

  • O que é Aprendizado por Reforço?
  • Diferenças entre Aprendizado Supervisionado, Não Supervisionado e por Reforço
  • Aplicações do DRL em 2025 (robótica, saúde, finanças, logística)
  • Compreensão do ciclo de interação entre agente e ambiente

2. Fundamentos do Aprendizado por Reforço

  • Processos de Decisão de Markov (MDP)
  • Funções de Estado, Ação, Recompensa, Política e Valor
  • Compromisso entre exploração e explotação
  • Métodos de Monte Carlo e Aprendizado por Diferença Temporal (TD)

3. Implementação de Algoritmos Básicos de RL

  • Métodos tabulares: Programação Dinâmica, Avaliação e Iteração de Políticas
  • Q-Learning e SARSA
  • Exploração epsilon-greedy e estratégias de decaimento
  • Implementação de ambientes RL com OpenAI Gymnasium

4. Transição para o Aprendizado por Reforço Profundo

  • Limitações dos métodos tabulares
  • Utilização de redes neurais para aproximação de funções
  • Arquitetura e fluxo de trabalho da Deep Q-Network (DQN)
  • Replay de experiências e redes alvo (target networks)

5. Algoritmos Avançados de DRL

  • Double DQN, Dueling DQN e Prioritized Experience Replay
  • Métodos de Gradiente de Política: algoritmo REINFORCE
  • Arquiteturas Actor-Critic (A2C, A3C)
  • Otimização de Política Próxima (PPO)
  • Soft Actor-Critic (SAC)

6. Trabalhando com Espaços de Ação Contínuos

  • Desafios no controle contínuo
  • Utilização do DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Ferramentas e Frameworks Práticos

  • Utilização do Stable-Baselines3 e Ray RLlib
  • Log e monitoramento com TensorBoard
  • Ajuste de hiperparâmetros para modelos DRL

8. Engenharia de Recompensas e Design de Ambiente

  • Modelagem de recompensas e balanceamento de penalidades
  • Conceitos de transferência de aprendizado Sim-to-Real (simulação para o mundo real)
  • Criação de ambientes personalizados no Gymnasium

9. Ambientes Parcialmente Observáveis e Generalização

  • Lidar com informações de estado incompletas (POMDPs)
  • Abordagens baseadas em memória usando LSTMs e RNNs
  • Melhoria da robustez e generalização do agente

10. Teoria dos Jogos e Aprendizado por Reforço Multiagente

  • Introdução a ambientes multiagentes
  • Cooperação versus competição
  • Aplicações em treinamento adversarial e otimização de estratégias

11. Estudos de Caso e Aplicações no Mundo Real

  • Simulações de direção autônoma
  • Precificação dinâmica e estratégias de negociação financeira
  • Robótica e automação industrial

12. Diagnóstico de Problemas e Otimização

  • Diagnosticar treinamento instável
  • Gerenciar esparsidade de recompensas e sobreajuste (overfitting)
  • Escalonamento de modelos DRL em GPUs e sistemas distribuídos

13. Resumo e Próximos Passos

  • Revisão da arquitetura DRL e dos principais algoritmos
  • Tendências do setor e direções de pesquisa (por exemplo, RLHF, modelos híbridos)
  • Recursos adicionais e materiais de leitura

Requisitos

  • Proficiência em programação Python
  • Compreensão de Cálculo e Álgebra Linear
  • Conhecimento básico de Probabilidade e Estatística
  • Experiência na construção de modelos de aprendizado de máquina utilizando Python e NumPy ou TensorFlow/PyTorch

Público-Alvo

  • Desenvolvedores interessados em IA e sistemas inteligentes
  • Cientistas de Dados explorando frameworks de aprendizado por reforço
  • Engenheiros de Machine Learning que trabalham com sistemas autônomos
 21 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (3)

Próximas Formações Provisórias

Categorias Relacionadas