Entrar em Contato

Programa do Curso

1. Introdução ao Aprendizado Profundo por Reforço

  • O que é Aprendizado por Reforço?
  • Diferenças entre Aprendizado Supervisionado, Não Supervisionado e Aprendizado por Reforço
  • Aplicações do DRL em 2025 (robótica, saúde, finanças, logística)
  • Compreendendo o ciclo de interação agente-ambiente

2. Fundamentos do Aprendizado por Reforço

  • Processos de Decisão de Markov (MDP)
  • Estado, Ação, Recompensa, Política e funções de Valor
  • Compromisso entre Exploração e Exploração (Exploration vs. Exploitation)
  • Métodos de Monte Carlo e aprendizagem por Diferença Temporal (TD)

3. Implementando Algoritmos Básicos de RL

  • Métodos tabulares: Programação Dinâmica, Avaliação de Política e Iteração
  • Q-Learning e SARSA
  • Exploração epsilon-greedy e estratégias de decaimento
  • Implementando ambientes de RL com OpenAI Gymnasium

4. Transição para o Aprendizado Profundo por Reforço

  • Limitações dos métodos tabulares
  • Uso de redes neurais para aproximação de funções
  • Arquitetura e fluxo de trabalho da Deep Q-Network (DQN)
  • Replay de experiência e redes alvo

5. Algoritmos Avançados de DRL

  • Double DQN, Dueling DQN e Replay de Experiência Prioritário
  • Métodos de Gradiente de Política: algoritmo REINFORCE
  • Arquiteturas Actor-Critic (A2C, A3C)
  • Otimização de Política Próxima (PPO)
  • Soft Actor-Critic (SAC)

6. Trabalhando com Espaços de Ação Contínuos

  • Desafios no controle contínuo
  • Uso de DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Ferramentas e Frameworks Práticos

  • Uso de Stable-Baselines3 e Ray RLlib
  • Registro e monitoramento com TensorBoard
  • Ajuste de hiperparâmetros para modelos de DRL

8. Engenharia de Recompensas e Design de Ambientes

  • Modelagem de recompensas e balanceamento de penalidades
  • Conceitos de transferência de aprendizado de simulação para o mundo real
  • Criação de ambientes personalizados no Gymnasium

9. Ambientes Parcialmente Observáveis e Generalização

  • Lidando com informações de estado incompletas (POMDPs)
  • Abordagens baseadas em memória usando LSTMs e RNNs
  • Melhorando a robustez e a generalização dos agentes

10. Teoria dos Jogos e Aprendizado por Reforço Multiagente

  • Introdução a ambientes multiagentes
  • Cooperação vs. competição
  • Aplicações em treinamento adversarial e otimização de estratégias

11. Estudos de Caso e Aplicações do Mundo Real

  • Simulações de direção autônoma
  • Precificação dinâmica e estratégias de negociação financeira
  • Robótica e automação industrial

12. Solução de Problemas e Otimização

  • Diagnosticando treinamento instável
  • Gerenciando escassez de recompensas e sobreaprendizado (overfitting)
  • Escalando modelos de DRL em GPUs e sistemas distribuídos

13. Resumo e Próximos Passos

  • Revisão da arquitetura de DRL e algoritmos-chave
  • Tendências da indústria e direções de pesquisa (ex: RLHF, modelos híbridos)
  • Recursos adicionais e materiais de leitura

Requisitos

  • Proficiência em programação Python
  • Conhecimento de Cálculo e Álgebra Linear
  • Conhecimento básico de Probabilidade e Estatística
  • Experiência na construção de modelos de aprendizado de máquina usando Python e NumPy ou TensorFlow/PyTorch

Público-Alvo

  • Desenvolvedores interessados em IA e sistemas inteligentes
  • Cientistas de Dados explorando frameworks de aprendizado por reforço
  • Engenheiros de Aprendizado de Máquina trabalhando com sistemas autônomos
 21 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (3)

Próximas Formações Provisórias

Categorias Relacionadas