Programa do Curso
1. Introdução ao Aprendizado por Reforço Profundo
- O que é Aprendizado por Reforço?
- Diferenças entre Aprendizado Supervisionado, Não Supervisionado e por Reforço
- Aplicações do DRL em 2025 (robótica, saúde, finanças, logística)
- Compreensão do ciclo de interação entre agente e ambiente
2. Fundamentos do Aprendizado por Reforço
- Processos de Decisão de Markov (MDP)
- Funções de Estado, Ação, Recompensa, Política e Valor
- Compromisso entre exploração e explotação
- Métodos de Monte Carlo e Aprendizado por Diferença Temporal (TD)
3. Implementação de Algoritmos Básicos de RL
- Métodos tabulares: Programação Dinâmica, Avaliação e Iteração de Políticas
- Q-Learning e SARSA
- Exploração epsilon-greedy e estratégias de decaimento
- Implementação de ambientes RL com OpenAI Gymnasium
4. Transição para o Aprendizado por Reforço Profundo
- Limitações dos métodos tabulares
- Utilização de redes neurais para aproximação de funções
- Arquitetura e fluxo de trabalho da Deep Q-Network (DQN)
- Replay de experiências e redes alvo (target networks)
5. Algoritmos Avançados de DRL
- Double DQN, Dueling DQN e Prioritized Experience Replay
- Métodos de Gradiente de Política: algoritmo REINFORCE
- Arquiteturas Actor-Critic (A2C, A3C)
- Otimização de Política Próxima (PPO)
- Soft Actor-Critic (SAC)
6. Trabalhando com Espaços de Ação Contínuos
- Desafios no controle contínuo
- Utilização do DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Ferramentas e Frameworks Práticos
- Utilização do Stable-Baselines3 e Ray RLlib
- Log e monitoramento com TensorBoard
- Ajuste de hiperparâmetros para modelos DRL
8. Engenharia de Recompensas e Design de Ambiente
- Modelagem de recompensas e balanceamento de penalidades
- Conceitos de transferência de aprendizado Sim-to-Real (simulação para o mundo real)
- Criação de ambientes personalizados no Gymnasium
9. Ambientes Parcialmente Observáveis e Generalização
- Lidar com informações de estado incompletas (POMDPs)
- Abordagens baseadas em memória usando LSTMs e RNNs
- Melhoria da robustez e generalização do agente
10. Teoria dos Jogos e Aprendizado por Reforço Multiagente
- Introdução a ambientes multiagentes
- Cooperação versus competição
- Aplicações em treinamento adversarial e otimização de estratégias
11. Estudos de Caso e Aplicações no Mundo Real
- Simulações de direção autônoma
- Precificação dinâmica e estratégias de negociação financeira
- Robótica e automação industrial
12. Diagnóstico de Problemas e Otimização
- Diagnosticar treinamento instável
- Gerenciar esparsidade de recompensas e sobreajuste (overfitting)
- Escalonamento de modelos DRL em GPUs e sistemas distribuídos
13. Resumo e Próximos Passos
- Revisão da arquitetura DRL e dos principais algoritmos
- Tendências do setor e direções de pesquisa (por exemplo, RLHF, modelos híbridos)
- Recursos adicionais e materiais de leitura
Requisitos
- Proficiência em programação Python
- Compreensão de Cálculo e Álgebra Linear
- Conhecimento básico de Probabilidade e Estatística
- Experiência na construção de modelos de aprendizado de máquina utilizando Python e NumPy ou TensorFlow/PyTorch
Público-Alvo
- Desenvolvedores interessados em IA e sistemas inteligentes
- Cientistas de Dados explorando frameworks de aprendizado por reforço
- Engenheiros de Machine Learning que trabalham com sistemas autônomos
Testemunhos de Clientes (3)
Gostei muito do final, quando tivemos tempo para brincar com o CHAT GPT. O ambiente não estava configurado da melhor maneira para isso - em vez de uma grande mesa, algumas mesas menores teriam ajudado a formar grupos pequenos e favorecido a brainstorming.
Nola - Laramie County Community College
Curso - Artificial Intelligence (AI) Overview
Máquina Traduzida
Trabalhando a partir de princípios fundamentais de forma focada e avançando para a aplicação de estudos de caso no mesmo dia
Maggie Webb - Department of Jobs, Regions, and Precincts
Curso - Artificial Neural Networks, Machine Learning, Deep Thinking
Máquina Traduzida
Que estava aplicando dados reais de uma empresa. O instrutor teve uma abordagem muito boa, fazendo com que os participantes se envolvessem e competissem.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Curso - Applied AI from Scratch in Python
Máquina Traduzida