Programa do Curso
1. Introdução ao Aprendizado Profundo por Reforço
- O que é Aprendizado por Reforço?
- Diferenças entre Aprendizado Supervisionado, Não Supervisionado e Aprendizado por Reforço
- Aplicações do DRL em 2025 (robótica, saúde, finanças, logística)
- Compreendendo o ciclo de interação agente-ambiente
2. Fundamentos do Aprendizado por Reforço
- Processos de Decisão de Markov (MDP)
- Estado, Ação, Recompensa, Política e funções de Valor
- Compromisso entre Exploração e Exploração (Exploration vs. Exploitation)
- Métodos de Monte Carlo e aprendizagem por Diferença Temporal (TD)
3. Implementando Algoritmos Básicos de RL
- Métodos tabulares: Programação Dinâmica, Avaliação de Política e Iteração
- Q-Learning e SARSA
- Exploração epsilon-greedy e estratégias de decaimento
- Implementando ambientes de RL com OpenAI Gymnasium
4. Transição para o Aprendizado Profundo por Reforço
- Limitações dos métodos tabulares
- Uso de redes neurais para aproximação de funções
- Arquitetura e fluxo de trabalho da Deep Q-Network (DQN)
- Replay de experiência e redes alvo
5. Algoritmos Avançados de DRL
- Double DQN, Dueling DQN e Replay de Experiência Prioritário
- Métodos de Gradiente de Política: algoritmo REINFORCE
- Arquiteturas Actor-Critic (A2C, A3C)
- Otimização de Política Próxima (PPO)
- Soft Actor-Critic (SAC)
6. Trabalhando com Espaços de Ação Contínuos
- Desafios no controle contínuo
- Uso de DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Ferramentas e Frameworks Práticos
- Uso de Stable-Baselines3 e Ray RLlib
- Registro e monitoramento com TensorBoard
- Ajuste de hiperparâmetros para modelos de DRL
8. Engenharia de Recompensas e Design de Ambientes
- Modelagem de recompensas e balanceamento de penalidades
- Conceitos de transferência de aprendizado de simulação para o mundo real
- Criação de ambientes personalizados no Gymnasium
9. Ambientes Parcialmente Observáveis e Generalização
- Lidando com informações de estado incompletas (POMDPs)
- Abordagens baseadas em memória usando LSTMs e RNNs
- Melhorando a robustez e a generalização dos agentes
10. Teoria dos Jogos e Aprendizado por Reforço Multiagente
- Introdução a ambientes multiagentes
- Cooperação vs. competição
- Aplicações em treinamento adversarial e otimização de estratégias
11. Estudos de Caso e Aplicações do Mundo Real
- Simulações de direção autônoma
- Precificação dinâmica e estratégias de negociação financeira
- Robótica e automação industrial
12. Solução de Problemas e Otimização
- Diagnosticando treinamento instável
- Gerenciando escassez de recompensas e sobreaprendizado (overfitting)
- Escalando modelos de DRL em GPUs e sistemas distribuídos
13. Resumo e Próximos Passos
- Revisão da arquitetura de DRL e algoritmos-chave
- Tendências da indústria e direções de pesquisa (ex: RLHF, modelos híbridos)
- Recursos adicionais e materiais de leitura
Requisitos
- Proficiência em programação Python
- Conhecimento de Cálculo e Álgebra Linear
- Conhecimento básico de Probabilidade e Estatística
- Experiência na construção de modelos de aprendizado de máquina usando Python e NumPy ou TensorFlow/PyTorch
Público-Alvo
- Desenvolvedores interessados em IA e sistemas inteligentes
- Cientistas de Dados explorando frameworks de aprendizado por reforço
- Engenheiros de Aprendizado de Máquina trabalhando com sistemas autônomos
Testemunhos de Clientes (3)
Gostei muito do final, quando tivemos tempo para brincar com o CHAT GPT. O ambiente não estava configurado da melhor maneira para isso - em vez de uma grande mesa, algumas mesas menores teriam ajudado a formar grupos pequenos e favorecido a brainstorming.
Nola - Laramie County Community College
Curso - Artificial Intelligence (AI) Overview
Máquina Traduzida
Trabalhando a partir de princípios fundamentais de forma focada e avançando para a aplicação de estudos de caso no mesmo dia
Maggie Webb - Department of Jobs, Regions, and Precincts
Curso - Artificial Neural Networks, Machine Learning, Deep Thinking
Máquina Traduzida
Que estava aplicando dados reais de uma empresa. O instrutor teve uma abordagem muito boa, fazendo com que os participantes se envolvessem e competissem.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Curso - Applied AI from Scratch in Python
Máquina Traduzida