Entrar em Contato

Programa do Curso

Introdução ao Aprendizado por Reforço e à IA Agêntica

  • Tomada de decisões sob incerteza e planejamento sequencial
  • Componentes-chave do RL: agentes, ambientes, estados e recompensas
  • Papel do RL em sistemas de IA adaptativos e agênticos

Processos de Decisão de Markov (MDPs)

  • Definição formal e propriedades dos MDPs
  • Funções de valor, equações de Bellman e programação dinâmica
  • Avaliação, melhoria e iteração de políticas

Aprendizado por Reforço Livre de Modelo

  • Aprendizado Monte Carlo e por Diferença Temporal (TD)
  • Q-learning e SARSA
  • Prática: implementação de métodos tabulares de RL em Python

Aprendizado Profundo por Reforço

  • Combinação de redes neurais com RL para aproximação de funções
  • Redes Q Profundas (DQN) e repetição de experiências
  • Arquiteturas Actor-Critic e gradientes de política
  • Prática: treinamento de um agente usando DQN e PPO com Stable-Baselines3

Estratégias de Exploração e Modelagem de Recompensas

  • Equilíbrio entre exploração e explotação (ε-greedy, UCB, métodos de entropia)
  • Projeto de funções de recompensa e evitação de comportamentos indesejados
  • Modelagem de recompensas e aprendizado por currículo

Temas Avançados em RL e Tomada de Decisões

  • Aprendizado por reforço multiagente e estratégias cooperativas
  • Aprendizado por reforço hierárquico e framework de opções
  • RL offline e aprendizado por imitação para implantação mais segura

Ambientes de Simulação e Avaliação

  • Uso do OpenAI Gym e ambientes personalizados
  • Espaços de ação contínuos vs. discretos
  • Métricas para desempenho, estabilidade e eficiência de amostragem dos agentes

Integração do RL em Sistemas de IA Agêntica

  • Combinação de raciocínio e RL em arquiteturas de agentes híbridas
  • Integração do aprendizado por reforço com agentes que utilizam ferramentas
  • Considerações operacionais para escalonamento e implantação

Projeto Final (Capstone)

  • Projetar e implementar um agente de aprendizado por reforço para uma tarefa simulada
  • Analizar o desempenho do treinamento e otimizar hiperparâmetros
  • Demonstrar comportamento adaptativo e tomada de decisões em um contexto agêntico

Resumo e Próximos Passos

Requisitos

  • Proficiência sólida em programação Python
  • Compreensão sólida dos conceitos de aprendizado de máquina e aprendizado profundo
  • Familiaridade com álgebra linear, probabilidade e métodos básicos de otimização

Público-Alvo

  • Engenheiros de aprendizado por reforço e pesquisadores de IA aplicada
  • Desenvolvedores de robótica e automação
  • Equipes de engenharia trabalhando em sistemas de IA adaptativos e agênticos
 28 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (3)

Próximas Formações Provisórias

Categorias Relacionadas