Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 14 horas
Programa do Curso
Projetando uma Arquitetura Open AIOps
- Visão geral dos principais componentes em pipelines de AIOps open source
- Fluxo de dados da ingestão ao alerta
- Comparação de ferramentas e estratégia de integração
Coleta e Agregação de Dados
- Ingestão de dados de séries temporais com Prometheus
- Captura de logs com Logstash e Beats
- Normalização de dados para correlação entre fontes
Construindo Dashboards de Observabilidade
- Visualização de métricas com Grafana
- Criação de dashboards no Kibana para análise de logs
- Uso de consultas do Elasticsearch para extrair insights operacionais
Detecção de Anomalias e Previsão de Incidentes
- Exportação de dados de observabilidade para pipelines em Python
- Treinamento de modelos de ML para detecção de valores atípicos e previsões
- Implantação de modelos para inferência ao vivo no pipeline de observabilidade
Alertas e Automação com Ferramentas Open Source
- Criação de regras de alerta no Prometheus e roteamento no Alertmanager
- Disparo de scripts ou fluxos de trabalho de API para resposta automática
- Uso de ferramentas de orquestração open source (ex.: Ansible, Rundeck)
Considerações sobre Integração e Escalabilidade
- Tratamento de ingestão de alto volume e retenção de longo prazo
- Segurança e controle de acesso em pilhas open source
- Escalonamento independente de cada camada: ingestão, processamento, alertas
Aplicações do Mundo Real e Extensões
- Estudos de caso: ajuste de desempenho, prevenção de indisponibilidade e otimização de custos
- Extensão de pipelines com ferramentas de rastreamento ou grafos de serviços
- Boas práticas para execução e manutenção de AIOps em produção
Resumo e Próximos Passos
Requisitos
- Experiência com ferramentas de observabilidade, como Prometheus ou ELK
- Conhecimento prático de Python e fundamentos de aprendizado de máquina
- Entendimento de operações de TI e fluxos de trabalho de alertas
Público-Alvo
- Engenheiros de confiabilidade do site (SREs) de nível avançado
- Engenheiros de dados atuantes em operações
- Líderes de plataforma DevOps e arquitetos de infraestrutura