Entrar em Contato

Programa do Curso

O Cenário da Observabilidade com IA

  • Dos painéis às conversações: a mudança para uma observabilidade aumentada por IA
  • Capacidades de LLM relevantes para observabilidade: resumo, raciocínio e correspondência de padrões
  • Padrões de arquitetura: incorporação de IA em pilhas de observabilidade existentes

Consulta de Telemetria em Linguagem Natural

  • Texto para PromQL: traduzindo linguagem natural em consultas de monitoramento
  • Consultas em NL para lojas de logs Elasticsearch, OpenSearch e Loki
  • Geração de SQL a partir de linguagem natural para telemetria estruturada
  • Construção de um agente assistente de consulta com uso de ferramentas e consciência contextual

Análise de Logs Alimentada por LLM

  • Parseamento e estruturação automatizados de logs com LLMs
  • Detecção de anomalias em fluxos de logs usando similaridade de embeddings
  • Agrupamento de logs e descoberta de padrões em larga escala
  • Geração de explicações legíveis por humanos a partir de sequências de logs brutas

Alertas Inteligentes e Enriquecimento de Incidentes

  • Correlação e deduplicação de alertas com compreensão semântica
  • Coleta automatizada de contexto de incidentes a partir de manuais de procedimento, incidentes anteriores e documentação
  • Roteamento inteligente de alertas baseado na compreensão do conteúdo e na expertise da equipe
  • Redução da fadiga de alertas com redução de ruído baseada em IA

Análise de Causa Raiz Assistida por IA

  • Geração de hipóteses a partir da correlação de telemetria multifonte
  • Cadeia de evidências: conectando sintomas entre métricas, logs e rastros
  • Troca guiada com sessões interativas de diagnóstico por IA
  • Construção de um agente de análise de causa raiz com investigação progressiva

Resposta Automatizada a Incidentes e Comunicação

  • Geração de resumos de incidentes e atualizações de status a partir de telemetria
  • Rascunho automatizado de postmortem com reconstrução da linha do tempo
  • Comunicação com partes interessadas adaptada para públicos técnicos e executivos
  • Sugestão de manuais de procedimento e recomendações de remediation automatizadas

ML para Observabilidade

  • Previsão de séries temporais para planejamento de capacidade e previsão de anomalias
  • Modelos fundamentais para detecção de anomalias em zero-shot em métricas
  • Mapeamento de dependência de serviços baseado em embeddings e descoberta de topologia
  • Treinamento e implantação de modelos de ML leves junto aos pipelines de observabilidade

Implantação em Produção e Ética

  • Considerações de latência e custo para observabilidade de IA em tempo real
  • Privacidade de dados: garantindo que LLMs não vazem telemetria sensível
  • Sobreposição humana: quando o diagnóstico de IA precisa de validação pelo operador
  • Avaliação de impacto: MTTD, MTTR e métricas da experiência de plantão

Requisitos

  • Experiência com ferramentas de observabilidade como Prometheus, Grafana, Datadog ou OpenTelemetry.
  • Conhecimento familiar sobre conceitos de gestão de registros e métricas.
  • Roteiro básico em Python para processamento de dados.

Público-Alvo

  • Engenheiros de SRE e observabilidade adotando ferramentas aprimoradas por IA.
  • Engenheiros de plataforma construindo pipelines de monitoramento de próxima geração.
  • Líderes de DevOps avaliando a integração de LLM em fluxos de trabalho de incidentes.
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas