Entrar em Contato

Programa do Curso

Infraestrutura como Código do EXO

  • Visão geral dos padrões de implantação do EXO: nó único, multinode e clusters RDMA
  • Automatização da instalação de dependências (Xcode, uv, Node.js, Rust) com gerenciamento de configuração
  • Uso de flakes do Nix para builds reproduzíveis do EXO e ambientes de desenvolvimento
  • Escrita de playbooks Ansible ou scripts shell para provisionamento não supervisionado de clusters

Builds Reproduzíveis e Integração com CI

  • Fixação de dependências e build do dashboard em pipelines de CI
  • Execução de testes de fumaça (smoke tests) do EXO em corredores do GitHub Actions ou GitLab CI
  • Criação de imagens base (golden images) e fluxos de reversão baseados em snapshots para VMs macOS e Linux
  • Versionamento de cartões de modelo personalizados junto com o código do aplicativo

Descoberta de Cluster e Automação de Rede

  • Configuração de mDNS e DNS estático para uma descoberta confiável de nós libp2p
  • Automação da criação de perfis de rede e gerenciamento do bridge Thunderbolt no macOS
  • Uso de namespaces personalizados (EXO_LIBP2P_NAMESPACE) para separar clusters de dev, staging e prod
  • Regras de firewall e segmentação de rede para ambientes multi-inquilinos

Gerenciamento do Ciclo de Vida de Armazenamento e Modelos

  • Predesigno das estratégias EXO_MODELS_DIRS e EXO_MODELS_READ_ONLY_DIRS
  • Montagem de compartilhamentos NFS ou SAN como repositórios de modelos somente leitura para provisionamento rápido
  • Coleção de lixo de caches desatualizados e políticas de retenção de pesos versionados
  • Automatização do pré-download de modelos e verificações de saúde antes de atualizações em rolling update

Monitoramento e Alertas

  • Envio dos logs do EXO para registros centralizados (ELK, Loki ou Splunk)
  • Criação de dashboards no Grafana a partir da saída EXO_TRACING_ENABLED
  • Alertas sobre alterações na adesão ao cluster, eventos de OOM e picos de latência de inferência
  • Correlação de telemetria de hardware macmon com regressões de desempenho do modelo

Atualização, Reversão e Recuperação de Desastres

  • Ambiente de pré-produção para atualizações do binário EXO em um nó canário antes da implantação geral
  • Reversão ao nível do modelo: alternar entre versões quantizadas sem baixar novamente
  • Backup e restauração do estado do cluster, namespaces personalizados e pesos em cache
  • Documentação de manuais de recuperação para cenários de reconstrução total do cluster

Hardenização de Segurança e Conformidade

  • Aplicação de TLS na camada de proxy reverso (nginx, traefik) para o dashboard e API
  • Implementação de limitação de taxa de API e whitelist de IPs para endpoints do EXO
  • Isolamento de clusters com VLANs e políticas de rede de confiança zero
  • Auditoria de acesso e manutenção de um inventário dos modelos e versões implantados

Requisitos

  • Experiência com práticas de DevOps (CI/CD, IaC, orquestração de contêineres)
  • Familiaridade com administração de sistemas e gerenciamento de pacotes em macOS ou Linux
  • Compreensão de conceitos de redes, DNS e armazenamento

Público-Alvo

  • Engenheiros de DevOps
  • Arquitetos de infraestrutura
  • SREs responsáveis por cargas de trabalho de IA on-premise
 21 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (2)

Próximas Formações Provisórias

Categorias Relacionadas