Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Infraestrutura como Código do EXO
- Visão geral dos padrões de implantação do EXO: nó único, multinode e clusters RDMA
- Automatização da instalação de dependências (Xcode, uv, Node.js, Rust) com gerenciamento de configuração
- Uso de flakes do Nix para builds reproduzíveis do EXO e ambientes de desenvolvimento
- Escrita de playbooks Ansible ou scripts shell para provisionamento não supervisionado de clusters
Builds Reproduzíveis e Integração com CI
- Fixação de dependências e build do dashboard em pipelines de CI
- Execução de testes de fumaça (smoke tests) do EXO em corredores do GitHub Actions ou GitLab CI
- Criação de imagens base (golden images) e fluxos de reversão baseados em snapshots para VMs macOS e Linux
- Versionamento de cartões de modelo personalizados junto com o código do aplicativo
Descoberta de Cluster e Automação de Rede
- Configuração de mDNS e DNS estático para uma descoberta confiável de nós libp2p
- Automação da criação de perfis de rede e gerenciamento do bridge Thunderbolt no macOS
- Uso de namespaces personalizados (EXO_LIBP2P_NAMESPACE) para separar clusters de dev, staging e prod
- Regras de firewall e segmentação de rede para ambientes multi-inquilinos
Gerenciamento do Ciclo de Vida de Armazenamento e Modelos
- Predesigno das estratégias EXO_MODELS_DIRS e EXO_MODELS_READ_ONLY_DIRS
- Montagem de compartilhamentos NFS ou SAN como repositórios de modelos somente leitura para provisionamento rápido
- Coleção de lixo de caches desatualizados e políticas de retenção de pesos versionados
- Automatização do pré-download de modelos e verificações de saúde antes de atualizações em rolling update
Monitoramento e Alertas
- Envio dos logs do EXO para registros centralizados (ELK, Loki ou Splunk)
- Criação de dashboards no Grafana a partir da saída EXO_TRACING_ENABLED
- Alertas sobre alterações na adesão ao cluster, eventos de OOM e picos de latência de inferência
- Correlação de telemetria de hardware macmon com regressões de desempenho do modelo
Atualização, Reversão e Recuperação de Desastres
- Ambiente de pré-produção para atualizações do binário EXO em um nó canário antes da implantação geral
- Reversão ao nível do modelo: alternar entre versões quantizadas sem baixar novamente
- Backup e restauração do estado do cluster, namespaces personalizados e pesos em cache
- Documentação de manuais de recuperação para cenários de reconstrução total do cluster
Hardenização de Segurança e Conformidade
- Aplicação de TLS na camada de proxy reverso (nginx, traefik) para o dashboard e API
- Implementação de limitação de taxa de API e whitelist de IPs para endpoints do EXO
- Isolamento de clusters com VLANs e políticas de rede de confiança zero
- Auditoria de acesso e manutenção de um inventário dos modelos e versões implantados
Requisitos
- Experiência com práticas de DevOps (CI/CD, IaC, orquestração de contêineres)
- Familiaridade com administração de sistemas e gerenciamento de pacotes em macOS ou Linux
- Compreensão de conceitos de redes, DNS e armazenamento
Público-Alvo
- Engenheiros de DevOps
- Arquitetos de infraestrutura
- SREs responsáveis por cargas de trabalho de IA on-premise
21 Horas
Testemunhos de Clientes (2)
Craig esteve extremamente envolvido no treinamento, sempre garantindo que estivéssemos atentos, adaptando os exemplos às nossas atividades do dia a dia e sempre fornecendo uma resposta quando solicitado, mesmo que as informações não tivessem sido incluídas na apresentação.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Curso - DevOps Foundation®
Máquina Traduzida
Alto nível de comprometimento e conhecimento do instrutor
Jacek - Softsystem
Curso - DevOps Engineering Foundation (DOEF)®
Máquina Traduzida