Entrar em Contato

Programa do Curso

Introdução ao EXO e Clustering Local de IA

  • Visão geral do framework EXO e do ecossistema exo-explore
  • Comparação entre inferência centralizada em nuvem versus inferência local distribuída
  • Arquitetura: descoberta de dispositivos libp2p, backend MLX, painel e camadas de API
  • Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, armazenamento compartilhado

Instalando o EXO no macOS

  • Configurando Xcode, Metal ToolChain e pré-requisitos do macOS
  • Instalando uv, Node.js e toolchain Rust nightly
  • Instalando a versão fixada (pinned) do fork macmon para monitoramento do Apple Silicon
  • Clonando o repositório e construindo o painel com npm
  • Executando o EXO a partir do código-fonte e verificando o painel em localhost:52415

Instalando o EXO no Linux

  • Instalando dependências via apt ou Homebrew no Linux
  • Configurando uv, Node.js 18+ e Rust nightly
  • Construindo o painel e executando o EXO apenas em modo CPU
  • Estrutura de diretórios: caminhos XDG Base Directory para configurações, dados, cache e logs

Descoberta Automática de Dispositivos e Formação do Cluster

  • Entendendo a auto-descoberta baseada em libp2p em redes locais
  • Configurando namespaces personalizados com EXO_LIBP2P_NAMESPACE para isolamento de cluster
  • Verificando o membership dos nós na visualização do cluster no painel
  • Lidando com falhas de descoberta e problemas de segmentação de rede

Habilitando RDMA sobre Thunderbolt 5

  • Arquitetura RDMA e a alegação de redução de latência de 99%
  • Habilitando o RDMA no modo Recovery do macOS com rdma_ctl
  • Requisitos de cabo e restrições de topologia de porta no Mac Studio
  • Sincronização das versões do macOS em todos os nós do cluster
  • Solucionando problemas de descoberta RDMA e configuração DHCP

Implantando Modelos Avançados

  • Usando o painel para carregar e fragmentar (shard) modelos DeepSeek v3.1, Qwen3-235B e família Llama
  • Visualizando alocações de instância com o endpoint /instance/previews da API
  • Criando instâncias de modelo com fragmentação por pipeline ou paralelismo de tensores
  • Configurando cartões de modelo personalizados a partir do HuggingFace hub

Monitoramento e Solução de Problemas

  • Lendo logs do EXO e entendendo o rastreamento distribuído
  • Interpretando a saúde do cluster na visualização do cluster no painel
  • Diagnóstico de falhas em nós de worker e comportamento de reconexão
  • Usando EXO_TRACING_ENABLED para análise de gargalos de desempenho

Manutenção e Atualização do Cluster

  • Atualizando binários do EXO e procedimentos de reconstrução do painel
  • Migrando caches de modelos e gerenciando modelos pré-baixados via NFS
  • Remoção graciosa de nós e balanceamento de cargas de trabalho

Requisitos

  • Compreensão dos fundamentos de rede (IP, sub-rede, firewalls)
  • Experiência com administração de linha de comando no macOS ou Linux
  • Conhecimento sobre gerenciamento de pacotes Python (pip/uv) e ferramentas Node.js

Público-Alvo

  • Administradores de sistemas
  • Engenheiros DevOps
  • Arquitetos de infraestrutura de IA responsáveis pela implantação de LLMs on-premise
 21 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas