Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Introdução ao EXO e Clustering Local de IA
- Visão geral do framework EXO e do ecossistema exo-explore
- Comparação entre inferência centralizada em nuvem versus inferência local distribuída
- Arquitetura: descoberta de dispositivos libp2p, backend MLX, painel e camadas de API
- Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, armazenamento compartilhado
Instalando o EXO no macOS
- Configurando Xcode, Metal ToolChain e pré-requisitos do macOS
- Instalando uv, Node.js e toolchain Rust nightly
- Instalando a versão fixada (pinned) do fork macmon para monitoramento do Apple Silicon
- Clonando o repositório e construindo o painel com npm
- Executando o EXO a partir do código-fonte e verificando o painel em localhost:52415
Instalando o EXO no Linux
- Instalando dependências via apt ou Homebrew no Linux
- Configurando uv, Node.js 18+ e Rust nightly
- Construindo o painel e executando o EXO apenas em modo CPU
- Estrutura de diretórios: caminhos XDG Base Directory para configurações, dados, cache e logs
Descoberta Automática de Dispositivos e Formação do Cluster
- Entendendo a auto-descoberta baseada em libp2p em redes locais
- Configurando namespaces personalizados com EXO_LIBP2P_NAMESPACE para isolamento de cluster
- Verificando o membership dos nós na visualização do cluster no painel
- Lidando com falhas de descoberta e problemas de segmentação de rede
Habilitando RDMA sobre Thunderbolt 5
- Arquitetura RDMA e a alegação de redução de latência de 99%
- Habilitando o RDMA no modo Recovery do macOS com rdma_ctl
- Requisitos de cabo e restrições de topologia de porta no Mac Studio
- Sincronização das versões do macOS em todos os nós do cluster
- Solucionando problemas de descoberta RDMA e configuração DHCP
Implantando Modelos Avançados
- Usando o painel para carregar e fragmentar (shard) modelos DeepSeek v3.1, Qwen3-235B e família Llama
- Visualizando alocações de instância com o endpoint /instance/previews da API
- Criando instâncias de modelo com fragmentação por pipeline ou paralelismo de tensores
- Configurando cartões de modelo personalizados a partir do HuggingFace hub
Monitoramento e Solução de Problemas
- Lendo logs do EXO e entendendo o rastreamento distribuído
- Interpretando a saúde do cluster na visualização do cluster no painel
- Diagnóstico de falhas em nós de worker e comportamento de reconexão
- Usando EXO_TRACING_ENABLED para análise de gargalos de desempenho
Manutenção e Atualização do Cluster
- Atualizando binários do EXO e procedimentos de reconstrução do painel
- Migrando caches de modelos e gerenciando modelos pré-baixados via NFS
- Remoção graciosa de nós e balanceamento de cargas de trabalho
Requisitos
- Compreensão dos fundamentos de rede (IP, sub-rede, firewalls)
- Experiência com administração de linha de comando no macOS ou Linux
- Conhecimento sobre gerenciamento de pacotes Python (pip/uv) e ferramentas Node.js
Público-Alvo
- Administradores de sistemas
- Engenheiros DevOps
- Arquitetos de infraestrutura de IA responsáveis pela implantação de LLMs on-premise
21 Horas