Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 21 horas
Programa do Curso
Introdução ao Dimensionamento do Ollama
- Arquitetura do Ollama e considerações de dimensionamento
- Gargalos comuns em implantações de múltiplos usuários
- Boas práticas para preparação da infraestrutura
Alocação de Recursos e Otimização de GPU
- Estratégias eficientes de utilização de CPU/GPU
- Considerações de memória e largura de banda
- Restrições de recursos em nível de container
Implantação com Containers e Kubernetes
- Containerização do Ollama com Docker
- Execução do Ollama em clusters Kubernetes
- Balanceamento de carga e descoberta de serviços
Dimensionamento Automático e Lote (Batching)
- Projeto de políticas de dimensionamento automático (autoscaling) para o Ollama
- Técnicas de inferência em lote para otimização do rendimento
- Compromissos entre latência e rendimento
Otimização de Latência
- Perfilamento de desempenho da inferência
- Estratégias de cache e aquecimento de modelos (model warm-up)
- Redução da sobrecarga de E/S e comunicação
Monitoramento e Observabilidade
- Integração do Prometheus para métricas
- Criação de painéis (dashboards) com Grafana
- Alertas e resposta a incidentes para a infraestrutura do Ollama
Gestão de Custos e Estratégias de Dimensionamento
- Alocação de GPU com foco em custos
- Considerações para implantação em nuvem vs. local (on-premises)
- Estratégias para dimensionamento sustentável
Resumo e Próximos Passos
Requisitos
- Experiência com administração de sistemas Linux
- Compreensão de containerização e orquestração
- Familiaridade com a implantação de modelos de aprendizado de máquina
Público-Alvo
- Engenheiros DevOps
- Equipes de infraestrutura de ML
- Engenheiros de confiabilidade de sites (SREs)