Entrar em Contato
 Duração 21 horas

Programa do Curso

Introdução ao Dimensionamento do Ollama

  • Arquitetura do Ollama e considerações de dimensionamento
  • Gargalos comuns em implantações de múltiplos usuários
  • Boas práticas para preparação da infraestrutura

Alocação de Recursos e Otimização de GPU

  • Estratégias eficientes de utilização de CPU/GPU
  • Considerações de memória e largura de banda
  • Restrições de recursos em nível de container

Implantação com Containers e Kubernetes

  • Containerização do Ollama com Docker
  • Execução do Ollama em clusters Kubernetes
  • Balanceamento de carga e descoberta de serviços

Dimensionamento Automático e Lote (Batching)

  • Projeto de políticas de dimensionamento automático (autoscaling) para o Ollama
  • Técnicas de inferência em lote para otimização do rendimento
  • Compromissos entre latência e rendimento

Otimização de Latência

  • Perfilamento de desempenho da inferência
  • Estratégias de cache e aquecimento de modelos (model warm-up)
  • Redução da sobrecarga de E/S e comunicação

Monitoramento e Observabilidade

  • Integração do Prometheus para métricas
  • Criação de painéis (dashboards) com Grafana
  • Alertas e resposta a incidentes para a infraestrutura do Ollama

Gestão de Custos e Estratégias de Dimensionamento

  • Alocação de GPU com foco em custos
  • Considerações para implantação em nuvem vs. local (on-premises)
  • Estratégias para dimensionamento sustentável

Resumo e Próximos Passos

Requisitos

  • Experiência com administração de sistemas Linux
  • Compreensão de containerização e orquestração
  • Familiaridade com a implantação de modelos de aprendizado de máquina

Público-Alvo

  • Engenheiros DevOps
  • Equipes de infraestrutura de ML
  • Engenheiros de confiabilidade de sites (SREs)

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas