Entrar em Contato

Programa do Curso

Soberania de IA e Implantação Local de LLM

  • Riscos dos LLMs em nuvem: retenção de dados, treinamento com base nas entradas, jurisdição estrangeira.
  • Arquitetura do Ollama: servidor de modelos, registro e API compatível com OpenAI.
  • Comparação com vLLM, llama.cpp e Text Generation Inference.
  • Licenciamento de modelos: termos da Llama, Mistral, Qwen e Gemma.

Instalação e Configuração de Hardware

  • Instalando o Ollama no Linux com suporte a CUDA e ROCm.
  • Fallback apenas em CPU e otimização AVX/AVX2.
  • Implantação via Docker e mapeamento de volumes persistentes.
  • Configuração de múltiplas GPUs e estratégias de alocação de VRAM.

Gestão de Modelos

  • Baixando modelos do registro do Ollama: ollama pull llama3.
  • Importando modelos GGUF do HuggingFace e do TheBloke.
  • Níveis de quantização: trocas entre Q4_K_M, Q5_K_M e Q8_0.
  • Troca de modelos e limites de carregamento simultâneo de modelos.

Modelfiles Personalizados

  • Escrita da sintaxe do Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Ajuste de temperatura, top_p e repeat_penalty.
  • Engenharia de prompt de sistema para comportamento específico de papéis.
  • Criação e publicação de modelos personalizados no registro local.

Integração de API

  • Endpoint /v1/chat/completions compatível com OpenAI.
  • Respostas em streaming e modo JSON.
  • Integração com LangChain, LlamaIndex e aplicativos personalizados.
  • Autenticação e limitação de taxa usando proxy reverso.

Otimização de Desempenho

  • Tamanhos da janela de contexto e gerenciamento do cache KV.
  • Inferência em lote e manipulação de solicitações paralelas.
  • Alocação de threads na CPU e consciência NUMA.
  • Monitoramento do uso da GPU e pressão na memória.

Segurança e Conformidade

  • Isolamento de rede para endpoints de servidor de modelos.
  • Filtragem de entradas e pipelines de moderação de saídas.
  • Auditoria dos logs de prompts e conclusões.
  • Procedência do modelo e verificação de hash.

Requisitos

  • Administracao intermedia de Linux e contêineres.
  • Compreensão de modelos de aprendizado de máquina e transformers em alto nível.
  • Familiaridade com APIs REST e JSON.

Público-Alvo

  • Engenheiros de IA e desenvolvedores que substituem APIs de LLM em nuvem.
  • Organizações com sensibilidade de dados que impedem o uso de modelos em nuvem.
  • Equipes governamentais e de defesa que exigem modelos de linguagem isolados da rede (air-gapped).
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas