Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Soberania de IA e Implantação Local de LLM
- Riscos dos LLMs em nuvem: retenção de dados, treinamento com base nas entradas, jurisdição estrangeira.
- Arquitetura do Ollama: servidor de modelos, registro e API compatível com OpenAI.
- Comparação com vLLM, llama.cpp e Text Generation Inference.
- Licenciamento de modelos: termos da Llama, Mistral, Qwen e Gemma.
Instalação e Configuração de Hardware
- Instalando o Ollama no Linux com suporte a CUDA e ROCm.
- Fallback apenas em CPU e otimização AVX/AVX2.
- Implantação via Docker e mapeamento de volumes persistentes.
- Configuração de múltiplas GPUs e estratégias de alocação de VRAM.
Gestão de Modelos
- Baixando modelos do registro do Ollama: ollama pull llama3.
- Importando modelos GGUF do HuggingFace e do TheBloke.
- Níveis de quantização: trocas entre Q4_K_M, Q5_K_M e Q8_0.
- Troca de modelos e limites de carregamento simultâneo de modelos.
Modelfiles Personalizados
- Escrita da sintaxe do Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajuste de temperatura, top_p e repeat_penalty.
- Engenharia de prompt de sistema para comportamento específico de papéis.
- Criação e publicação de modelos personalizados no registro local.
Integração de API
- Endpoint /v1/chat/completions compatível com OpenAI.
- Respostas em streaming e modo JSON.
- Integração com LangChain, LlamaIndex e aplicativos personalizados.
- Autenticação e limitação de taxa usando proxy reverso.
Otimização de Desempenho
- Tamanhos da janela de contexto e gerenciamento do cache KV.
- Inferência em lote e manipulação de solicitações paralelas.
- Alocação de threads na CPU e consciência NUMA.
- Monitoramento do uso da GPU e pressão na memória.
Segurança e Conformidade
- Isolamento de rede para endpoints de servidor de modelos.
- Filtragem de entradas e pipelines de moderação de saídas.
- Auditoria dos logs de prompts e conclusões.
- Procedência do modelo e verificação de hash.
Requisitos
- Administracao intermedia de Linux e contêineres.
- Compreensão de modelos de aprendizado de máquina e transformers em alto nível.
- Familiaridade com APIs REST e JSON.
Público-Alvo
- Engenheiros de IA e desenvolvedores que substituem APIs de LLM em nuvem.
- Organizações com sensibilidade de dados que impedem o uso de modelos em nuvem.
- Equipes governamentais e de defesa que exigem modelos de linguagem isolados da rede (air-gapped).
14 Horas