Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 14 horas
Programa do Curso
Fundamentos da Produção com Tencent Hunyuan
- Visão geral dos cenários de serviço com modelos Tencent Hunyuan.
- Características da produção em modelos grandes e MoE.
- Gargalos comuns de latência, taxa de transferência e custo.
- Definição de objetivos de nível de serviço (SLOs) para cargas de trabalho de inferência.
Arquitetura de Implantação e Fluxo de Serviço
- Componentes principais de uma pilha de inferência em produção.
- Escolha entre modelos de implantação com contêineres, local (on-premise) ou em nuvem.
- Fundamentos do carregamento de modelos, roteamento de solicitações e alocação de GPU.
- Projeto para confiabilidade e simplicidade operacional.
Otimização de Latência na Prática
- Uso de motores de inferência otimizados, como TensorRT, quando aplicável.
- Conceitos de KV-cache e ajuste prático do cache.
- Redução da sobrecarga de inicialização, aquecimento (warmup) e resposta.
- Medição do tempo até o primeiro token e da velocidade de geração de tokens.
Taxa de Transferência, Batching e Eficiência da GPU
- Estratégias de batching contínuo e agrupamento de solicitações.
- Gestão de concorrência e comportamento de filas.
- Melhoria da utilização da GPU sem comprometer a experiência do usuário.
- Lidar com solicitações de contexto longo e cargas de trabalho mistas.
Quantização e Controle de Custos
- A importância da quantização para o serviço em produção.
- Trade-offs práticos de FP16, INT8 e outras opções comuns de precisão.
- Equilíbrio entre qualidade do modelo, latência e custo de infraestrutura.
- Criação de uma lista de verificação simples para otimização de custos.
Operações, Monitoramento e Revisão de Preparação
- Gatilhos de autoescalonamento para serviços de inferência.
- Monitoramento de latência, taxa de transferência, uso do cache e saúde da GPU.
- Fundamentos de log, alertas e resposta a incidentes.
- Revisão de uma implantação de referência e criação de um plano de melhoria.
Requisitos
- Conhecimento básico sobre a implantação e fluxos de trabalho de inferência de grandes modelos de linguagem.
- Experiência com contêineres, infraestrutura em nuvem ou local (on-premise) e serviços baseados em API.
- Conhecimento prático de Python ou tarefas de engenharia de sistemas.
Público-Alvo
- Engenheiros de ML que implantam LLMs em produção.
- Engenheiros de plataforma responsáveis por serviços de inferência baseados em GPU.
- Arquitetos de solução que projetam plataformas escaláveis para o serviço de IA.