Entrar em Contato

Programa do Curso

Fundamentos da Produção com Tencent Hunyuan

  • Visão geral dos cenários de serviço com modelos Tencent Hunyuan.
  • Características da produção em modelos grandes e MoE.
  • Gargalos comuns de latência, taxa de transferência e custo.
  • Definição de objetivos de nível de serviço (SLOs) para cargas de trabalho de inferência.

Arquitetura de Implantação e Fluxo de Serviço

  • Componentes principais de uma pilha de inferência em produção.
  • Escolha entre modelos de implantação com contêineres, local (on-premise) ou em nuvem.
  • Fundamentos do carregamento de modelos, roteamento de solicitações e alocação de GPU.
  • Projeto para confiabilidade e simplicidade operacional.

Otimização de Latência na Prática

  • Uso de motores de inferência otimizados, como TensorRT, quando aplicável.
  • Conceitos de KV-cache e ajuste prático do cache.
  • Redução da sobrecarga de inicialização, aquecimento (warmup) e resposta.
  • Medição do tempo até o primeiro token e da velocidade de geração de tokens.

Taxa de Transferência, Batching e Eficiência da GPU

  • Estratégias de batching contínuo e agrupamento de solicitações.
  • Gestão de concorrência e comportamento de filas.
  • Melhoria da utilização da GPU sem comprometer a experiência do usuário.
  • Lidar com solicitações de contexto longo e cargas de trabalho mistas.

Quantização e Controle de Custos

  • A importância da quantização para o serviço em produção.
  • Trade-offs práticos de FP16, INT8 e outras opções comuns de precisão.
  • Equilíbrio entre qualidade do modelo, latência e custo de infraestrutura.
  • Criação de uma lista de verificação simples para otimização de custos.

Operações, Monitoramento e Revisão de Preparação

  • Gatilhos de autoescalonamento para serviços de inferência.
  • Monitoramento de latência, taxa de transferência, uso do cache e saúde da GPU.
  • Fundamentos de log, alertas e resposta a incidentes.
  • Revisão de uma implantação de referência e criação de um plano de melhoria.

Requisitos

  • Conhecimento básico sobre a implantação e fluxos de trabalho de inferência de grandes modelos de linguagem.
  • Experiência com contêineres, infraestrutura em nuvem ou local (on-premise) e serviços baseados em API.
  • Conhecimento prático de Python ou tarefas de engenharia de sistemas.

Público-Alvo

  • Engenheiros de ML que implantam LLMs em produção.
  • Engenheiros de plataforma responsáveis por serviços de inferência baseados em GPU.
  • Arquitetos de solução que projetam plataformas escaláveis para o serviço de IA.
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas