Entrar em Contato

Programa do Curso

Introdução aos Modelos Visão-Linguagem

  • Visão geral dos VLMs e seu papel na IA multimodal
  • Arquiteturas populares: CLIP, Flamingo, BLIP, etc.
  • Casos de uso: busca, legendamento, sistemas autônomos, análise de conteúdo

Preparação do Ambiente de Ajuste Fino

  • Configuração do OpenCLIP e outras bibliotecas VLM
  • Formatos de conjuntos de dados para pares imagem-texto
  • Pipelines de pré-processamento para entradas visuais e linguísticas

Ajuste Fino do CLIP e Modelos Semelhantes

  • Loss contrastivo e espaços de incorporação conjunta
  • Prática: ajuste fino do CLIP em conjuntos de dados personalizados
  • Tratamento de dados específicos de domínio e multilingues

Técnicas Avançadas de Ajuste Fino

  • Uso de LoRA e métodos baseados em adaptadores para eficiência
  • Ajuste de prompts e injeção de prompts visuais
  • Compensações entre avaliação zero-shot e ajuste fino

Avaliação e Benchmarking

  • Métricas para VLMs: precisão de recuperação, BLEU, CIDEr, recall
  • Diagnósticos de alinhamento imagem-texto
  • Visualização dos espaços de incorporação e erros de classificação

Implantação e Uso em Aplicações Reais

  • Exportação de modelos para inferência (TorchScript, ONNX)
  • Integração de VLMs em pipelines ou APIs
  • Considerações sobre recursos e escalonamento de modelos

Estudos de Caso e Cenários Aplicados

  • Análise de mídia e moderação de conteúdo
  • Busca e recuperação no comércio eletrônico e bibliotecas digitais
  • Interação multimodal em robótica e sistemas autônomos

Resumo e Próximos Passos

Requisitos

  • Compreensão de aprendizado profundo para visão computacional e PLN (Processamento de Linguagem Natural)
  • Experiência com PyTorch e modelos baseados em transformadores
  • Familiaridade com arquiteturas de modelos multimodais

Público-Alvo

  • Engenheiros de visão computacional
  • Desenvolvedores de IA
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas