Entrar em Contato

Programa do Curso

Introdução à IA Multimodal

  • O que é IA multimodal?
  • Principais desafios e aplicações
  • Visão geral dos principais modelos multimodais

Processamento de Texto e Compreensão da Linguagem Natural

  • Aproveitamento de LLMs para agentes de IA baseados em texto
  • Compreensão da engenharia de prompts para tarefas multimodais
  • Ajuste fino de modelos de texto para aplicações específicas do domínio

Reconhecimento e Geração de Imagens

  • Processamento de imagens com IA: classificação, legendagem e detecção de objetos
  • Geração de imagens com modelos de difusão (Stable Diffusion, DALLE)
  • Integração de dados de imagem com modelos baseados em texto

Processamento de Áudio e Fala

  • Reconhecimento de fala com Whisper ASR
  • Técnicas de síntese de texto para fala (TTS)
  • Aprimoramento da interação do usuário com IA baseada em voz

Integração de Entradas Multimodais

  • Criação de pipelines de IA para processar múltiplos tipos de entrada
  • Técnicas de fusão para combinar dados de texto, imagem e áudio
  • Aplicações do mundo real de agentes de IA multimodal

Implantação de Agentes de IA Multimodal

  • Criação de soluções de IA multimodal baseadas em APIs
  • Otimização de modelos para desempenho e escalabilidade
  • Melhores práticas para implantar IA multimodal em produção

Considerações Éticas e Tendências Futuras

  • Vieses e justiça na IA multimodal
  • Questões de privacidade com dados multimodais
  • Desenvolvimentos futuros em IA multimodal

Resumo e Próximos Passos

Requisitos

  • Compreensão dos fundamentos de aprendizado de máquina
  • Experiência com programação em Python
  • Familiaridade com frameworks de aprendizado profundo (por exemplo, TensorFlow, PyTorch)

Público-alvo

  • Desenvolvedores de IA
  • Pesquisadores
  • Engenheiros multimídia
 21 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas