Entrar em Contato

Programa do Curso

Introdução aos Modelos Multimodais Mistral

  • Visão geral dos modelos Mistral Medium e capacidades multimodais
  • Modelos OCR/documento e casos de uso
  • Integração com ecossistemas de código aberto

Pipelines de OCR e Visão

  • Fundamentos de OCR com modelos Mistral
  • Pré-processamento de imagens e documentos digitalizados
  • Extração de texto estruturado a partir de imagens

Compreensão de Documentos

  • Projeto de pipelines de PLN para documentos
  • Reconhecimento de entidades, resumo e classificação
  • Vinculação cross-modal entre dados textuais e visuais

Pesquisa e Aplicações de Conhecimento

  • Sistemas de pesquisa por visão-texto
  • Construção de busca semântica com saídas de OCR
  • Repositórios empresariais de documentos

Aplicações Assistivas e Interativas

  • Projeto de UI para assistentes multimodais
  • Aplicações de acessibilidade (por exemplo, visão-para-texto)
  • Ferramentas de produtividade do mundo real

Desempenho e Otimização

  • Escalonamento de pipelines multimodais
  • Ajuste de desempenho de inferência
  • Avaliação dos compromissos entre precisão e eficiência

Casos de Estudo e Direções Futuras

  • Aplicações industriais de IA multimodal
  • Tendências de pesquisa em OCR e IA para documentos
  • Considerações de IA responsável em tarefas visão-texto

Resumo e Próximos Passos

Requisitos

  • Compreensão dos conceitos de Processamento de Linguagem Natural (PLN)
  • Experiência com Python e frameworks de ML
  • Familiaridade com os fundamentos da visão computacional

Público-Alvo

  • Equipes de produto
  • Pesquisadores de ML
  • Engenheiros de ML aplicados
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas