Entrar em Contato

Programa do Curso

Introdução aos Modelos Multimodais Mistral

  • Visão geral do Mistral Medium e suas capacidades multimodais
  • Modelos de OCR/documento e casos de uso
  • Integração com ecossistemas de código aberto

Pipelines de OCR e Visão

  • Fundamentos de OCR com modelos Mistral
  • Pré-processamento de imagens e documentos digitalizados
  • Extração de texto estruturado de imagens

Compreensão de Documentos

  • Projeto de pipelines de NLP para documentos
  • Reconhecimento de entidades, resumo e classificação
  • Linking entre modais de dados de texto e visão

Aplicações de Busca e Conhecimento

  • Sistemas de busca por visão-texto
  • Construção de busca semântica com saídas de OCR
  • Repositórios de documentos empresariais

Aplicações Assistivas e Interativas

  • Design de UI para assistentes multimodais
  • Aplicações de acessibilidade (ex.: visão para texto)
  • Ferramentas de produtividade para o mundo real

Desempenho e Otimização

  • Escala de pipelines multimodais
  • Ajuste de desempenho de inferência
  • Avaliação de compromissos entre precisão e eficiência

Estudos de Caso e Direções Futuras

  • Aplicações industriais de IA multimodal
  • Tendências de pesquisa em OCR e IA de documentos
  • Considerações de IA responsável em tarefas de visão-texto

Resumo e Próximos Passos

Requisitos

  • Conhecimento de conceitos de processamento de linguagem natural
  • Experiência com Python e frameworks de ML
  • Familiaridade com os fundamentos de visão computacional

Público-Alvo

  • Equipes de produto
  • Pesquisadores de ML
  • Engenheiros de ML aplicado
 14 Horas

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas