Entrar em Contato
 Duração 21 horas

Programa do Curso

Introdução à IA Multimodal e Ollama

  • Visão geral da aprendizagem multimodal
  • Principais desafios na integração visão-linguagem
  • Capacidades e arquitetura do Ollama

Configurando o Ambiente Ollama

  • Instalação e configuração do Ollama
  • Trabalhando com implantação local de modelos
  • Integração do Ollama com Python e Jupyter

Trabalhando com Entradas Multimodais

  • Integração de texto e imagem
  • Incorporação de áudio e dados estruturados
  • Projetando pipelines de pré-processamento

Aplicações de Compreensão de Documentos

  • Extração de informações estruturadas de PDFs e imagens
  • Combinação de OCR com modelos de linguagem
  • Construção de fluxos de trabalho inteligentes de análise de documentos

Resposta a Perguntas Visuais (VQA)

  • Configuração de conjuntos de dados e benchmarks de VQA
  • Treino e avaliação de modelos multimodais
  • Construção de aplicações interativas de VQA

Projetando Agentes Multimodais

  • Princípios de design de agentes com raciocínio multimodal
  • Combinação de percepção, linguagem e ação
  • Implantação de agentes para casos de uso reais

Integração Avançada e Otimização

  • Ajuste fino de modelos multimodais com Ollama
  • Otimização do desempenho de inferência
  • Considerações sobre escalabilidade e implantação

Resumo e Próximos Passos

Requisitos

  • Sólido entendimento dos conceitos de aprendizado de máquina
  • Experiência com frameworks de aprendizado profundo, como PyTorch ou TensorFlow
  • Familiaridade com processamento de linguagem natural e visão computacional

Público-Alvo

  • Engenheiros de aprendizado de máquina
  • Pesquisadores de IA
  • Desenvolvedores de produtos que integram fluxos de trabalho de visão e texto

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas