Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 21 horas
Programa do Curso
Introdução à IA Multimodal e Ollama
- Visão geral da aprendizagem multimodal
- Principais desafios na integração visão-linguagem
- Capacidades e arquitetura do Ollama
Configurando o Ambiente Ollama
- Instalação e configuração do Ollama
- Trabalhando com implantação local de modelos
- Integração do Ollama com Python e Jupyter
Trabalhando com Entradas Multimodais
- Integração de texto e imagem
- Incorporação de áudio e dados estruturados
- Projetando pipelines de pré-processamento
Aplicações de Compreensão de Documentos
- Extração de informações estruturadas de PDFs e imagens
- Combinação de OCR com modelos de linguagem
- Construção de fluxos de trabalho inteligentes de análise de documentos
Resposta a Perguntas Visuais (VQA)
- Configuração de conjuntos de dados e benchmarks de VQA
- Treino e avaliação de modelos multimodais
- Construção de aplicações interativas de VQA
Projetando Agentes Multimodais
- Princípios de design de agentes com raciocínio multimodal
- Combinação de percepção, linguagem e ação
- Implantação de agentes para casos de uso reais
Integração Avançada e Otimização
- Ajuste fino de modelos multimodais com Ollama
- Otimização do desempenho de inferência
- Considerações sobre escalabilidade e implantação
Resumo e Próximos Passos
Requisitos
- Sólido entendimento dos conceitos de aprendizado de máquina
- Experiência com frameworks de aprendizado profundo, como PyTorch ou TensorFlow
- Familiaridade com processamento de linguagem natural e visão computacional
Público-Alvo
- Engenheiros de aprendizado de máquina
- Pesquisadores de IA
- Desenvolvedores de produtos que integram fluxos de trabalho de visão e texto