Entrar em Contato
 Duração 14 horas (2 dias)

Programa do Curso

Visão Geral das Tecnologias de Reconhecimento de Fala

  • História e evolução do reconhecimento de fala
  • Modelos acústicos, modelos de linguagem e decodificação
  • Arquiteturas modernas: RNNs, transformers e Whisper

Pré-processamento de Áudio e Fundamentos de Transcrição

  • Tratamento de formatos de áudio e taxas de amostragem
  • Limpeza, recorte e segmentação de áudio
  • Geração de texto a partir de áudio: tempo real vs lote

Mão na Massa com Whisper e Outras APIs

  • Instalação e uso do OpenAI Whisper
  • Chamando APIs na nuvem (Google, Azure) para transcrição
  • Comparação de desempenho, latência e custo

Idioma, Acentos e Adaptação de Domínio

  • Trabalhando com múltiplos idiomas e acentos
  • Vocabulários personalizados e tolerância a ruído
  • Tratamento de linguagem jurídica, médica ou técnica

Formatação de Saída e Integração

  • Adicionando timestamps, pontuação e rótulos de falantes
  • Exportação para formatos de texto, SRT ou JSON
  • Integração de transcrições em aplicativos ou bancos de dados

Laboratórios de Implementação de Casos de Uso

  • Transcrição de reuniões, entrevistas ou podcasts
  • Sistemas de comandos por voz para texto
  • Legendas em tempo real para streams de vídeo/áudio

Avaliação, Limitações e Ética

  • Métricas de precisão e benchmarking de modelos
  • Viés e justiça em modelos de fala
  • Considerações de privacidade e conformidade

Resumo e Próximos Passos

Requisitos

  • Compreensão dos conceitos gerais de IA e aprendizado de máquina
  • Familiaridade com formatos e ferramentas de arquivos de áudio ou mídia

Público Alvo

  • Cientistas de dados e engenheiros de IA que trabalham com dados de voz
  • Desenvolvedores de software que constroem aplicações baseadas em transcrição
  • Organizações explorando o reconhecimento de fala para automação

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas