Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 14 horas (2 dias)
Programa do Curso
Visão Geral das Tecnologias de Reconhecimento de Fala
- História e evolução do reconhecimento de fala
- Modelos acústicos, modelos de linguagem e decodificação
- Arquiteturas modernas: RNNs, transformers e Whisper
Pré-processamento de Áudio e Fundamentos de Transcrição
- Tratamento de formatos de áudio e taxas de amostragem
- Limpeza, recorte e segmentação de áudio
- Geração de texto a partir de áudio: tempo real vs lote
Mão na Massa com Whisper e Outras APIs
- Instalação e uso do OpenAI Whisper
- Chamando APIs na nuvem (Google, Azure) para transcrição
- Comparação de desempenho, latência e custo
Idioma, Acentos e Adaptação de Domínio
- Trabalhando com múltiplos idiomas e acentos
- Vocabulários personalizados e tolerância a ruído
- Tratamento de linguagem jurídica, médica ou técnica
Formatação de Saída e Integração
- Adicionando timestamps, pontuação e rótulos de falantes
- Exportação para formatos de texto, SRT ou JSON
- Integração de transcrições em aplicativos ou bancos de dados
Laboratórios de Implementação de Casos de Uso
- Transcrição de reuniões, entrevistas ou podcasts
- Sistemas de comandos por voz para texto
- Legendas em tempo real para streams de vídeo/áudio
Avaliação, Limitações e Ética
- Métricas de precisão e benchmarking de modelos
- Viés e justiça em modelos de fala
- Considerações de privacidade e conformidade
Resumo e Próximos Passos
Requisitos
- Compreensão dos conceitos gerais de IA e aprendizado de máquina
- Familiaridade com formatos e ferramentas de arquivos de áudio ou mídia
Público Alvo
- Cientistas de dados e engenheiros de IA que trabalham com dados de voz
- Desenvolvedores de software que constroem aplicações baseadas em transcrição
- Organizações explorando o reconhecimento de fala para automação