Entrar em Contato
 Duração 14 horas

Programa do Curso

Introdução à Síntese de Fala e Clonagem de Voz

  • Visão geral de text-to-speech (TTS) e síntese de voz neural
  • Clonagem de voz vs. geração de fala: casos de uso e limitações
  • Modelos principais: Tacotron, WaveNet, FastSpeech, VITS

Trabalhando com Plataformas Comerciais

  • Uso do ElevenLabs e Resemble AI
  • Criação, clonagem e edição de vozes
  • Acesso via API e fluxos de trabalho de text-to-speech

Construindo com Ferramentas de Código Aberto

  • Instalação e configuração do Coqui TTS
  • Treinamento de vozes personalizadas e gerenciamento de conjuntos de dados
  • Geração de fala com controle fino (tom, velocidade, emoção)

Preparação de Dados e Gerenciamento de Conjuntos de Dados de Voz

  • Coleta e limpeza de amostras de voz
  • Segmentação, rotulagem e alinhamento de transcrições
  • Origem ética e consentimento de voz

Integração de Aplicações

  • Incorporação de TTS em sites e aplicativos
  • Criação de sistemas IVR e bots interativos
  • Geração de diálogos sintéticos para vídeos e jogos

Avaliação de Qualidade e Realismo

  • MOS (Mean Opinion Score) e testes de inteligibilidade
  • Controle de expressividade e prosódia
  • Comparação de latência, fidelidade e realismo

Considerações Éticas, Legais e de Governança

  • Riscos de deepfakes e uso responsável
  • Consentimento, atribuição e implicações de direitos autorais
  • Regulamentações e políticas organizacionais

Resumo e Próximos Passos

Requisitos

  • Compreensão dos fundamentos do aprendizado de máquina
  • Familiaridade com formatos de arquivos de áudio e ferramentas de edição
  • Habilidades básicas em programação Python

Público-Alvo

  • Desenvolvedores e engenheiros de IA interessados em síntese de fala
  • Criadores de conteúdo e tecnólogos de mídia explorando a geração de voz
  • Equipes de P&D que constroem sistemas de áudio personalizados ou dinâmicos

Número de participantes


Preço por participante

Próximas Formações Provisórias

Categorias Relacionadas