Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 35 horas
Programa do Curso
Introdução, Objetivos e Estratégia de Migração
- Objetivos do curso, alinhamento do perfil dos participantes e critérios de sucesso
- Aproximações de alto nível para a migração e considerações de risco
- Configuração de workspaces, repositórios e conjuntos de dados para os laboratórios
Dia 1 — Fundamentos de Migração e Arquitetura
- Conceitos de Lakehouse, visão geral do Delta Lake e arquitetura do Databricks
- Diferenças entre SMP e MPP e implicações para a migração
- Projeto Medallion (Bronze→Silver→Gold) e visão geral do Unity Catalog
Laboratório Dia 1 — Tradução de uma Procedure Armazenada
- Migração prática de uma procedure armazenada de exemplo para um notebook
- Mapeamento de tabelas temporárias e cursores para transformações DataFrame
- Validação e comparação com a saída original
Dia 2 — Delta Lake Avançado & Carregamento Incremental
- Transações ACID, logs de commit, versionamento e time travel
- Auto Loader, padrões MERGE INTO, upserts e evolução de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamento e ajuste de armazenamento
Laboratório Dia 2 — Ingestão & Otimização Incremental
- Implementação de ingestão com Auto Loader e workflows MERGE
- Aplique OPTIMIZE, Z-ORDER e VACUUM; validação de resultados
- Medição de melhorias no desempenho de leitura/escrita
Dia 3 — SQL no Databricks, Desempenho & Depuração
- Funcionalidades de SQL analítico: funções de janela, funções de ordem superior, tratamento JSON/array
- Leitura da Spark UI, DAGs, shuffles, stages, tasks e diagnóstico de gargalos
- Padrões de ajuste de consultas: broadcast joins, hints, cache e redução de spill
Laboratório Dia 3 — Refatoração de SQL & Ajuste de Desempenho
- Refatorar um processo SQL pesado em Spark SQL otimizado
- Usar rastreamentos da Spark UI para identificar e corrigir problemas de skew e shuffle
- Benchmark antes/depois e documentação das etapas de ajuste
Dia 4 — PySpark Tático: Substituindo Lógica Procedural
- Modelo de execução do Spark: driver, executores, avaliação preguiçosa e estratégias de particionamento
- Transformação de laços e cursores para operações vetorizadas DataFrame
- Modularização, UDFs/pandas UDFs, widgets e bibliotecas reutilizáveis
Laboratório Dia 4 — Refatoração de Scripts Procedurais
- Refatorar um script ETL procedural em notebooks PySpark modulares
- Introdução à parametrização, testes estilo unitário e funções reutilizáveis
- Revisão de código e aplicação de checklist de boas práticas
Dia 5 — Orquestração, Pipeline de Ponta a Ponta & Boas Práticas
- Databricks Workflows: design de jobs, dependências de tarefas, gatilhos e tratamento de erros
- Projeto de pipelines Medallion incrementais com regras de qualidade e validação de esquema
- Integração com Git (GitHub/Azure DevOps), CI e estratégias de teste para lógica PySpark
Laboratório Dia 5 — Construção de um Pipeline Completo de Ponta a Ponta
- Montagem do pipeline Bronze→Silver→Gold orquestrado com Workflows
- Implementação de logging, auditoria, repetições e validações automatizadas
- Execução do pipeline completo, validação de saídas e preparação de notas de implantação
Operacionalização, Governança e Prontidão para Produção
- Governança do Unity Catalog, linhagem e melhores práticas de controle de acesso
- Custo, dimensionamento de clusters, auto-escalabilidade e padrões de concorrência de jobs
- Checklists de implantação, estratégias de rollback e criação de runbooks
Revisão Final, Transferência de Conhecimento e Próximas Etapas
- Apresentações dos participantes sobre o trabalho de migração e lições aprendidas
- Análise de lacunas, atividades de acompanhamento recomendadas e entrega de materiais de treinamento
- Referências, caminhos de aprendizado adicional e opções de suporte
Requisitos
- Compreensão dos conceitos de engenharia de dados
- Experiência com SQL e procedures armazenadas (Synapse / SQL Server)
- Familiaridade com conceitos de orquestração de ETL (ADF ou similar)
Público-Alvo
- Gerentes de tecnologia com formação em engenharia de dados
- Engenheiros de dados que estão migrando lógica procedural de OLAP para padrões de Lakehouse
- Engenheiros de plataforma responsáveis pela adoção do Databricks