Programa do Curso
Plataforma Databricks e Fundamentos do Lakehouse
- Arquitetura e componentes do Databricks Lakehouse.
- Organização de espaços de trabalho (workspaces) e catálogos.
Espaço de Trabalho e Notebooks do Databricks
- Navegação no espaço de trabalho e desenvolvimento baseado em notebooks.
- Estruturação do código em notebooks reutilizáveis.
Arquitetura e Execução do Apache Spark
- Arquitetura do tempo de execução (runtime) do Spark e modelo de execução.
- Avaliação preguiçosa (lazy evaluation) e DAG do trabalho (job).
DataFrames PySpark e a API DataFrame
- Abstrações de DataFrames e esquemas.
- Operações principais de DataFrame e expressões de coluna.
Traduzindo SQL para DataFrames PySpark
- Tradução das cláusulas principais do SQL para operações de DataFrame.
- Funções de janela e agregações no PySpark.
Lendo e Gravando Dados no Databricks
- Leitura a partir de fontes comuns de arquivos e bancos de dados.
- Gravação e particionamento de dados no Lakehouse.
Delta Lake e Gestão de Tabelas
- Tabelas Delta e transações ACID.
- Histórico de dados (time travel) e evolução do esquema.
Padrões de Limpeza e Transformação de Dados
- Limpeza de dados e conversão de tipos.
- Criação de lógica de transformação reutilizável.
Funções Definidas pelo Usuário e Código Modular
- UDFs Python e pandas UDFs.
- Modularização da lógica procedural em funções.
Tuning de Performance e Otimização
- Estratégias de particionamento e cache.
- Diagnóstico de gargalos com a interface do Spark (Spark UI).
Fundamentos do Structured Streaming
- Modelos de processamento em lotes versus streaming.
- DataFrames de streaming e agregações básicas.
Trabalhos (Jobs) e Orquestração de Fluxos de Trabalho no Databricks
- Agendamento de notebooks como trabalhos e tarefas.
- Criação de fluxos de trabalho em múltiplas etapas com dependências.
Unity Catalog e Governança de Dados
- Arquitetura do Unity Catalog e namespaces.
- Controle de acesso e linhagem de dados.
Testes, Depuração e Boas Práticas de Produção
- Teste unitário da lógica PySpark.
- Depuração e padrões de qualidade de código.
Casos de Uso End-to-End em Serviços Financeiros
- Criação de um pipeline ETL bancário end-to-end.
- Tradução de processos legados de SQL para PySpark.
Migração de Cargas de Trabalho SQL para PySpark
- Estratégia de migração e padrões de planejamento.
- Conversão incremental de fluxos de trabalho SQL para PySpark.
Requisitos
- Experiência com programação em Python, incluindo funções e tipos de dados.
- Compreensão de SQL, incluindo joins, agregações e subconsultas.
- Não é necessária experiência prévia com Databricks ou PySpark.
Público-Alvo
- Engenheiros de dados, analistas de dados e profissionais da área de dados.
- Equipes que estão migrando fluxos de trabalho baseados em SQL existentes para o Databricks e PySpark.
Testemunhos de Clientes (1)
Gostei do fato de ser prático. Adorei aplicar o conhecimento teórico com exemplos práticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida