Entrar em Contato

Programa do Curso

Plataforma Databricks e Fundamentos do Lakehouse

  • Arquitetura e componentes do Databricks Lakehouse.
  • Organização de espaços de trabalho (workspaces) e catálogos.

Espaço de Trabalho e Notebooks do Databricks

  • Navegação no espaço de trabalho e desenvolvimento baseado em notebooks.
  • Estruturação do código em notebooks reutilizáveis.

Arquitetura e Execução do Apache Spark

  • Arquitetura do tempo de execução (runtime) do Spark e modelo de execução.
  • Avaliação preguiçosa (lazy evaluation) e DAG do trabalho (job).

DataFrames PySpark e a API DataFrame

  • Abstrações de DataFrames e esquemas.
  • Operações principais de DataFrame e expressões de coluna.

Traduzindo SQL para DataFrames PySpark

  • Tradução das cláusulas principais do SQL para operações de DataFrame.
  • Funções de janela e agregações no PySpark.

Lendo e Gravando Dados no Databricks

  • Leitura a partir de fontes comuns de arquivos e bancos de dados.
  • Gravação e particionamento de dados no Lakehouse.

Delta Lake e Gestão de Tabelas

  • Tabelas Delta e transações ACID.
  • Histórico de dados (time travel) e evolução do esquema.

Padrões de Limpeza e Transformação de Dados

  • Limpeza de dados e conversão de tipos.
  • Criação de lógica de transformação reutilizável.

Funções Definidas pelo Usuário e Código Modular

  • UDFs Python e pandas UDFs.
  • Modularização da lógica procedural em funções.

Tuning de Performance e Otimização

  • Estratégias de particionamento e cache.
  • Diagnóstico de gargalos com a interface do Spark (Spark UI).

Fundamentos do Structured Streaming

  • Modelos de processamento em lotes versus streaming.
  • DataFrames de streaming e agregações básicas.

Trabalhos (Jobs) e Orquestração de Fluxos de Trabalho no Databricks

  • Agendamento de notebooks como trabalhos e tarefas.
  • Criação de fluxos de trabalho em múltiplas etapas com dependências.

Unity Catalog e Governança de Dados

  • Arquitetura do Unity Catalog e namespaces.
  • Controle de acesso e linhagem de dados.

Testes, Depuração e Boas Práticas de Produção

  • Teste unitário da lógica PySpark.
  • Depuração e padrões de qualidade de código.

Casos de Uso End-to-End em Serviços Financeiros

  • Criação de um pipeline ETL bancário end-to-end.
  • Tradução de processos legados de SQL para PySpark.

Migração de Cargas de Trabalho SQL para PySpark

  • Estratégia de migração e padrões de planejamento.
  • Conversão incremental de fluxos de trabalho SQL para PySpark.

Requisitos

  • Experiência com programação em Python, incluindo funções e tipos de dados.
  • Compreensão de SQL, incluindo joins, agregações e subconsultas.
  • Não é necessária experiência prévia com Databricks ou PySpark.

Público-Alvo

  • Engenheiros de dados, analistas de dados e profissionais da área de dados.
  • Equipes que estão migrando fluxos de trabalho baseados em SQL existentes para o Databricks e PySpark.
 35 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (1)

Próximas Formações Provisórias

Categorias Relacionadas