Programa do Curso
Introdução
Compreendendo o Big Data
Noções gerais sobre Spark
Noções gerais sobre Python
Noções gerais sobre PySpark
- Distribuição de dados por meio do framework Resilient Distributed Datasets (RDD)
- Distribuição de processamento utilizando operadores da API do Spark
Configuração do Python com o Spark
Configuração do PySpark
Uso de instâncias EC2 da Amazon Web Services (AWS) para Spark
Configuração do Databricks
Configuração do cluster AWS EMR
Aprendizado dos fundamentos da programação em Python
- Iniciando com Python
- Utilizando o Jupyter Notebook
- Variáveis e tipos de dados simples
- Trabalhando com listas
- Uso de estruturas condicionais (if)
- Solicitação e uso de entradas do usuário
- Trabalhando com loops while
- Criando funções
- Trabalhando com classes
- Manipulação de arquivos e tratamento de exceções
- Trabalhando com projetos, dados e APIs
Aprendizado dos fundamentos do Spark DataFrame
- Iniciando com Spark DataFrames
- Implementação de operações básicas no Spark
- Uso de agrupamento (groupby) e operações agregadas
- Manipulação de carimbos de data/hora (timestamps) e datas
Exercício prático de projeto com Spark DataFrame
Compreensão do aprendizado de máquina com a biblioteca MLlib
Trabalhando com MLlib, Spark e Python para aprendizado de máquina
Compreendendo regressões
- Aprendizado da teoria da regressão linear
- Implementação de código para avaliação de regressão
- Exercício prático de regressão linear com exemplo
- Aprendizado da teoria da regressão logística
- Implementação de código de regressão logística
- Exercício prático de regressão logística com exemplo
Compreendendo Random Forests (Florestas Aleatórias) e Decision Trees (Árvores de Decisão)
- Aprendizado da teoria dos métodos baseados em árvores
- Implementação de códigos para Árvores de Decisão e Random Forests
- Exercício prático de classificação com Random Forest
Trabalhando com agrupamento K-means
- Compreendendo a teoria do agrupamento K-means
- Implementação de código para agrupamento K-means
- Exercício prático de clustering com exemplo
Sistemas de recomendação
Implementação de processamento de linguagem natural (NLP)
- Compreensão do Processamento de Linguagem Natural (NLP)
- Noções gerais sobre ferramentas de NLP
- Exercício prático de NLP com exemplo
Processamento de fluxo de dados (streaming) com Spark em Python
- Noções gerais sobre streaming com Spark
- Exercício prático de streaming com Spark
Agradecimentos e encerramento
Requisitos
- Habilidades gerais de programação
Público-alvo
- Desenvolvedores
- Profissionais de TI
- Cientistas de Dados
Testemunhos de Clientes (6)
Gostei do fato de ser prático. Adorei aplicar o conhecimento teórico com exemplos práticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida
O curso abordou uma série de tópicos muito complexos e interrelacionados, e Pablo possui um conhecimento profundo de cada um deles. Às vezes, nuances se perdiam na comunicação e/ou devido a pressões de tempo, o que possivelmente fez com que as expectativas não fossem totalmente atendidas. Além disso, houve alguns problemas de configuração do UHG/Azure Databricks, mas Pablo e UHG resolveram esses problemas rapidamente assim que se tornaram evidentes - isso para mim demonstrou um alto nível de entendimento e profissionalismo entre UHG e Pablo,
Michael Monks - Tech NorthWest Skillnet
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida
Atenção individual.
ARCHANA ANILKUMAR - PPL
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida
Treinamento Prático..
Abraham Thomas - PPL
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida
As aulas foram ministradas em um notebook Jupyter. Os tópicos foram estruturados com uma sequência lógica e naturalmente ajudaram a desenvolver a sessão das partes mais fáceis às mais complexas. Como já sou um usuário avançado de Python, com experiência em Aprendizado de Máquina, achei o curso mais fácil de seguir do que possivelmente alguns dos meus colegas que fizeram o treinamento. Aprecio que alguns dos conceitos mais elementares tenham sido omitidos e que ele tenha se concentrado nos assuntos mais substanciais.
Angela DeLaMora - ADT, LLC
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida
tarefas práticas
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida