Curso de Integração de Big Data com Talend
O Talend Open Studio for Big Data é uma ferramenta ETL de código aberto para processamento de grandes volumes de dados. Ele inclui um ambiente de desenvolvimento para interagir com fontes e destinos de Big Data, além de executar tarefas sem a necessidade de escrever código.
Este treinamento ao vivo, ministrado por instrutor (online ou presencial), é voltado para profissionais técnicos que desejam implementar o Talend Open Studio for Big Data para simplificar o processo de leitura e análise de grandes volumes de dados.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Talend Open Studio for Big Data.
- Conectar-se a sistemas de Big Data, como Cloudera, Hortonworks, MapR, Amazon EMR e Apache.
- Compreender e configurar os componentes e conectores de Big Data do Open Studio.
- Configurar parâmetros para gerar automaticamente código MapReduce.
- Utilizar a interface de arrastar e soltar do Open Studio para executar tarefas Hadoop.
- Criar protótipos de pipelines de Big Data.
- Automatizar projetos de integração de Big Data.
Formato do Curso
- Palestra interativa e discussão.
- Muitos exercícios e prática.
- Implementação prática em ambiente de laboratório ao vivo.
Opções de Personalização do Curso
- Para solicitar um treinamento personalizado para este curso, entre em contato conosco para agendar.
Programa do Curso
Introdução
Visão geral dos recursos e da arquitetura do "Open Studio for Big Data"
Configuração do Open Studio for Big Data
Navegando na interface gráfica (UI)
Compreendendo os componentes e conectores de Big Data
Conectando-se a um cluster Hadoop
Leitura e gravação de dados
Processamento de dados com Hive e MapReduce
Análise dos resultados
Melhoria da qualidade do Big Data
Construção de um pipeline de Big Data
Gerenciamento de usuários, grupos, funções e projetos
Implantação do Open Studio em produção
Monitoramento do Open Studio
Solução de problemas
Resumo e conclusão
Requisitos
- Compreensão de bancos de dados relacionais
- Compreensão de armazenamento de dados (data warehousing)
- Compreensão dos conceitos ETL (Extração, Transformação e Carga)
Público-alvo
- Profissionais de inteligência de negócios (BI)
- Profissionais de banco de dados
- Desenvolvedores SQL
- Desenvolvedores ETL
- Arquitetos de solução
- Arquitetos de dados
- Profissionais de armazenamento de dados (data warehousing)
- Administradores e integradores de sistemas
Os cursos de treinamento abertos exigem mais de 5 participantes.
Curso de Integração de Big Data com Talend - Reserva
Curso de Integração de Big Data com Talend - Consulta
Integração de Big Data com Talend - SOLICITAÇÃO DE CONSULTORIA
Testemunhos de Clientes (1)
Exercícios práticos. A turma deveria ter durado 5 dias, mas os 3 dias ajudaram a esclarecer muitas das minhas dúvidas sobre o trabalho com NiFi.
James - BHG Financial
Curso - Apache NiFi for Administrators
Máquina Traduzida
Próximas Formações Provisórias
Cursos Relacionados
Apache Iceberg Avançado
21 HorasEste treinamento ao vivo com instrutor em Brasil (online ou presencial) destina-se a profissionais de dados de nível avançado que desejam otimizar fluxos de trabalho de processamento de dados, garantir a integridade dos dados e implementar soluções robustas de lakehouse capazes de lidar com as complexidades das aplicações modernas de big data.
Ao final deste treinamento, os participantes serão capazes de:
- Obter uma compreensão aprofundada da arquitetura do Iceberg, incluindo gerenciamento de metadados e layout dos arquivos.
- Configurar o Iceberg para desempenho ótimo em vários ambientes e integrá-lo com múltiplos motores de processamento de dados.
- Gerenciar tabelas Iceberg em larga escala, realizar alterações complexas de esquema e lidar com a evolução das partições.
- Dominar técnicas para otimizar o desempenho das consultas e a eficiência da varredura de dados em grandes conjuntos de dados.
- Implementar mecanismos para garantir a consistência dos dados, gerenciar garantias transacionais e lidar com falhas em ambientes distribuídos.
Fundamentos do Apache Iceberg
14 HorasEste treinamento ao vivo com instrutor em Brasil (online ou presencial) é voltado para profissionais de dados iniciantes que desejam adquirir os conhecimentos e as habilidades necessários para utilizar efetivamente o Apache Iceberg no gerenciamento de conjuntos de dados em grande escala, garantir a integridade dos dados e otimizar os fluxos de processamento.
Ao final deste treinamento, os participantes serão capazes de:
- Obter uma compreensão profunda da arquitetura, recursos e benefícios do Apache Iceberg.
- Aprender sobre formatos de tabela, particionamento, evolução de esquemas e recursos de viagem no tempo.
- Instalar e configurar o Apache Iceberg em diferentes ambientes.
- Criar, gerenciar e manipular tabelas Iceberg.
- Compreender o processo de migração de dados de outros formatos de tabela para o Iceberg.
Análise de Big Data com Google Colab e Apache Spark
14 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é direcionado a cientistas de dados e engenheiros de nível intermediário que desejam utilizar o Google Colab e o Apache Spark para processamento e análise de big data.
Ao final deste treinamento, os participantes serão capazes de:
- Configurar um ambiente de big data usando o Google Colab e o Spark.
- Processar e analisar grandes conjuntos de dados de forma eficiente com o Apache Spark.
- Visualizar big data em um ambiente colaborativo.
- Integrar o Apache Spark a ferramentas baseadas em nuvem.
Apache NiFi para Administradores
21 HorasO Apache NiFi é uma plataforma de integração de dados e processamento de eventos de código aberto, baseada em fluxos. Ele permite o roteamento automatizado de dados em tempo real, transformação e mediação entre sistemas distintos, com interface web (UI) e controle granular.
Este treinamento ao vivo, ministrado por instrutor (presencial ou remoto), destina-se a administradores e engenheiros de nível intermediário que desejam implantar, gerenciar, proteger e otimizar fluxos de dados do NiFi em ambientes de produção.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar, configurar e manter clusters do Apache NiFi.
- Projetar e gerenciar fluxos de dados provenientes de diversas fontes e destinos.
- Implementar lógica de automação de fluxos, roteamento e transformação.
- Otimizar o desempenho, monitorar operações e solucionar problemas.
Formato do Curso
- Palestra interativa com discussões sobre arquiteturas de casos reais.
- Laboratórios práticos: construção, implantação e gerenciamento de fluxos.
- Exercícios baseados em cenários em ambiente de laboratório ao vivo.
Opções de Personalização do Curso
- Para solicitar um treinamento personalizado para este curso, entre em contato conosco para organizar.
PySpark e Aprendizado de Máquina
21 HorasEsta formação oferece uma introdução prática à construção de fluxos de trabalho escalonáveis de processamento de dados e aprendizado de máquina utilizando PySpark. Os participantes aprenderão como o Apache Spark opera dentro dos modernos ecossistemas de Big Data e como processar grandes conjuntos de dados de maneira eficiente, aplicando os princípios da computação distribuída.
Fundamentos do Apache Spark
21 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é voltado para engenheiros que desejam configurar e implantar o sistema Apache Spark para processar grandes volumes de dados.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Apache Spark.
- Processar rapidamente e analisar grandes conjuntos de dados.
- Compreender as diferenças entre o Apache Spark e o Hadoop MapReduce, e saber quando usar cada um.
- Integrar o Apache Spark com outras ferramentas de aprendizado de máquina.
Administração do Apache Spark
35 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é voltado para administradores de sistemas de nível iniciante a intermediário que desejam implantar, manter e otimizar clusters Spark.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Apache Spark em vários ambientes.
- Gerenciar recursos do cluster e monitorar aplicativos Spark.
- Otimizar o desempenho dos clusters Spark.
- Implementar medidas de segurança e garantir alta disponibilidade.
- Depurar e resolver problemas comuns do Spark.
Apache Spark na Nuvem
21 HorasA curva de aprendizado do Apache Spark começa lenta, exigindo muito esforço para obter os primeiros resultados. Este curso tem como objetivo superar essa fase inicial difícil. Após concluir este curso, os participantes compreenderão o básico do Apache Spark, saberão diferenciar claramente RDD de DataFrame, aprenderão as APIs em Python e Scala, entenderão executores e tarefas, etc. Além disso, seguindo as melhores práticas, este curso dá ênfase à implantação em nuvem, Databricks e AWS. Os alunos também compreenderão as diferenças entre AWS EMR e AWS Glue, um dos serviços Spark mais recentes da AWS.
PÚBLICO-ALVO:
Engenheiro de Dados, DevOps, Cientista de Dados
Python e Spark para Big Data (PySpark)
21 HorasNeste treinamento presencial e guiado por instrutor em Brasil, os participantes aprenderão a utilizar Python e Spark em conjunto para analisar grandes volumes de dados, enquanto realizam exercícios práticos.
Ao final deste treinamento, os participantes serão capazes de:
- Apprender como usar o Spark com o Python para analisar Big Data.
- Trabalhar em exercícios que simulam casos reais.
- Utilizar diversas ferramentas e técnicas para análise de big data por meio do PySpark.
Python, Spark e Hadoop para Big Data
21 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é direcionado a desenvolvedores que desejam utilizar e integrar Spark, Hadoop e Python para processar, analisar e transformar conjuntos de dados grandes e complexos.
Ao final deste treinamento, os participantes serão capazes de:
- Configurar o ambiente necessário para começar a processar big data com Spark, Hadoop e Python.
- Compreender as funcionalidades, componentes principais e arquitetura do Spark e do Hadoop.
- Aprender como integrar Spark, Hadoop e Python para o processamento de big data.
- Explorar as ferramentas do ecossistema do Spark (Spark MLlib, Spark Streaming, Kafka, Sqoop, Kafka e Flume).
- Construir sistemas de recomendação por filtragem colaborativa semelhantes aos da Netflix, YouTube, Amazon, Spotify e Google.
- Utilizar o Apache Mahout para escalonar algoritmos de aprendizado de máquina.
Stratio: Módulos Rocket e Intelligence com PySpark
14 HorasA Stratio é uma plataforma centrada em dados que integra big data, inteligência artificial (IA) e governança em uma única solução. Seus módulos Rocket e Intelligence permitem exploração rápida de dados, transformação e análises avançadas em ambientes corporativos.
Esta formação presencial (online ou ao vivo) é direcionada a profissionais de dados de nível intermediário que desejam usar os módulos Rocket e Intelligence da Stratio de forma eficaz com PySpark, com foco em estruturas de repetição, funções definidas pelo usuário (UDFs) e lógica de dados avançada.
Ao final desta formação, os participantes serão capazes de:
- Navegar e trabalhar na plataforma Stratio utilizando os módulos Rocket e Intelligence.
- Aplicar o PySpark no contexto de ingestão, transformação e análise de dados.
- Usar laços de repetição e lógica condicional para controlar fluxos de trabalho e tarefas de engenharia de recursos (feature engineering).
- Criar e gerenciar funções definidas pelo usuário (UDFs) para operações reutilizáveis em PySpark.
Formato do Curso
- Palestra interativa e discussão.
- Diversos exercícios e práticas.
- Implementação prática em ambiente de laboratório ao vivo (live-lab).
Opções de Personalização do Curso
- Para solicitar uma formação personalizada para este curso, entre em contato conosco para organizarmos os detalhes.
Centro de Administração do Talend (TAC)
14 HorasEste treinamento ao vivo com instrutor em Brasil (online ou presencial) é voltado para administradores de sistemas, cientistas de dados e analistas de negócios que desejam configurar o Talend Administration Center para implantar e gerenciar os papéis e tarefas da organização.
Ao final deste treinamento, os participantes serão capazes de:
- Instalar e configurar o Talend Administration Center.
- Compreender e implementar os fundamentos da gestão do Talend.
- Criar, implantar e executar projetos ou tarefas comerciais no Talend.
- Monitorar a segurança de conjuntos de dados e desenvolver rotinas comerciais com base na estrutura do TAC.
- Obter uma compreensão mais ampla das aplicações de big data.
Talend Data Stewardship
14 HorasEste treinamento ao vivo, ministrado por instrutor em Brasil (online ou presencial), é destinado a analistas de dados de nível básico a intermediário que desejam aprofundar seu conhecimento e habilidades no gerenciamento e na melhoria da qualidade de dados usando o Talend Data Stewardship.
Ao final deste treinamento, os participantes serão capazes de:
- Compreender de forma abrangente o papel do data stewardship na manutenção da qualidade dos dados.
- Utilizar o Talend Data Stewardship para gerenciar tarefas relacionadas à qualidade dos dados.
- Criar, atribuir e gerenciar tarefas dentro do Talend Data Stewardship, incluindo a personalização de fluxos de trabalho.
- Usar os recursos de relatórios e monitoramento da ferramenta para acompanhar os esforços de qualidade dos dados e data stewardship.
Talend Open Studio para ESB
21 HorasNeste treinamento ao vivo e ministrado por instrutor em Brasil, os participantes aprenderão como utilizar o Talend Open Studio para ESB para criar, conectar, mediar e gerenciar serviços e suas interações.
Ao final deste treinamento, os participantes serão capazes de:
- Integrar, aprimorar e entregar tecnologias de ESB como pacotes únicos em diversos ambientes de implantação.
- Compreender e utilizar os componentes mais utilizados do Talend Open Studio.
- Integrar qualquer aplicativo, banco de dados, API ou serviço Web.
- Realizar a integração contínua de sistemas e aplicativos heterogêneos.
- Incorporar bibliotecas de código Java existentes para estender projetos.
- Aproveitar componentes e códigos da comunidade para estender projetos.
- Integrar rapidamente sistemas, aplicativos e fontes de dados em um ambiente Eclipse com recursos de arrastar e soltar.
- Reduzir o tempo de desenvolvimento e os custos de manutenção gerando código otimizado e reutilizável.