Entrar em Contato

Programa do Curso

Cada sessão tem 2 horas

Dia-1: Sessão-1: Visão Geral de Negócios sobre Por que Inteligência de Negócios com Big Data no Governo

  • Estudos de caso do NIH e DoE
  • Taxa de adaptação do Big Data nas Agências Governamentais & como elas estão alinhando suas operações futuras em torno da Análise Preditiva com Big Data
  • Ampla gama de áreas de aplicação no DoD, NSA, IRS, USDA, etc.
  • Integração do Big Data com dados legados
  • Compreensão básica das tecnologias habilitadoras na análise preditiva
  • Integração de Dados & Visualização em painéis (Dashboards)
  • Gestão de Fraudes
  • Geração de Regras de Negócio / Detecção de Fraudes
  • Detecção e perfilamento de ameaças
  • Análise custo-benefício para implementação de Big Data

Dia-1: Sessão-2: Introdução ao Big Data-1

  • Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
  • Data Warehouses – esquema estático, conjunto de dados de evolução lenta
  • Bancos de Dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluções baseadas em Hadoop – sem restrições quanto à estrutura do conjunto de dados.
  • Padrão típico: HDFS, MapReduce (processamento), recuperação do HDFS
  • Lote (Batch) - adequado para análise/não interativo
  • Volume: streaming de CEP (Event Processing)
  • Escolhas típicas – produtos CEP (ex. Infostreams, Apama, MarkLogic, etc.)
  • Pouco pronto para produção – Storm/S4
  • Bancos de Dados NoSQL – (colunar e chave-valor): Mais adequados como complemento analítico ao data warehouse/banco de dados

Dia-1: Sessão-3: Introdução ao Big Data-2

Soluções NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, MongoDB, DovetailDB
  • KV Store (Hierárquico) - GT.m, Cache
  • KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • Cachê KV - Memcached, Repcached, Coherence, Infinispan, ExtremeScale, JBossCache, Velocity, Terracotta
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Banco de Dados de Objetos - ZopeDB, DB4J, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Preserve, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variety of Data: Introdução à questão da limpeza de dados no Big Data

  • RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
  • NoSQL – semiestruturado, estrutura suficiente para armazenar dados sem um esquema exato antes do armazenamento
  • Questões de limpeza de dados

Dia-1: Sessão-4: Introdução ao Big Data-3 : Hadoop

  • Quando selecionar o Hadoop?
  • ESTRUTURADO - Data warehouses/databases empresariais podem armazenar dados massivos (a um custo), mas impõem estrutura (não é bom para exploração ativa)
  • Dados SEMI ESTRUTURADOS – difíceis de lidar com soluções tradicionais (DW/DB)
  • Armazenamento em data warehouse = ESFORÇO ENORME e estático mesmo após a implementação
  • Para variedade & volume de dados, processado em hardware genérico – HADOOP
  • Hardware genérico necessário para criar um Cluster Hadoop

Introdução ao MapReduce / HDFS

  • MapReduce – distribuir computação entre vários servidores
  • HDFS – tornar os dados disponíveis localmente para o processo de computação (com redundância)
  • Dados – podem ser não estruturados/sem esquema (diferente do RDBMS)
  • O desenvolvedor é responsável por dar sentido aos dados
  • Programação MapReduce = trabalhar com Java (prós/contras), carregamento manual de dados no HDFS

Dia-2: Sessão-1: Ecossistema de Big Data - Construindo ETL de Big Data: universo de ferramentas de Big Data - qual usar e quando?

  • Hadoop vs. Outras soluções NoSQL
  • Para acesso interativo e aleatório aos dados
  • HBase (banco de dados orientado a colunas) sobre o Hadoop
  • Acesso aleatório aos dados, mas com restrições impostas (máx. 1 PB)
  • Não é bom para análises ad-hoc, bom para logs, contagens e séries temporais
  • Sqoop - Importar de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
  • Flume – Streams de dados (ex. log data) para o HDFS

Dia-2: Sessão-2: Sistema de Gerenciamento de Big Data

  • Componentes móveis, nós de computação iniciam/falham: ZooKeeper - Para serviços de configuração/coordenação/nomeação
  • Pipeline/workflow complexo: Oozie – gerenciar workflow, dependências e cadeia (daisy chain)
  • Implantar, configurar, gerenciar clusters, atualizar etc. (sys admin): Ambari
  • Na Nuvem: Whirr

Dia-2: Sessão-3: Análise Preditiva em Inteligência de Negócios -1: Técnicas Fundamentais & BI baseado em Machine Learning :

  • Introdução ao Machine Learning
  • Aprendizado de técnicas de classificação
  • Predição Bayesiana - preparando arquivo de treinamento
  • Máquinas de Vetores de Suporte (SVM)
  • KNN p-Tree Algebra & mineração vertical
  • Rede Neural
  • Problema de grandes variáveis no Big Data - Random Forest (RF)
  • Problema de Automação no Big Data – Ensemble Multi-modelo RF
  • Automação através do Soft10-M
  • Ferramenta de Análise de Texto - Treeminer
  • Aprendizado Ágil
  • Aprendizado baseado em agentes
  • Aprendizado Distribuído
  • Introdução às Ferramentas Open Source para Análise Preditiva: R, Rapidminer, Mahout

Dia-2: Sessão-4 Ecossistema de Análise Preditiva-2: Problemas comuns de análise preditiva no Governo

  • Análise de insights
  • Análise visual
  • Análise preditiva estruturada
  • Análise preditiva não estruturada
  • Perfilamento de ameaças/fraude/fornecedor
  • Motor de Recomendação
  • Detecção de padrões
  • Descoberta de regras/cenários – falha, fraude, otimização
  • Descoberta da causa raiz
  • Análise de sentimento
  • Análise CRM
  • Análise de rede
  • Análise de texto
  • Revisão assistida por tecnologia
  • Análise de fraude
  • Análise em Tempo Real

Dia-3: Sessão-1: Análise em Tempo Real e Escalável sobre Hadoop

  • Por que algoritmos de análise comuns falham no Hadoop/HDFS
  • Apache Hama - para computação distribuída síncrona em massa (Bulk Synchronous)
  • Apache SPARK - para computação em cluster para análise em tempo real
  • Laboratório de Gráficos CMU2 - Abordagem assíncrona baseada em grafos para computação distribuída
  • Abordagem baseada em p-Algebra KNN do Treeminer para reduzir o custo operacional de hardware

Dia-3: Sessão-2: Ferramentas eDiscovery e Forense

  • eDiscovery sobre Big Data vs. Dados Legados – uma comparação de custo e desempenho
  • Codificação Preditiva e revisão assistida por tecnologia (TAR)
  • Demo ao vivo de um produto TAR (vMiner) para entender como o TAR funciona para descoberta mais rápida
  • Indexação mais rápida através do HDFS – velocidade dos dados
  • PNL ou Processamento de Linguagem Natural – várias técnicas e produtos open source
  • eDiscovery em idiomas estrangeiros - tecnologia para processamento de línguas estrangeiras

Dia-3: Sessão 3: Big Data BI para Segurança Cibernética – Compreendendo visões completas de 360 graus da coleta rápida de dados até a identificação de ameaças

  • Compreender os fundamentos da análise de segurança - superfície de ataque, configurações incorretas de segurança, defesas de host
  • Infraestrutura de rede / grande pipeline de dados / ETL de resposta para análise em tempo real
  • Preditivo prescritivo vs. Preditivo – baseado em regras fixas vs. descoberta automática de regras de ameaça a partir de metadados

Dia-3: Sessão 4: Big Data no USDA : Aplicação na Agricultura

  • Introdução à IoT (Internet das Coisas) para agricultura - sensor based Big Data e controle
  • Introdução à imagem de satélite e sua aplicação na agricultura
  • Integração de dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
  • Seguro agrícola e Big Data
  • Previsão de perda de safras

Dia-4: Sessão-1: Prevenção de Fraudes com BI a partir de Big Data no Governo - Análise de Fraude:

  • Classificação básica da análise de fraude - baseada em regras vs. análise preditiva
  • Aprendizado supervisionado vs não supervisionado para detecção de padrões de fraude
  • Fraude de fornecedores / cobrança excessiva por projetos
  • Fraude no Medicare e Medicaid - técnicas de detecção de fraudes para processamento de reivindicações
  • Fraudes em reembolsos de viagem
  • Fraudes em restituições do IRS
  • Estudos de caso e demonstração ao vivo serão fornecidos sempre que os dados estiverem disponíveis.

Dia-4: Sessão-2: Análise de Mídias Sociais - Coleta e análise de inteligência

  • API ETL de Big Data para extração de dados de mídias sociais
  • Texto, imagem, metadados e vídeo
  • Análise de sentimento a partir do feed de mídias sociais
  • Filtragem contextual e não contextual do feed de mídias sociais
  • Painel de Mídias Sociais para integrar diversas mídias sociais
  • Perfilamento automatizado de perfis de mídias sociais
  • Demonstração ao vivo de cada análise será fornecida através da ferramenta Treeminer.

Dia-4: Sessão-3: Análise de Big Data em processamento de imagens e feeds de vídeo

  • Técnicas de armazenamento de imagens no Big Data - Solução de armazenamento para dados que excedem petabytes
  • LTFS e LTO
  • GPFS-LTFS (Solução de armazenamento em camadas para dados de imagem grande)
  • Fundamentos da análise de imagens
  • Reconhecimento de objetos
  • Ssegmentação de imagem
  • Rastreamento de movimento
  • Reconstrução de imagem 3D

Dia-4: Sessão-4: Aplicações de Big Data no NIH:

  • Áreas emergentes da Bioinformática
  • Metagenômica e questões de mineração de Big Data
  • Análise Preditiva com Big Data para Farmacogenômica, Metabolômica e Proteômica
  • Big Data no processo downstream de genômica
  • Aplicação da análise preditiva de Big Data na saúde pública

Painel (Dashboard) de Big Data para acesso rápido e exibição diversificada de dados :

  • Integração da plataforma de aplicativos existente com o Painel de Big Data
  • Gestão de Big Data
  • Estudo de Caso do Painel de Big Data: Tableau e Pentaho
  • Uso de aplicativos de Big Data para impulsionar serviços baseados em localização no Governo
  • Sistema de rastreamento e gestão

Dia-5 : Sessão-1: Como justificar a implementação de BI com Big Data dentro de uma organização:

  • Definindo ROI para implementação de Big Data
  • Estudos de caso para economia de tempo do analista na coleta e preparação de dados – aumento no ganho de produtividade
  • Estudos de caso de ganho de receita ao economizar custos de banco de dados licenciado
  • Ganho de receita a partir de serviços baseados em localização
  • Economia proveniente da prevenção de fraudes
  • Uma abordagem integrada de planilha para calcular despesa aproximada vs. ganho/economia de receita da implementação de Big Data.

Dia-5 : Sessão-2: Procedimento passo a passo para substituir o sistema de dados legado por um sistema de Big Data:

  • Compreendendo o roteiro prático de migração de Big Data
  • Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
  • Quais são as diferentes maneiras de calcular volume, velocidade, variedade e veracidade dos dados
  • Como estimar o crescimento dos dados
  • Estudos de caso

Dia-5: Sessão 4: Revisão de fornecedores de Big Data e revisão de seus produtos. Sessão de Perguntas e Respostas:

  • Accenture
  • APTEAN (anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte da EMC)

Requisitos

  • Conhecimento básico de operações de negócios e sistemas de dados governamentais no seu domínio
  • Compreensão básica de SQL/Oracle ou bancos de dados relacionais
  • Compreensão básica de Estatísticas (ao nível de planilha)
 35 Horas

Número de participantes


Preço por participante

Testemunhos de Clientes (1)

Próximas Formações Provisórias

Categorias Relacionadas