Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Cada sessão dura 2 horas
Dia 1: Sessão 1: Visão Geral de Negócios sobre Por Que Inteligência de Negócios em Big Data no Governo
- Estudos de caso do NIH, DoE
- Taxa de adaptação do Big Data nas agências governamentais e como estão alinhando suas operações futuras à análise preditiva de Big Data
- Áreas de aplicação de larga escala em DoD, NSA, IRS, USDA etc.
- Interface do Big Data com dados legados
- Compreensão básica das tecnologias habilitadoras na análise preditiva
- Integração de dados e visualização em dashboards
- Gestão de fraudes
- Geração de regras de negócios/detecção de fraudes
- Detecção de ameaças e perfilamento
- Análise de custo-benefício para a implementação de Big Data
Dia 1: Sessão 2: Introdução ao Big Data-1
- Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
- Armazéns de dados – esquema estático, conjunto de dados que evolui lentamente
- Bancos de dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica etc.
- Soluções baseadas em Hadoop – sem condições sobre a estrutura do conjunto de dados.
- Padrão típico : HDFS, MapReduce (crunch), recuperação do HDFS
- Processamento em lote (Batch) – adequado para análise/não interativo
- Volume : dados de streaming CEP
- Escolhas típicas – produtos CEP (e.g. Infostreams, Apama, MarkLogic etc)
- Menos pronto para produção – Storm/S4
- Bancos de dados NoSQL – (colunar e chave-valor): Mais adequados como complemento analítico ao armazém de dados/banco de dados
Dia 1 : Sessão 3 : Introdução ao Big Data-2
Soluções NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Banco de Objetos - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Dados: Introdução à questão da Limpeza de Dados em Big Data
- RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
- NoSQL – semi estruturado, estrutura suficiente para armazenar dados sem um esquema exato antes do armazenamento
- Problemas de limpeza de dados
Dia 1 : Sessão 4 : Introdução ao Big Data-3 : Hadoop
- Quando selecionar Hadoop?
- ESTRUTURADO - Armazéns de dados/bancos de dados empresariais podem armazenar dados massivos (a um custo) mas impõem estrutura (não bom para exploração ativa)
- Dados SEMI ESTRUTURADOS – difícil de lidar com soluções tradicionais (DW/DB)
- Armazenar dados em warehouse = grande esforço e estático mesmo após a implementação
- Para variedade e volume de dados, processado em hardware de commodity – HADOOP
- Hardware de commodity necessário para criar um Cluster Hadoop
Introdução ao Map Reduce /HDFS
- MapReduce – distribuição de computação sobre múltiplos servidores
- HDFS – torna os dados disponíveis localmente para o processo de computação (com redundância)
- Dados – podem ser não estruturados/sem esquema (ao contrário de RDBMS)
- Responsabilidade do desenvolvedor de dar sentido aos dados
- Programação MapReduce = trabalhar com Java (prós/contras), carregando manualmente dados para o HDFS
Dia 2: Sessão 1: Ecossistema de Big Data - Construindo ETL de Big Data: universo de Ferramentas de Big Data - qual usar e quando?
- Hadoop vs. Outras soluções NoSQL
- Para acesso interativo e aleatório a dados
- Hbase (banco de dados orientado a colunas) sobre o Hadoop
- Acesso aleatório a dados, mas com restrições impostas (máx 1 PB)
- Não bom para análise ad-hoc, bom para logging, contagem, séries temporais
- Sqoop - Importação de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
- Flume – Dados de streaming (e.g. dados de log) para HDFS
Dia 2: Sessão 2: Sistema de Gerenciamento de Big Data
- Movimento de partes, início/falha de nós de computação :ZooKeeper - Para serviços de configuração/coordenação/nomeação
- Pipeline/workflow complexo: Oozie – gerenciar workflow, dependências, corrente de tarefas
- Implantação, configuração, gerenciamento de cluster, atualização etc (admin de sistemas) :Ambari
- Na Nuvem : Whirr
Dia 2: Sessão 3: Análise Preditiva em Inteligência de Negócios -1: Técnicas Fundamentais e BI baseado em Machine learning :
- Introdução ao Machine learning
- Técnicas de aprendizado de classificação
- Predição Bayesiana-preparação do arquivo de treinamento
- Support Vector Machine
- KNN p-Tree Algebra & mineração vertical
- Rede Neural
- Problema de variáveis grandes em Big Data -Random forest (RF)
- Problema de Automação em Big Data – Ensemble de modelos múltiplos RF
- Automação através do Soft10-M
- Ferramenta de análise textual-Treeminer
- Aprendizado ágil
- Aprendizado baseado em agentes
- Aprendizado distribuído
- Introdução a Ferramentas de Código Aberto para análise preditiva : R, Rapidminer, Mahut
Dia 2: Sessão 4 Ecossistema de análise preditiva-2: Problemas comuns de análise preditiva no Governo.
- Análise de insights
- Análise de visualização
- Análise preditiva estruturada
- Análise preditiva não estruturada
- Perfilamento de ameaças/fraudes/fornecedores
- Motor de Recomendação
- Detecção de padrões
- Descoberta de Regras/Cenários –falha, fraude, otimização
- Descoberta de causa raiz
- Análise de sentimento
- Análise de CRM
- Análise de rede
- Análise de Texto
- Revisão assistida por tecnologia
- Análise de fraudes
- Análise em Tempo Real
Dia 3 : Sessão 1 : Análise em Tempo Real e Escalável sobre Hadoop
- Por que algoritmos de análise comuns falham em Hadoop/HDFS
- Apache Hama- para computação distribuída Bulk Synchronous
- Apache SPARK- para computação em cluster para análise em tempo real
- CMU Graphics Lab2- Abordagem assíncrona baseada em gráficos para computação distribuída
- Abordagem baseada em KNN p-Algebra do Treeminer para redução de custo de hardware de operação
Dia 3: Sessão 2: Ferramentas para eDiscovery e Forense
- eDiscovery sobre Big Data vs. dados Legados – uma comparação de custo e desempenho
- Codificação preditiva e revisão assistida por tecnologia (TAR)
- Demonstração ao vivo de um produto TAR (vMiner) para entender como o TAR funciona para descoberta mais rápida
- Indexação mais rápida através do HDFS –velocidade de dados
- NLP ou Processamento de Linguagem Natural –várias técnicas e produtos de código aberto
- eDiscovery em línguas estrangeiras-tecnologia para processamento de idiomas estrangeiros
Dia 3 : Sessão 3: Big Data BI para Cibersegurança – Entendendo a visão 360 graus completa da coleta rápida de dados à identificação de ameaças
- Entendendo os básicos da análise de segurança-superfície de ataque, configuração de segurança incorreta, defesas do host
- Infraestrutura de rede/ Grande pipeline de dados / ETL de Resposta para análise em tempo real
- Prescritivo vs preditivo – Regras fixas baseadas em regras vs auto-descoberta de regras de ameaças a partir de Metadados
Dia 3: Sessão 4: Big Data na USDA : Aplicação na Agricultura
- Introdução ao IoT ( Internet das Coisas) para agricultura-Big Data baseado em sensores e controle
- Introdução à imagem de satélite e sua aplicação na agricultura
- Integrando dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
- Seguro agrícola e Big Data
- Previsão de Perda de Safra
Dia 4 : Sessão 1: Prevenção de Fraudes BI de Big Data no Governo-Análise de Fraudes:
- Classificação básica de análise de fraudes- baseada em regras vs análise preditiva
- Machine learning supervisionado vs não supervisionado para detecção de padrões de fraude
- Fraude/faturamento excessivo de fornecedores em projetos
- Fraude em Medicare e Medicaid- técnicas de detecção de fraude para processamento de solicitações
- Fraudes em reembolso de viagens
- Fraudes em reembolso da IRS
- Estudos de caso e demonstrações ao vivo serão fornecidos sempre que houver dados disponíveis.
Dia 4 : Sessão 2: Análise de Mídias Sociais- Coleta e análise de inteligência
- API de ETL de Big Data para extração de dados de mídias sociais
- Texto, imagem, metadados e vídeo
- Análise de sentimento de feeds de mídias sociais
- Filtragem contextual e não contextual de feeds de mídias sociais
- Dashboard de Mídias Sociais para integrar diversas mídias sociais
- Perfilamento automatizado de perfis de mídias sociais
- Demonstração ao vivo de cada análise será fornecida através da Ferramenta Treeminer.
Dia 4 : Sessão 3: Análise de Big Data em processamento de imagem e feeds de vídeo
- Técnicas de Armazenamento de Imagem em Big Data- Solução de armazenamento para dados excedendo petabytes
- LTFS e LTO
- GPFS-LTFS ( Solução de armazenamento em camadas para Big image data)
- Fundamentos da análise de imagem
- Reconhecimento de objetos
- Segmentação de imagem
- Rastreamento de movimento
- Reconstrução de imagem 3-D
Dia 4: Sessão 4: Aplicações de Big Data no NIH:
- Áreas emergentes da Bio-informática
- Meta-genômica e questões de mineração de Big Data
- Análise Preditiva de Big Data para Farmacogenômica, Metabolômica e Proteômica
- Big Data no processo descendente de Genômica
- Aplicação da análise preditiva de Big Data na Saúde Pública
Dashboard de Big Data para acessibilidade rápida a dados diversos e exibição :
- Integração da plataforma de aplicação existente com o Dashboard de Big Data
- Gerenciamento de Big Data
- Estudo de Caso de Dashboard de Big Data: Tableau e Pentaho
- Use app de Big Data para empregar serviços baseados em localização no Governo.
- Sistema de rastreamento e gerenciamento
Dia 5 : Sessão 1: Como justificar a implementação de BI de Big Data dentro de uma organização:
- Definindo ROI para a implementação de Big Data
- Estudos de caso para economia de Tempo de Analista para coleta e preparação de Dados –aumento no ganho de produtividade
- Estudos de caso de ganho de receita da economia do custo de banco de dados licenciado
- Ganho de receita de serviços baseados em localização
- Economia da prevenção de fraudes
- Uma abordagem integrada de planilha eletrônica para calcular aproximadamente despesa vs. ganho de receita/economia da implementação de Big Data.
Dia 5 : Sessão 2: Procedimento passo a passo para substituir o sistema de dados legado pelo Sistema de Big Data:
- Entendendo o Mapa da Rota Prático de Migração de Big Data
- Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
- Quais são as diferentes formas de calcular volume, velocidade, variedade e veracidade de dados
- Como estimar o crescimento de dados
- Estudos de caso
Dia 5: Sessão 4: Revisão de Vendedores de Big Data e revisão de seus produtos. Sessão de Q/A:
- Accenture
- APTEAN (Antes CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Antes 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte da EMC)
Requisitos
- Conhecimento básico de operações de negócios e sistemas de dados no governo em sua área de atuação
- Compreensão básica de SQL/Oracle ou banco de dados relacional
- Compreensão básica de Estatística (nível de planilha eletrônica)
35 Horas
Testemunhos de Clientes (1)
A capacidade do instrutor de alinhar o curso com os requisitos da organização, e não apenas oferecer o curso por mera formalidade.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Máquina Traduzida