Amazon EMR 4.4.0 – Sqoop, HCatalog, Java 8 e muito mais…
Anunciamos o Amazon EMR 4.4.0, que dá suporte para Apache Sqoop (1.4.6) e Apache HCatalog 1.0.0 e libera sandbox atualizados para Presto (0,136) e Apache Zeppelin (0.5.6).
Anunciamos recentemente o lançamento do Amazon EMR 4.4.0, que adiciona suporte para Apache Sqoop (1.4.6) e Apache HCatalog 1.0.0 – uma versão atualizada do Apache Mahout (0.11.1) – e libera sandbox atualizados para Presto (0,136) e Apache Zeppelin (0.5.6).
Nós também aperfeiçoamos nossas configurações padrão do Apache Spark e adicionamos suporte para Java 8.
Novas aplicações na versão 4.4.0
O Amazon EMR simplifica o processamento de big data, oferecendo uma estrutura gerenciada, Hadoop ou Spark, que permite distribuir e processar grandes quantidades de dados em instâncias dinamicamente escaláveis do Amazon EC2 de forma fácil, rápida e econômica. Você pode criar clusters do Amazon EMR na página Amazon EMR Create Cluster, no AWS Management Console, pela AWS Command Line Interface (CLI), ou usando um SDK com uma API do EMR. Na versão mais recente, adicionamos suporte para várias novas versões das seguintes aplicações:
Zeppelin 0.5.6
O Zeppelin é um notebook interativo e colaborativo de código aberto para a exploração de dados usando Spark. O Zeppelin 0.5.6 adiciona a capacidade de importar ou exportar um notebook, armazenamento de notebook no GitHub, auto-save em navegação e suporte melhorado para Pyspark. Veja as notas de lançamento do Zeppelin ou saiba mais sobre o Zeppelin no Amazon EMR.
Presto 0,136
O Presto é um mecanismo de consulta SQL distribuída, open-source, projetada para consultas de baixa latência em grandes conjuntos de dados no Amazon S3 e HDFS. Este é um lançamento de versão menor, com suporte para matrizes maiores, binários SQL literais, capacidade de chamar procedimentos definidos pelo conector e melhorias para a interface web. Veja as notas de lançamento do Presto ou saiba mais sobre Presto na Amazon EMR.
Sqoop 1.4.6
O Sqoop é uma ferramenta para a transferência de dados em massa entre HDFS, S3 (usando EMRFS) e armazenamentos de dados estruturados, tais como bancos de dados relacionais. Você pode usar o Sqoop para transferir dados estruturados a partir de RDS e Aurora para EMR para processamento e escrever os resultados de volta para o S3, HDFS, ou outro banco de dados. Saiba mais sobre Sqoop na Amazon EMR.
Mahout 0.11.1
O Mahout é uma coleção de ferramentas e bibliotecas para criar aplicativos de aprendizado de máquina distribuídos. Esta versão inclui suporte para Spark, bem como um novo ambiente de matemática baseado no Spark chamado Samsara. Saiba mais sobre Mahout na Amazon EMR.
HCatalog 1.0.0
O HCatalog é um subprojeto dentro do projeto Apache Hive. É uma camada de gerenciamento de mesa e de armazenamento para Hadoop que utiliza o Hive Metastore. Ele possibilita que ferramentas executem o SQL em Hadoop através de uma interface REST fácil de usar.
Melhorias para as configurações padrão para Spark
Temos melhorado a nossa configuração padrão para executores do Spark a partir do Apache padrão, para melhor utilizar os recursos em seu cluster. A partir da versão 4.4.0, o EMR permite alocação dinâmica de executores por padrão, permitindo que o YARN determine quantos executores utilizar ao executar um aplicativo Spark. Além disso, a quantidade de memória utilizada para cada executor agora é determinada automaticamente pela família da instância usada no grupo de instâncias do núcleo do seu cluster.
Permitindo a alocação dinâmica e personalizando a memória do executor possibilita ao Spark utilizar todos os recursos no cluster, lançar executores adicionais sobre nós adicionados ao cluster e permitir multitenancy para aplicações Spark. O parâmetro maximizeResourceAllocation anterior ainda está disponível. No entanto, este não usa alocação dinâmica e especifica um número estático de executores para a sua aplicação Spark. Você pode ainda substituir os novos padrões usando a API de configuração ou passar parâmetros adicionais ao apresentar a sua aplicação do Spark usando o spark-submit. Saiba mais sobre a configuração do Spark no Amazon EMR.
Usando Java 8 com seus aplicativos na Amazon EMR
Por padrão, aplicativos em cluster Amazon EMR usam o Java Development Kit 7 (JDK 7) para seu ambiente de tempo de execução. No entanto, na versão 4.4.0, você pode usar o JDK 8, configurando o JAVA_HOME para apontar para JDK 8 para as variáveis de ambiente relevantes usando um objeto de configuração (embora observe que JDK 8 não é compatível com Apache Hive). Saiba mais sobre o uso do Java 8 na Amazon EMR.
Lance um Cluster Amazon EMR com a versão 4.4.0 agora
Para criar um cluster Amazon EMR com 4.4.0, selecione versão 4.4.0 na página Create Cluster no AWS Management Console ou utilize o rótulo de versão emr-4.4.0 ao criar o cluster do AWS CLI ou usando um SDK com API do EMR.








