有关【Hadoop】的内容

Apache Kafka 2.6.0 有哪些值得关心的变化

Apache Kafka 2.6.0 于2020年08月03日正式发布。在这个版本中，社区做了很多显著的性能改进，特别是当 Broker 有非常多的分区时。Broker 关闭性能得到了显著提高；当生产者使用压缩时，性能也得到了显著提高。ACL 使用的各个方面都有不同程度的提升，并且需要更少的内存。......

w397090770 5年前 (2020-08-23) 969℃ 0评论0喜欢

ElasticSearch

滴滴ElasticSearch千万级TPS写入性能翻倍技术剖析

桔妹导读：滴滴ElasticSearch平台承接了公司内部所有使用ElasticSearch的业务，包括核心搜索、RDS从库、日志检索、安全数据分析、指标数据分析等等。平台规模达到了3000+节点，5PB 的数据存储，超过万亿条数据。平台写入的峰值写入TPS达到了2000w/s，每天近 10 亿次检索查询......

w397090770 5年前 (2020-08-19) 1554℃ 0评论8喜欢

Presto

Presto on Spark：支持即时查询和批处理

前言Facebook 的数据仓库构建在 HDFS 集群之上。在很早之前，为了能够方便分析存储在 Hadoop 上的数据，Facebook 开发了 Hive 系统，使得科学家和分析师可以使用 SQL 来方便的进行数据分析，但是 Hive 使用的是 MapReduce 作为底层的计算框架，随着数据分析的场景和数据量......

w397090770 5年前 (2020-08-09) 1743℃ 0评论4喜欢

Spark

Apache Spark 自定义优化规则：Custom Optimizer Rule

在《Apache Spark 自定义优化规则：Custom Strategy》文章中我们介绍了如何自定义策略，策略是用在逻辑计划转换到物理计划阶段。而本文将介绍如何自定义逻辑计划优化规则，主要用于优化逻辑计划，和前文不一样的地方是，逻辑优化规则只是等价变换逻辑计划，也就是 Logic P......

w397090770 5年前 (2020-08-07) 1360℃ 0评论2喜欢

Spark

Apache Spark 自定义优化规则：Custom Strategy

这篇文章本来19年5月份就想写的，最终拖到今天才整理出来😂。Spark 内置给我们带来了非常丰富的各种优化，这些优化基本可以满足我们日常的需求。但是我们知道，现实场景中会有各种各样的需求，总有一些场景在 Spark 得到的执行计划不是最优的，社区的大佬肯定也知道......

w397090770 5年前 (2020-08-05) 1167℃ 2评论3喜欢

Spark

Apache Spark 动态分区 OverWrite 问题

如果想及时了解Spark、Hadoop或者HBase相关的文章，欢迎关注微信公众号：iteblog_hadoop假设我们有以下表：scala> spark.sql("""CREATE TABLE iteblog_test (name STRING, id int) using orc PARTITIONED BY (id)""").show(100)......

w397090770 5年前 (2020-08-03) 3530℃ 0评论4喜欢

Spark

如何使用 Spark 3.0 中新加的 Structured Streaming UI 来进行异常分析

本文为阿里巴巴技术专家余根茂在社区发的一篇文章。Structured Streaming 最初是在 Apache Spark 2.0 中引入的，它已被证明是构建分布式流处理应用程序的最佳平台。SQL/Dataset/DataFrame API 和 Spark 的内置函数的统一使得开发人员可以轻松实现复杂的需求，比如支持流聚......

w397090770 5年前 (2020-07-30) 793℃ 0评论1喜欢

Idea

IntelliJ IDEA 2020.2 稳定版发布

IntelliJ IDEA 2020.2 稳定版已发布，此版本带来了不少新功能，包括支持在 IDE 中审查和合并 GitHub PR、新增加的 Inspections 小组件(Inspections Widget)支持在文件的警告和错误之间快速导航、使用 Problems 工具窗口查看当前文件中的完整问题列表，并在更改会破坏其......

w397090770 5年前 (2020-07-29) 456℃ 0评论2喜欢

Spark

Apache Spark 3.0 R 的向量化 IO

R 是数据科学中最流行的计算机语言之一，专门用于统计分析和一些扩展，如用于数据处理和机器学习任务的 RStudio addins 和其他 R 包。此外，它使数据科学家能够轻松地可视化他们的数据集。通过在 Apache Spark 中使用 SparkR，可以很容易地扩展 R 代码。要交互式地运行作业......

w397090770 5年前 (2020-07-09) 787℃ 0评论2喜欢

Spark

Spark 3.0 中七个必须知道的 SQL 性能优化

本文来自 IBM 东京研究院的高级技术人员 Kazuaki Ishizaki 博士在 Spark Summit North America 2020 的《SQL Performance Improvements at a Glance in Apache Spark 3.0》议题的分享，本文视频参见今天的推文第三条。PPT 请关注过往记忆大数据并后台回复 sparksql3 获......

w397090770 5年前 (2020-07-08) 2583℃ 0评论3喜欢

上一页
1
···
26
27
28
29
30
31
32
33
34
35
36
...
99
下一页
共 99 页