分类：Spark

解决Spark shell模式下初始化Job出现的异常

Spark 的 shell 作为一个强大的交互式数据分析工具，提供了一个简单的方式来学习 API。它可以使用 Scala(在 Java 虚拟机上运行现有的 Java 库的一个很好方式) 或 Python。我们很可能会在Spark Shell模式下运行下面的测试代码：如果想及时了解Spark、Hadoop或者Hbase相关的文章，欢迎关注微信公共帐号：iteblog_hadoop[code lang="scala"]scala> imp

w397090770 7年前 (2017-04-26) 2870℃ 0评论9喜欢

[电子书]Mastering Spark for Data Science PDF下载

　　本书由Andrew Morgan所著，全书共560页；Packt Publishing出版社于2017年03月出版。通过本书你将学习到以下的知识：　　1、Learn the design patterns that integrate Spark into industrialized data science pipelines　　2、See how commercial data scientists design scalable code and reusable code for data science services　　3、Explore cutting edge data science methods so that you can study tre

zz~~ 7年前 (2017-04-17) 3436℃ 2评论8喜欢

Apache Spark常见的三大误解

最近几年关于Apache Spark框架的声音是越来越多，而且慢慢地成为大数据领域的主流系统。最近几年Apache Spark和Apache Hadoop的Google趋势可以证明这一点：如果想及时了解Spark、Hadoop或者Hbase相关的文章，欢迎关注微信公共帐号：iteblog_hadoop上图已经明显展示出最近五年，Apache Spark越来越受开发者们的欢迎，大家通过Google搜索更多关

w397090770 7年前 (2017-04-12) 6537℃ 0评论46喜欢

Apache Hivemall:可运行在Hive, Spark 和 Pig 上的可扩展机器学习库

　　Apache Hivemall是机器学习算法（machine learning algorithms）和多功能数据分析函数（versatile data analytics functions）的集合，它通过Apache Hive UDF / UDAF / UDTF接口提供了一些易于使用的机器学习算法。Hivemall 最初由Treasure Data 开发的，并于2016年9月捐献给 Apache 软件基金会，进入了Apache 孵化器。　　Apache Hivemall提供了各种功能包括：回归（

w397090770 7年前 (2017-03-29) 3324℃ 1评论10喜欢

object not serializable (class: org.apache.hadoop.hbase.io.ImmutableBytesWritable)

在使用Spark操作Hbase的时候，其返回的数据类型是RDD[ImmutableBytesWritable,Result]，我们可能会对这个结果进行其他的操作，比如join等，但是因为org.apache.hadoop.hbase.io.ImmutableBytesWritable 和 org.apache.hadoop.hbase.client.Result 并没有实现 java.io.Serializable 接口，程序在运行的过程中可能发生以下的异常：[code lang="bash"]Serialization stack: - object not ser

w397090770 7年前 (2017-03-23) 5331℃ 1评论13喜欢