上一页 1 2 3 4 5 6 7 ··· 12 下一页
  2014年11月30日
摘要: 概要在即将发布的spark 1.0中有一个新增的功能,即对sql的支持,也就是说可以用sql来对数据进行查询,这对于DBA来说无疑是一大福音,因为以前的知识继续生效,而无须去学什么scala或其它script.一般来说任意一个sql子系统都需要有parser,optimizer,execution三... 阅读全文
posted @ 2014-11-30 11:28 船长 阅读(192) 评论(0) 推荐(0)
摘要: 概要本文以wordCount为例,详细说明spark创建和运行job的过程,重点是在进程及线程的创建。实验环境搭建在进行后续操作前,确保下列条件已满足。下载spark binary 0.9.1安装scala安装sbt安装java启动spark-shell单机模式运行,即local模式local模式运... 阅读全文
posted @ 2014-11-30 11:27 船长 阅读(161) 评论(0) 推荐(0)
摘要: Hive是基于Hadoop的开源数据仓库工具,提供了类似于SQL的HiveQL语言,使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析。由于这一特性而收到广泛的欢迎。Hive的整体框架中有一个重要的模块是执行模块,这一部分是用Hadoop中MapRed... 阅读全文
posted @ 2014-11-30 11:27 船长 阅读(159) 评论(0) 推荐(0)
摘要: 概要图的并行化处理一直是一个非常热门的话题,这里头的重点有两个,一是如何将图的算法并行化,二是找到一个合适的并行化处理框架。Spark作为一个非常优秀的并行处理框架,将一些并行化的算法移到其上面就成了一个很自然的事情。Graphx是一些图的常用算法在Spark上的并行化实现,同时提供了丰富的API接... 阅读全文
posted @ 2014-11-30 11:27 船长 阅读(202) 评论(0) 推荐(0)
摘要: 概要“spark已经比较头痛了,还要将其运行在yarn上,yarn是什么,我一点概念都没有哎,再怎么办啊。不要跟我讲什么原理了,能不能直接告诉 我怎么将spark在yarn上面跑起来,I'm a dummy, just told me how to do it.”如果你和我一样是一个对形而上的东西不... 阅读全文
posted @ 2014-11-30 11:27 船长 阅读(296) 评论(0) 推荐(0)
摘要: 主成分分析(Principal components analysis)-最大方差解释原文链接:http://chuna2.787528.xyz/jerrylead/archive/2011/04/18/2020209.html 在这一篇之前的内容是《Factor Analysis》,由于非常理论,打算... 阅读全文
posted @ 2014-11-30 11:26 船长 阅读(183) 评论(0) 推荐(0)
摘要: 1 引言2 实例和数学背景3 旋转数据4 数据降维5 还原近似数据6 选择主成分个数7 对图像数据应用PCA算法8 参考文献9 中英文对照10 中文译者引言 主成分分析(PCA)是一种能够极大提升无监督特征学习速度的数据降维算法。更重要的是,理解PCA算法,对实现白化算法有很大的帮助,很多算法都先用... 阅读全文
posted @ 2014-11-30 11:26 船长 阅读(241) 评论(0) 推荐(0)
摘要: 概要之所以对spark shell的内部实现产生兴趣全部缘于好奇代码的编译加载过程,scala是需要编译才能执行的语言,但提供的scala repl可以实现代码的实时交互式执行,这是为什么呢?既然scala已经提供了repl,为什么spark还要自己单独搞一套spark repl,这其中的缘由到底何... 阅读全文
posted @ 2014-11-30 11:26 船长 阅读(1090) 评论(0) 推荐(0)
摘要: 概要本文就standalone部署方式下的容错性问题做比较细致的分析,主要回答standalone部署方式下的包含哪些主要节点,当某一类节点出现问题时,系统是如何处理的。Standalone部署的节点组成介绍Spark的资料中对于RDD这个概念涉及的比较多,但对于RDD如何运行起来,如何对应到进程和... 阅读全文
posted @ 2014-11-30 11:26 船长 阅读(152) 评论(0) 推荐(0)
摘要: 概要在新近发布的spark 1.0中新加了sql的模块,更为引人注意的是对hive中的hiveql也提供了良好的支持,作为一个源码分析控,了解一下spark是如何完成对hql的支持是一件非常有趣的事情。Hive简介Hive的由来以下部分摘自Hadoop definite guide中的Hive一章“... 阅读全文
posted @ 2014-11-30 11:26 船长 阅读(278) 评论(0) 推荐(0)
上一页 1 2 3 4 5 6 7 ··· 12 下一页