,map reduce编程的特点？

用户投稿 2023年10月22日 12:14:53 231 0

关于“php_mapreduce”的问题，小编就整理了【3】个相关介绍“php_mapreduce”的解答：

map reduce编程的特点？

1、MapReduce 易于编程

它简单的实现一些接口，就可以完成一个分布式程序，这个分布式程序可以分布到大量廉价的机器上运行。也就是说你写一个分布式程序，跟写一个简单的串行程序是一模一样的。就是因为这个特点使得MapReduce编程变得非常流行。

2、良好的扩展性

当你的计算资源不能得到满足的时候，你可以通过简单的增加机器来扩展它的计算能力。

3、高容错性

MapReduce设计的初衷就是使程序能够部署在廉价的机器上，这就要求它具有很高的容错性。比如其中一台机器挂了，它可以把上面的计算任务转移到另外一个节点上运行，不至于这个任务运行失败，而且这个过程不需要人工参与，而完全是由Hadoop内部完成的。

4、适合PB级以上海量数据的离线处理

可以实现上千台服务器集群并发工作，提供数据处理能力。

mapreduce主要由哪四个阶段组成？

mapreduce主要由以下四个阶段组成：

1、split阶段：

此阶段，每个输入文件被分片输入到map。如一个文件有200M，默认会被分成2片，因为每片的默认较大值和每块的默认值128M相同。

如果输入为大量的小文件，则会造成过多的map数，导致效率下降，可采用压缩输入格式CombineFileInputFormat。

2、map阶段：

此阶段，执行map任务。map数由分片决定，若要增加map数，可增大mapred.map.tasks，若减少map数，可增大mapred.min.split.size。

3、shuffle阶段：

此阶段，将map的输出经过“整理”后给到reduce，也称为“混洗”。分为map端操作和reduce端操作。

在map端，map的输出先写入缓存，当每次缓存快满时，由缓存“溢写”至磁盘，每次溢写都先进行“分区”，并对每个分区的数据进行“排序”和“合并”（可选）。一般会产生多个溢写的文件，这些文件会在map端先被“归并”为一个大的磁盘文件，通知reduce任务来领取自己的分区。

在reduce端，每个reduce任务会从多个map任务领取文件，然后将这些文件进行“归并”，交给reduce任务。

mapreduce功能？

Mapreduce 是种编程模型，结合了概念"Map（映射）"和"Reduce（归约）"，用于大规模数据集（大于1TB）的并行运算。

它极大地方便了编程人员在不会分布式并行编程的情况下，将自己的程序运行在分布式系统上。

MapReduce实现了以下4大主要功能： 1）数据划分和计算任务调度系统自动将一个作业（Job）待处理的大数据划分为很多个数据块，每个数据块对应于一个计算任务（Task），并自动调度计算节点来处理相应的数据块。作业和任务调度功能主要负责分配和调度计算节点（Map节点或Reduce节点），同时负责监控这些节点的执行状态，并负责Map节点执行的同步控制。

到此，以上就是小编对于“php_mapreduce”的问题就介绍到这了，希望介绍关于“php_mapreduce”的【3】点解答对大家有用。

本文地址： http://gurugot.com/article/88420ce5.html

文章来源：用户投稿