Hadoop-2.2.0中文文档——Hadoop MapReduce 下一代 —配置一个单节点集群

219次阅读

共计 4101 个字符，预计需要花费 11 分钟才能阅读完成。

Mapreduce 包

你需从发布页面获得 MapReduce tar 包。若不能，你要将源码打成 tar 包。

$ mvn clean install -DskipTests
$ cd Hadoop-mapreduce-project
$ mvn clean install assembly:assembly -Pnative

注意：你需要安装有 protoc 2.5.0。

忽略本地建立 mapreduce，你可以在 maven 中省略 -Pnative 参数。tar 包应该在 target/directory。

相关阅读：

Ubuntu 13.04 上搭建 Hadoop 环境 http://www.linuxidc.com/Linux/2013-06/86106.htm
Ubuntu 12.10 +Hadoop 1.2.1 版本集群配置 http://www.linuxidc.com/Linux/2013-09/90600.htm
Ubuntu 上搭建 Hadoop 环境（单机模式 + 伪分布模式）http://www.linuxidc.com/Linux/2013-01/77681.htm
Ubuntu 下 Hadoop 环境的配置 http://www.linuxidc.com/Linux/2012-11/74539.htm
单机版搭建 Hadoop 环境图文教程详解 http://www.linuxidc.com/Linux/2012-02/53927.htm
搭建 Hadoop 环境（在 Winodws 环境下用虚拟机虚拟两个 Ubuntu 系统进行搭建）http://www.linuxidc.com/Linux/2011-12/48894.htm

配置环境

假设你已经安装 hadoop-common/hadoop-hdfs，并且输出了 $HADOOP_COMMON_HOME/$HADOOP_HDFS_HOME， 解压 hadoop mapreduce 包，配置环境变量 $HADOOP_MAPRED_HOME 到要安装的目录。$HADOOP_YARN_HOME 的配置和 $HADOOP_MAPRED_HOME一样.

注意：下面的操作假设你已经运行了 hdfs。

设置配置信息

要启动 ResourceManager and NodeManager, 你必须升级配置。假设你的 $HADOOP_CONF_DIR 是配置目录，并且已经安装了 HDFS 和 core-site.xml。还有 2 个配置文件你必须设置 mapred-site.xml 和yarn-site.xml.

设置 `mapred-site.xml`

添加下面的配置到你的mapred-site.xml.

<property>
    <name>mapreduce.cluster.temp.dir</name>
    <value></value>
    <description>No description</description>
    <final>true</final>
  </property>

  <property>
    <name>mapreduce.cluster.local.dir</name>
    <value></value>
    <description>No description</description>
    <final>true</final>
  </property>

添加下面的配置到你的yarn-site.xml.

<property>
    <name>yarn.resourcemanager.resource-tracker.address</name>
    <value>host:port</value>
    <description>host is the hostname of the resource manager and 
    port is the port on which the NodeManagers contact the Resource Manager.
    </description>
  </property>

  <property>
    <name>yarn.resourcemanager.scheduler.address</name>
    <value>host:port</value>
    <description>host is the hostname of the resourcemanager and port is the port
    on which the Applications in the cluster talk to the Resource Manager.
    </description>
  </property>

  <property>
    <name>yarn.resourcemanager.scheduler.class</name>
    <value>org.apache.hadoop.yarn.server.resourcemanager.scheduler.capacity.CapacityScheduler</value>
    <description>In case you do not want to use the default scheduler</description>
  </property>

  <property>
    <name>yarn.resourcemanager.address</name>
    <value>host:port</value>
    <description>the host is the hostname of the ResourceManager and the port is the port on
    which the clients can talk to the Resource Manager. </description>
  </property>

  <property>
    <name>yarn.nodemanager.local-dirs</name>
    <value></value>
    <description>the local directories used by the nodemanager</description>
  </property>

  <property>
    <name>yarn.nodemanager.address</name>
    <value>0.0.0.0:port</value>
    <description>the nodemanagers bind to this port</description>
  </property>  

  <property>
    <name>yarn.nodemanager.resource.memory-mb</name>
    <value>10240</value>
    <description>the amount of memory on the NodeManager in GB</description>
  </property>
 
  <property>
    <name>yarn.nodemanager.remote-app-log-dir</name>
    <value>/app-logs</value>
    <description>directory on hdfs where the application logs are moved to </description>
  </property>

   <property>
    <name>yarn.nodemanager.log-dirs</name>
    <value></value>
    <description>the directories used by Nodemanagers as log directories</description>
  </property>

  <property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
    <description>shuffle service that needs to be set for Map Reduce to run </description>
  </property>

设置 `capacity-scheduler.xml`

确保你放置根队列到capacity-scheduler.xml.

 <property>
    <name>yarn.scheduler.capacity.root.queues</name>
    <value>unfunded,default</value>
  </property>
  
  <property>
    <name>yarn.scheduler.capacity.root.capacity</name>
    <value>100</value>
  </property>
  
  <property>
    <name>yarn.scheduler.capacity.root.unfunded.capacity</name>
    <value>50</value>
  </property>
  
  <property>
    <name>yarn.scheduler.capacity.root.default.capacity</name>
    <value>50</value>
  </property>

运行守护进程

假设环境变量 $HADOOP_COMMON_HOME, $HADOOP_HDFS_HOME, $HADOO_MAPRED_HOME, $HADOOP_YARN_HOME,$JAVA_HOME 和 $HADOOP_CONF_DIR 已经设置正确。$$YARN_CONF_DIR 的设置同 $HADOOP_CONF_DIR。

运行 ResourceManager 和 NodeManager 如下：

$ cd $HADOOP_MAPRED_HOME
$ sbin/yarn-daemon.sh start resourcemanager
$ sbin/yarn-daemon.sh start nodemanager

你应该启动和运行。你可以运行 randomwriter 如下：

$ $HADOOP_COMMON_HOME/bin/hadoop jar hadoop-examples.jar randomwriter out

祝你好运。

更多 Hadoop 相关信息见Hadoop 专题页面 http://www.linuxidc.com/topicnews.aspx?tid=13

正文完

星哥玩云-微信公众号

发表至：服务器应用

2022-01-20

0

转载说明：除特殊说明外本站文章皆由CC-4.0协议发布，转载请注明出处。

使用vmstat和iostat命令进行Linux性能监控

4 KB 扇区磁盘上的 Linux：实用性建议

Lucene的配置及创建索引全文检索

Hadoop-2.2.0中文文档——Apache Hadoop 2.2.0 概览

Hadoop-2.2.0中文文档——Hadoop MapReduce 下一代 —配置一个单节点集群

配置环境

设置配置信息

设置 `mapred-site.xml`

设置 `yarn-site.xml`

设置 `capacity-scheduler.xml`

运行守护进程

选择PHP与Python，可以考虑这三个问题

Centos 7平滑无缝升级PHP7.1.0到PHP 7.1.5

介绍ansible的Ad-hoc与commands模块

Linux安装使用pidstat命令以对进程数据进行监控

linux下使用tree命令以树形结构显示文件目录结构

如何处理 git使用中push报错

一起来看 VMware之网络设置

如何解决Linux主机改名后无法启动MySQL

悄悄告诉你10 条加速 Ubuntu Linux 的杀手级技巧

利用.htaccess文件保护网站目录隐私

Hadoop-2.2.0中文文档——Hadoop MapReduce 下一代 —配置一个单节点集群

配置环境

设置配置信息

设置 mapred-site.xml

设置 yarn-site.xml

设置 capacity-scheduler.xml

运行守护进程

设置 `mapred-site.xml`

设置 `yarn-site.xml`

设置 `capacity-scheduler.xml`