PDF
准备1Hadoop(2):单机Hadoop环境安装大数据Contents准备 .................................................................................................... 1环境安装下载系统安装创建安装必要软件配置拷贝文件到虚拟机安装Hadoop .......................................................................................... 3设置环境修改配置文件启动作为一个从来没接触过大数据的小白,从开始来学习一下。首先是安装环境,官网给出了几种方式单机版的模式,运行在一个进程伪分布式模式,运行多个进程来模拟分布式的环境完全分布式部署在多台机器上当然最理想的当然是真实的分布式部署了,在进行分布式部署之前,先来简单的单机版本部署一下,以便熟悉一下相关的概念。准备环境安装VirtualBox因为我们的目标是在本机实现分布式的部署,来模拟真实的集群环境,所以需要利用虚拟机来构建多个独立的系统。要做到这步有很多种方式,比如:其实我最开始尝试过,这货是推出的感觉比较新的样子,但是我用了一段时间之后莫名的出现了虚拟机无法启动的情况,可能跟兼容性还不是很好吧。所以比较靠谱和简单的选择是,不仅比较稳定(虽然在上也遇到些),而且还跨平台。安装非常简单:sudo pacman -S virtualbox下直接下载二进制程序安装即可 准备2Vagrant跟这种容器平台相比一个劣势是系统的安装必须要从头开始。当然自己可以安装完成之后创建一个模板来复制虚拟机,终究比较麻烦。幸好有这个工具可以帮助来管理虚拟机,可以快速的从仓库拉取镜像来创建一个虚拟机,以及自动化的配置多个机器、网络、安装脚本等,十分方便。安装sudo pacman -S vagrant下直接下载二进制程序安装即可安装完成之后,就可以用其来创建虚拟机了。它支持的所有镜像(它的术语叫)可以在公开仓库中找到,后续我们将选用官方版本作为服务器基础镜像。下载Hadoop可以从清华大学镜像下载当前最新的是。系统安装创建Ubuntu Server利用命令快速生成一个虚拟机:mkdir hadoop-standalonecd hadoop-standalonevagrant init ubuntu/focal64vagrant up执行成功之后,就可以在中看到创建的这个虚拟机。然后可以通过命令登录:# 执行执行先cd到 hadoop-standalone 目录vagrant statusvagrant ssh安装必要软件运行在之上,必须要安装环境。支持的版本是,其中只支持运行而不支持编译。为简单起见,选择作为运行环境sudo apt-get updatesudo apt install openjdk-8-jdksudo apt-get install sshsudo apt-get install pdsh配置SSH需要配置以便可以无密码登录。# 试一下是否能直接登录ssh localhostssh-keygen -t rsa -P '' -f ~/.ssh/id_rsa 安装Hadoop3cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keyschmod 0600 ~/.ssh/authorized_keys拷贝文件到虚拟机将文件上传到虚拟机中。也可以直接在虚拟机,这里主要考虑是为以后集群部署准备,避免多次下载。vagrant upload ~/Downloads/hadoop-3.3.1.tar.gz安装Hadoop设置环境tar -zxvf hadoop-3.3.1.tar.gzcd hadoop-3.3.1vim etc/hadoop/hadoop-env.sh修改其中的环境变量:export JAVA_HOME=/usr/lib/jvm/java-1.8.0-openjdk-amd64# 完成之后可以试一下bin/hadoop修改配置文件修改下面这些配置文件(都是原样从官网抄的):<configuration> <property> <name>fs.defaultFS</name> <value>hdfs://localhost:9000</value> </property></configuration><configuration> <property> <name>dfs.replication</name> <value>1</value> </property></configuration><configuration> <property> <name>mapreduce.framework.name</name> <value>yarn</value> </property> <property> <name>mapreduce.application.classpath</name> <value>$HADOOP_MAPRED_HOME/share/hadoop/mapreduce/*:$HADOOP_MAPRED_HOME/share/hadoop/mapreduce/lib/*</value> 安装Hadoop4 </property></configuration><configuration> <property> <name>yarn.nodemanager.aux-services</name> <value>mapreduce_shuffle</value> </property> <property> <name>yarn.nodemanager.env-whitelist</name> <value>JAVA_HOME,HADOOP_COMMON_HOME,HADOOP_HDFS_HOME,HADOOP_CONF_DIR,CLASSPATH_PREPEND_DISTCACHE,HADOOP_YARN_HOME,HADOOP_HOME,PATH,LANG,TZ,HADOOP_MAPRED_HOME</value> </property></configuration>启动Hadoop首先需要格式化bin/hdfs namenode -format启动:sbin/start-dfs.shsbin/start-yarn.sh启动之后,可以去访问的站点(因为是在虚拟机里面,需要配置端口转发到宿主机): 安装Hadoop5这样就算安装完成了。

HTML view coming soon.

Download PDF for the full formatted version.