用 Hadoop 进行分布式数据处理（入门）

既然 Hadoop 守护进程已经在运行了，现在看看每个守护进程在 Hadoop 框架中的作用。namenode 是 Hadoop 中的主服务器，它管理文件系统名称空间和对集群中存储的文件的访问。还有一个 secondary namenode，它不是 namenode 的冗余守护进程，而是提供周期检查点和清理任务。在每个 Hadoop 集群中可以找到一个 namenode 和一个 secondary namenode。

datanode 管理连接到节点的存储（一个集群中可以有多个节点）。每个存储数据的节点运行一个 datanode 守护进程。

最后，每个集群有一个 jobtracker，它负责调度 datanode 上的工作。每个 datanode 有一个 tasktracker，它们执行实际工作。jobtracker 和 tasktracker 采用主-从形式，jobtracker 跨 datanode 分发工作，而 tasktracker 执行任务。jobtracker 还检查请求的工作，如果一个 datanode 由于某种原因失败，jobtracker 会重新调度以前的任务。

在这个简单的配置中，所有节点都驻留在同一个主机上（见图 1）。但是，通过前面的讨论很容易看出 Hadoop 如何提供并行处理。尽管架构很简单，但是 Hadoop 能够方便地实现数据分发、负载平衡以及以容错的方式并行处理大量数据。

检查 HDFS

可以通过几个检查确认 Hadoop（至少是 namenode）已经启动并正常运行。确认所有进程都在运行之后，可以使用 hadoop 命令检查本地名称空间（见清单 2）。

清单 2. 检查对 HDFS 的访问

# hadoop-0.20 fs -ls /

Found 2 items

drwxr-xr-x - root supergroup 0 2010-04-29 16:38 /user

drwxr-xr-x - root supergroup 0 2010-04-29 16:28 /var

可以看出 namenode 已经启动，能够为本地名称空间提供服务。注意，使用 hadoop-0.20 命令检查文件系统。这个实用程序用于与 Hadoop 集群交互，包括检查文件系统、在集群中运行作业等等。请注意命令的结构：指定 hadoop-0.20 实用程序之后，定义一个命令（在这里是通用文件系统 shell）以及一个或多个选项（在这里使用 ls 请求文件列表）。因为 hadoop-0.20 是 Hadoop 集群的主要接口之一，您会看到本文中多次使用这个实用程序。清单 3 提供另外几个文件系统操作示例（创建子目录 test，列出它的内容，然后删除它），可以通过它们进一步了解这个接口。

清单 3. Hadoop 中的文件系统操作

# hadoop-0.20 fs -mkdir test

# hadoop-0.20 fs -ls test

# hadoop-0.20 fs -rmr test

Deleted hdfs://localhost/user/root/test

测试 Hadoop

既然已经安装了 Hadoop 并测试了文件系统的基本接口，现在就该在真实的应用程序中测试 Hadoop 了。在这个示例中，我们使用 MapReduce 处理一个小数据集。map（映射）和 reduce（缩减）源自函数式编程中的函数名，但是这个应用程序的核心功能是数据缩减。映射是指把大量输入处理成更小的子问题集（然后把这些子问题分发给并行的工作系统）。缩减是指把子问题的答案组合成单一输出集。注意，这里没有定义处理的含义，因为框架允许您自己定义什么是处理。典型的 MapReduce 示例是计算单词在文档集中出现的频率。

根据前面的讨论，我们需要一个输入集并产生一个输出集。第一步是在文件系统中创建一个 input 子目录，工作将放在这个目录中。使用以下命令：

# hadoop-0.20 fs -mkdir input

接下来，在 input 目录中放一些工作。在这里，使用 put 命令把文件从本地文件系统转移到 HDFS 中（见清单 4）。注意，下面的命令格式把源文件转移到 HDFS 子目录 (input) 中。完成之后，在 HDFS 中就有两个文本文件等待处理。

清单 4. 把文件转移到 HDFS 中

# hadoop-0.20 fs -put /usr/src/linux-source-2.6.27

/Doc*/memory-barriers.txt input

# hadoop-0.20 fs -put /usr/src/linux-source-2.6.27/Doc*/rt-mutex-design.txt input

接下来，使用 ls 命令检查文件是否存在（见清单 5）。

清单 5. 检查 HDFS 中的文件

# hadoop-0.20 fs -ls input

Found 2 items

-rw-r--r-- 1 root supergroup 78031 2010-04-29 17:35 /user/root/input/memory-barriers.txt

-rw-r--r-- 1 root supergroup 33567 2010-04-29 17:36 /user/root/input/rt-mutex-design.txt

2/5 首页上一页 1 2 3 4 5 下一页尾页

正在为您生成精美海报...

用 Hadoop 进行分布式数据处理（入门）

尽管 Hadoop 是一些大型搜索引擎数据缩减功能的核心部分，但是它实际上是一个分布式数据处理框架。搜索引擎需要收集数据，而且是数量...

希望看到您的想法，请您发表评论x

用 Hadoop 进行分布式数据处理（入门）

techsir