亚洲国产成人久久精品动漫,亚洲综合一区二区三区四区五区,亚洲视频一区调教

�q�期HADOOP�Q?.0.3�Q�实施心得与�ȝ��

一酌散千忧 — Wed, 08 Aug 2012 12:21:00 GMT

Hadoop实施已经有快一个月了，对Hadoop的概�느�解、��用，Linux与shell脚本�Q�甚至mysql都有了更多的理解�?br />

��目背景�Q�用于互联网信息攉��后的关键词匹配与内容提取�?/span>

主要�pȝ��架构分�ؓ互联�|�爬虫、分析、业务应用三块：

��单架构描�q?/span>

�׃��我在当中的角色主要负责分析架构的搭徏�Q�所以其他两块都��d��单，下面也不会过多的描述�?br />

Hadoop理解�Q�提到Hadoop都想到的是云、分布式计算�Q�在一�D�|��间的实施之后有了一些具体的理解�?/span>

Hadoop的优势：

针对性能指标�Q�当业务数据量总量或增速上升到一定��别，依靠关系型数据库一定无法支持。对于非关系型数据库�Q�包括Nosql和Solr一�c�d��储方式，�E�显复杂�Q�对于机器集��性能要求偏高�Q�相对于文�g�pȝ��Q�。从数据使用模式上来�Ԍ��目前��量数据的常常是不包含复杂逻辑的简单统计整理（比如上述�pȝ��中的关键词匹配）。这时候文件系�l�的优势反而比较明显（�l�构��单，逻辑��单）�?/span>

如上�q�系�l�的应用场景是怎么��L��呢，在一个强大的爬虫�pȝ��之下�Q�每个小时的数据增量在G�?0G的��别，需要搜索所有的文�g�Q�获取关键字的匹配，�q�且对匹配内容进行摘要。很�c�M��我们windows里面的搜索功能，需要解决的��是如何在这样增�q�的文�g�pȝ��之下�Q�如何满��业务系�l�的需求�?br />

�?/span>分析�pȝ��有什么要�?/span>呢？

l 能够建立集群�Q�分布式的保存数据文件内容（�l�一控制�Q�可配置�Q��?/span>

l 有一定的保护机制�Q�保证数据或节点丢失不会影响�pȝ��使用�?/span>

l 如果有一个�Q务脚本执行框架机制就好了�Q�用于�ƈ行计��）�?/span>

l 能够�q�行节点间的数据均衡�?/span>

l 能够��单的查看所有的状态与日志�Q�web客户端）

可能主要是这些了。若自己实现�Q�确实是个复杂而庞大的工程�Q�现在我们有了Hadoop�?br />

�pȝ��物理架构�Q?/span>

我们使用了一台服务器�Q�利用虚拟化�Q�安装了7�?4x位的CentOS。一个Namenode�Q?个Datanode�Q�复制数讄��?。每个系�l�分配到一个cpu�Q?G内存�Q�Datanode挂蝲�?00G的存储空间�?/span>

理想的Hadoop的搭建环境，参照《Best Practices for Selecting Apache Hadoop Hardware》（http://hortonworks.com/blog/best-practices-for-selecting-apache-hadoop-hardware/�Q�一文，以及一些其他的文章�?/span>

CPU�Q�最好是双CPU�Q?核左叟뀂不用太高了�?/span>

内存�Q�推�?8G�Q�但�?G应该��可以运行Hadoop了�?/span>

��盘�Q?200转的SATA��盘卛_��Q�Hadoop很占�I�间�Q�所以尽量加�?/span>

�|�络�Q�内部的数据交换要求非常高，内网最好是千兆�|�卡�Q�带宽�ؓ1GB�?br />

理想与现实，有钱与没钱，呵呵�?br />

�pȝ��软�g架构�Q?/span>

Hadoop�Q�版本��用的�?.0.3�Q�再下来��是2了，��Z��量��化应用，所以不考虑2的新�Ҏ��。对Hadoop没有做太多的讄��Q�基本基于默认�?0为Namenode�Q?1-76为Datanode�?/span>

JDK�Q?.6.0_33 �Q?4x�Q?br />

�pȝ��实施�q�程�Q?/span>

HDFS部分�Q?/span>

爬虫抓取数据�Q�整理后存放�?0文�g服务器，70以外部挂载的形式��d��。网��|��件比较小�Q�假如直接写入Hadoop对Namenode负蝲�q�大�Q�所以入库前合�ƈ�Q�将每小时网��|��合成��Z��个文件写入HDFS�Q�由于区分类别，所以每��时基本写入10个文件左叻I��总量�?-8G�Q�耗时�?0-50分钟。（�q�个�q�程中，�׃��爬虫的IO�q�于频繁�Q�导致文件读取困难，所以做了定时�Q务，每小时启动一�ơ，��需要处理的文�g先拷贝到临时区域�Q�合�q�入库之后再删除。此处应该是受到单核cpu的限�Ӟ��所有操作均是串行，包括拯��Q�cp�Q�和合�ƈ入库�Q�java�Q�，所以Namenode严重��配置�E�高。）

此处没有太多问题�?/span>

MapReduce部分�Q?/span>

写入完成后，�q�行分析工作�Q�MapReduce。此处的工作�q�程为：数据库定时生成关键词列表文�g。Job执行时会��d��列表文�g�Q�匹配指定范围内的HDFS文�g�Q�过��M��时�Q�，匚w��出对应的表达式与HTML�Q�Map�q�程�l�束。在Reduce阶段�Q�会��Map的所有数据入数据库（Mysql�Q��?/span>

此处出现�q�一些问题，记录下来�?/span>

1. Reduce阶段需要加载Mysql的第三方驱动包。我在三个环境测试过�Q�公司、家里、发布环境）�Q��?nbsp;-libjars 一定可以，有的地方不需要也可以。不明确�Q�怀疑与HADOOP_HOME环境变量有关�?/span>

2. MR�q�程中��用log4j打印日志�Q�在Hadoop临时目录�Q�如果你没有配置dfs.name.dir�Q�dfs.data.dir,mapred.local.dir.mapred.system.dir�{�目录，�q�些都会在hadoop.tmp.dir当中�Q�我��偷懒都没配�|�）mapred文�g夹中查看一下�?/span>

整个�q�程实际上还是比较简单的�Q�基本编码量��在Job的部分，但是一个Java文�g��够了。在目前初��阶段应该�q�是比较好用的。现在还没有��试Job的执行效率。完成后会��l�记录下来。有什么问题可以提出。我惛_��什么也会在本文�l�箋更新�?/span>

一酌散千忧 2012-08-08 20:21 发表评论

Hadoop完整分布式配�|�方�?Fully distributed mode)

一酌散千忧 — Tue, 03 Jul 2012 23:38:00 GMT

��g资源�Q?/span>

三台CentOS5.6虚拟机（Vmware�Q?/span>

本机 windows7 64x

基本资源配置�Q?/span>

三台虚拟机均是克隆自同一个镜�?/span>

已经安装�?/span>Java环境�Q?/span>jdk1.6.0_25�Q?/span>

Hadoop路径�?/span>/usr/hadoop/hadoop-0.20.205.0

操作步骤�Q?/span>

1、机器名�U�规�?/span>

ip分别�?/span>128�?/span>129�?/span>130�Q�将128讄��?/span>master�Q�其他设�|��ؓslave

修改

/etc/sysconfig/network

/etc/hosts

两处配置�Q�名�U�分别�ؓhadoop-master\hadoop-slave01\hadoop-slave02

注意�Q�此处名�U�最好不用��用下划线�Q�有可能引发namenode的启动异常�?/span>

2、修�?/span>Hadoop配置

�?/span>master节点�?/span>conf中修�?/span>master�?/span>slave文�g�Q�分别�ؓ机器�?/span>ip地址

修改master节点�?/span>conf中：

core-site.xml

fs.default.name

hdfs://ip-master:9000

mapred-site.xml

mapred.job.tracker

master:9001

hdfs-site.xm

dfs.replication

注意此处的端口号均�ؓ默认�?/span>

3、徏�?/span>m-s之间�?/span>ssh�q�接

首先master�?/span>slave机器都需要进�?/span>ssh信�Q文�g生成�Q�执行如下命令：

$ ssh-keygen -t rsa

中间需要输入的地方直接回�R�Q�接受缺省值即�?/span>

�׃��使用root用户��d��Q�所以密钥文件生成在 /root/.ssh/文�g夹下�Q�存有一对密�?/span>id_dsa�?/span>id_dsa.pub�?/span>

此处id_dsa�Q�私钥）必须为其他用户不可读�Q�所以文件属性应当是600

�?/span>master机器执行�Q?/span>

��?/span>id_dsa.pub�Q�公钥）复制�?/span> authorized_keys

$ cp id_dsa.pub authorized_keys

如果是多台机器需�?/span>,无密码登�?/span>,则各自机器��生公钥追加到authorized_keys卛_��.

使用scp协议覆盖slave端的密钥文�g夹，使得slave机器信�Q来自master的连�?/span>:

$ scp /root/.ssh/* ip-slave:/root/.ssh

4、启动服�?/span>

��?/span>$HADOOP_HOME/bin下的所有文件给与执行权限：

$ chmod 777 bin

master作�ؓnamenod需要执行如下脚本：

$HADOOP_HOME/bin/hadoop namenode –format

完成后执�?/span> $HADOOP_HOME/bin/start-all.sh

5、问题检�?/span>

�?/span>Hadoop根目录下�?/span>logs文�g中，��查各个服务日志的启动情况

6、其他情况说明：

Q: $HADOOP_HOME is deprecated

A: 基本不会产生��M��影响。由于脚本启动时讄��了该环境变量�Q�就会提�C�用户原有环境变量失效。可以取消环境变量设�|�，或者直接去bin/hadoop中找到这句话�Q�去掉即�?/span>

Q: 无效的选项 -jvm / Unrecognized option: -jvm

A: 在��?/span>root用户��d��?/span> bin/hadoop 脚本��׃��q�行判断�Q�加�?/span>-jvm参数。此处是��Z��q�入jsvc�Q?/span>http://commons.apache.org/daemon/jsvc.html�Q�，此处�q�不��定是否bug�Q�也不再�q�行详细的追溯，解决�Ҏ��是�q�入 bin/hadoop 脚本�?/span> 扑ֈ� jvm 参数�q�去掉�?/span>

一酌散千忧 2012-07-04 07:38 发表评论

Zookeeper的学习�ȝ��

一酌散千忧 — Tue, 15 May 2012 03:02:00 GMT

Zookeeper的核心概念：

ZNode

Znode��是核心�l�构�Q�Zookeeper服务中是由大量的Znode构成。Znode一般是由客��L��建立和修改，作�ؓ信息或标志的载体�Q�甚��x��w�就是标志�?/span>

Znode可以讄��为持久（PERSISTENT�Q�或临时�Q�EPHEMERAL�Q�，区别在于临时的节点若断开�q�接后就自动删除。徏立节�Ҏ��可选择是否使用序列号命名（SEQUENTIAL�Q�，若启用则会自动在节点名后加入唯一序列�~�号�?/span>

Session

作�ؓ客户端和Zookeeper服务之间交互的凭证�?/span>

Watch

当客��L��对节点信息进行查询操作之后，可以选择是否讄��一个Watch。其作用��是当本�ơ查询的数据在服务器端发生变化之后，会对讄��Watch的客��L��发送通知。一�ơ发送之后，��将删除该Watch�Q�以后的变更或不再设�|�Watch则不会通知�?/span>

ACLs

节点的权限限制��用ACL�Q�如增删�Ҏ��操作�?/span>

Zookeeper的服务器安装�Q?/span>

1�?/span>下蝲对应版本��L��tar.gz文�g

2�?/span>使用 tar xzvf zookeeper-3.4.2.tar.gz -C ./ 解压

3�?/span>讄��Q�将conf/zoo.example.cfg复制到conf/zoo.cfg或者手动徏立一个新的�?/span>

4�?/span>启动Zookeeper服务�Q�bin/zkServer.sh start

5�?/span>启动客户端连接：bin/zkCli.sh -server 127.0.0.1:2181�Q�此处在本机�Q�且使用了默认端口，且在Java环境中）

6�?/span>使用命��o�Q�ls、get、set�{��?/span>

7�?/span>关闭Zookeeper服务�Q�bin/zkServer.sh stop

Zookeeper代码�~�写�Q?/span>

代码�~�写部分比较��单，因�ؓ暴露的接口很��，主要复杂在于��目如何使用节点以及节点信息�?/span>

启动Zookeeper服务之后�Q�客��L��代码�q�行节点的增删，Watch的设�|�，内容的改查等�?/span>

此处��查看官方的《Programming with ZooKeeper - A basic tutorial》部分，当中举了两个例子来模拟分布式�pȝ��的应用�?/span>

代码基本没有问题�Q�唯一需要注意的��是�Q�若之间按照原版�q�行调试�Ӟ��有可能在调用

Stat s = zk.exists(root, false);

�q�句代码时会出现一个异常，当中包括“KeeperErrorCode = ConnectionLoss for”�?/span>

�q�个问题引�v的原因可以看一下代�?/span>

System.out.println("Starting ZK:");
                zk = new ZooKeeper(address, 3000, this);
                mutex = new Integer(-1);
                System.out.println("Finished starting ZK: " + zk);

最后一行有打印出Zookeeper目前的信息，若未修改的原代码�Q�此处的State应当是CONECTING。连接中的时候去验证是否存在节点会报错。解决的�Ҏ��也很��单，��是�{�到Zookeeper客户端以及完全连接上服务器，State为CONECTED之后再进行其他操作。给��Z��码示例：

// 使用了倒数计数�Q�只需要计��C��?/span>
private CountDownLatch connectedSignal = new CountDownLatch(1);
SyncPrimitive(String address) {
    if(zk == null){
        try {
            System.out.println("Starting ZK:");
            zk = new ZooKeeper(address, 3000, this);
            mutex = new Integer(-1);
            connectedSignal.await(); // �{�待�q�接完成
            System.out.println("Finished starting ZK: " + zk);
        } catch (IOException e) {
            System.out.println(e.toString());
            zk = null;
        } catch (InterruptedException e) {
            // TODO Auto-generated catch block
            e.printStackTrace();
        }
    }
    //else mutex = new Integer(-1);
}
synchronized public void process(WatchedEvent event) {
    // 此处讄��在Watch中会在状态变化后触发事�g
    if (event.getState() == KeeperState.SyncConnected) {
        connectedSignal.countDown();// 倒数-1
    }

        synchronized (mutex) {
            //System.out.println("Process: " + event.getType());
            mutex.notify();
        }
}

�q�样��可以正��运行代码了�?/span>

Zookeeper的应用场景及方式�Q?/span>

此处是�ؓ引用�Q�原地址为（http://rdc.taobao.com/team/jm/archives/1232 �Q?/span>

ZooKeeper是一个高可用的分布式数据��理与系�l�协调框架。基于对Paxos��法的实玎ͼ�使该框架保证了分布式环境中数据的��Z��致性，也正是基于这��L��Ҏ��，使得zookeeper能够应用于很多场景。网上对zk的��用场景也有不��介�l�，本文��结合作者��n边的��目例子�Q�系�l�的对zk的��用场景进行归�c�M��l��?nbsp;值得注意的是�Q�zk�q�不是生来就��些场景设计，都是后来众多开发者根据框架的�Ҏ��，摸烦出来的典型��用方法。因此，也非常欢�q�你分��n你在ZK使用上的奇技淫��y�?/span>

场景�c�d��	典型场景描述�Q�ZK�Ҏ��，使用�Ҏ��Q?/span>	应用中的具体使用
数据发布与订�?/span>	发布与订阅即所谓的配置��理�Q�顾名思义��是��数据发布到zk节点上，供订阅者动态获取数据，实现配置信息的集中式��理和动态更新。例如全局的配�\|�信息，地址列表�{�就非常适合使用�?/span>	1. 索引信息和集��中机器节点状态存攑֜�zk的一些指定节点，供各个客��L��订阅使用�?. �pȝ��日志�Q�经�q�处理后的）存储�Q�这些日志通常2-3天后被清除�?nbsp; 3. 应用中用到的一些配�\|�信息集中管理，在应用启动的时候主动来获取一�ơ，�q�且在节点上注册一个Watcher�Q�以后每�ơ配�\|�有更新�Q�实旉��知到应用，获取最新配�\|�信息�?/span> 4. 业务逻辑中需要用到的一些全局变量�Q�比如一些消息中间�g的消息队列通常有个offset�Q�这个offset存放在zk上，�q�样集群中每个发送者都能知道当前的发送进度�?/span> 5. �pȝ��中有些信息需要动态获取，�q�且�q�会存在人工手动��M��改这个信息。以前通常是暴露出接口�Q�例如JMX接口�Q�有了zk后，只要��这些信息存攑ֈ�zk节点上即可�?/span>
Name Service	�q�个主要是作为分布式命名服务�Q�通过调用zk的create node api�Q�能够很�Ҏ��创徏一个全局唯一的path�Q�这个path��可以作��Z��个名�U��?/span>
分布通知/协调	ZooKeeper中特有watcher注册与异步通知机制�Q�能够很好的实现分布式环境下不同�pȝ��之间的通知与协调，实现�Ҏ��据变更的实时处理。��用方法通常是不同系�l�都对ZK上同一个znode�q�行注册�Q�监听znode的变化（包括znode本��n内容及子节点的）�Q�其中一个系�l�update了znode�Q�那么另一个系�l�能够收到通知�Q��ƈ作出相应处理�?/span>	1. 另一�U�心��x��机�Ӟ��系�l�和被检��系�l�之间�ƈ不直接关联�v来，而是通过zk上某个节点关联，大大减少�pȝ��耦合�?. 另一�U�系�l�调度模式：某系�l�有控制台和推送系�l�两部分�l�成�Q�控制台的职责是控制推送系�l�进行相应的推送工作。管理�h员在控制��C��的一些操作，实际上是修改了ZK上某些节点的状态，而zk��把�q�些变化通知�l�他们注册Watcher的客��L��Q�即推送系�l�，于是�Q�作出相应的推送�Q务�?nbsp; 3. 另一�U�工作汇报模式：一些类��g��d��分发�pȝ��Q�子��d��启动后，到zk来注册一个��时节点，�q�且定时��自��q��q�度�q�行汇报�Q�将�q�度写回�q�个临时节点�Q�，�q�样��d��理者就能够实时知道��d��q�度�?/span> ��M��Q��用zookeeper来进行分布式通知和协调能够大大降低系�l�之间的耦合�?/span>
分布式锁	分布式锁�Q�这个主要得益于ZooKeeper为我们保证了数据的强一致性，即用户只要完全相信每时每刻，zk集群中�Q意节点（一个zk server�Q�上的相同znode的数据是一定是相同的。锁服务可以分�ؓ两类�Q?/span>一个是保持独占�Q�另一个是控制时序�?/span> 所谓保持独占，��是所有试图来获取�q�个锁的客户端，最�l�只有一个可以成功获得这把锁。通常的做法是把zk上的一个znode看作是一把锁�Q�通过create znode的方式来实现。所有客��L��都去创徏 /distribute_lock 节点�Q�最�l�成功创建的那个客户端也��x��有了�q�把锁�?/span> 控制时序�Q�就是所有视图来获取�q�个锁的客户端，最�l�都是会被安排执行，只是有个全局时序了。做法和上面基本�c�M��Q�只是这�?nbsp;/distribute_lock 已经预先存在�Q�客��L��在它下面创徏临时有序节点�Q�这个可以通过节点的属性控�Ӟ��CreateMode.EPHEMERAL_SEQUENTIAL来指定）。Zk的父节点�Q?distribute_lock�Q�维持一份sequence,保证子节点创建的时序性，从而也形成了每个客��L��的全局时序�?/span>
集群��理	1. 集群机器监控�Q�这通常用于那种寚w��中机器状态，机器在线率有较高要求的场景，能够快速对集群中机器变化作出响应。这��L��场景中，往往有一个监控系�l�，实时��集��机器是否存�z�R��过�ȝ��做法通常是：监控�pȝ��通过某种手段�Q�比如ping�Q�定时检��每个机器，或者每个机器自己定时向监控�pȝ��汇报“我还�zȝ��”�?nbsp;�q�种做法可行�Q�但是存在两个比较明昄��问题�Q?. 集群中机器有变动的时候，牵连修改的东西比较多�?. 有一定的延时�?nbsp; 利用ZooKeeper有两个特性，��可以实时另一�U�集��机器存�z�L��监控系�l�：a. 客户端在节点 x 上注册一个Watcher�Q�那么如�?nbsp;x 的子节点变化了，会通知该客��L��。b. 创徏EPHEMERAL�c�d��的节点，一旦客��L��和服务器的会话结束或�q�期�Q�那么该节点��׃��消失�?/span> 例如�Q�监控系�l�在 /clusterServers 节点上注册一个Watcher�Q�以后每动态加机器�Q�那么就往 /clusterServers 下创��Z��?nbsp;EPHEMERAL�c�d��的节点：/clusterServers/{hostname}. �q�样�Q�监控系�l�就能够实时知道机器的增减情况，至于后箋处理��是监控�pȝ��的业务了�?/span> 2. Master选�D则是zookeeper中最为经典的使用场景了�?/span> 在分布式环境中，相同的业务应用分布在不同的机器上�Q�有些业务逻辑�Q�例如一些耗时的计��，�\|�络I/O处理�Q�，往往只需要让整个集群中的某一台机器进行执行，其余机器可以�׃�n�q�个�l�果�Q�这样可以大大减��重复劳动，提高性能�Q�于是这个master选�D便是�q�种场景下的��到的主要问题�?/span> 利用ZooKeeper的强一致性，能够保证在分布式高�ƈ发情况下节点创徏的全局唯一性，卻I��同时有多个客��L��h��创徏 /currentMaster 节点�Q�最�l�一定只有一个客��L��h��能够创徏成功�?/span> 利用�q�个�Ҏ��，��p��很轻易的在分布式环境中进行集��选取了�?/span> 另外�Q�这�U�场景演化一下，��是动态Master选�D。这��p��用到 EPHEMERAL_SEQUENTIAL�c�d��节点的特性了�?/span> 上文中提刎ͼ�所有客��L��创徏��h��Q�最�l�只有一个能够创建成功。在�q�里�E�微变化下，��是允许所有请求都能够创徏成功�Q�但是得有个创徏��序�Q�于是所有的��h��最�l�在ZK上创建结果的一�U�可能情冉\|��q�样�Q?nbsp;/currentMaster/{sessionId}-1 , /currentMaster/{sessionId}-2 , /currentMaster/{sessionId}-3 ….. 每次选取序列��h��的那个机器作�ؓMaster�Q�如果这个机器挂了，�׃��他创建的节点会马上小�Ӟ��那么之后最��的那个机器��是Master了�?/span>	1. 在搜索系�l�中�Q�如果集��中每个机器都生成一份全量烦引，不仅耗时�Q�而且不能保证彼此之间索引数据一致。因此让集群中的Master来进行全量烦引的生成�Q�然后同步到集群中其它机器�?. 另外�Q�Master选�D的容灾措施是�Q�可以随时进行手动指定master�Q�就是说应用在zk在无法获取master信息�Ӟ��可以通过比如http方式�Q�向一个地方获取master�?/span>
分布式队�?/span>	队列斚w��Q�我目前感觉有两�U�，一�U�是常规的先�q�先出队列，另一�U�是要等到队列成员聚齐之后的才统一按序执行。对于第二种先进先出队列�Q�和分布式锁服务中的控制时序场景基本原理一��_��q�里不再赘述�?nbsp; �W�二�U�队列其实是在FIFO队列的基��上作了一个增强。通常可以�?nbsp;/queue �q�个znode下预先徏立一�?queue/num 节点�Q��ƈ且赋��gؓn�Q�或者直接给/queue赋值n�Q�，表示队列大小�Q�之后每�ơ有队列成员加入后，��判断下是否已经到达队列大小�Q�决定是否可以开始执行了。这�U�用法的典型场景是，分布式环境中�Q�一个大��d��Task A�Q�需要在很多子�Q务完成（或条件就�l�）情况下才能进行。这个时候，凡是其中一个子��d��完成�Q�就�l�）�Q�那么就�?nbsp;/taskList 下徏立自��q��临时时序节点�Q�CreateMode.EPHEMERAL_SEQUENTIAL�Q�，�?nbsp;/taskList 发现自己下面的子节点满��指定个数�Q�就可以�q�行下一步按序进行处理了�?/span>

一酌散千忧 2012-05-15 11:02 发表评论

Hadoop in action 实践(伪分布式)

一酌散千忧 — Sun, 01 Apr 2012 07:00:00 GMT

《Hadoop in action�?span style="font-family: 宋体; ">�?/span>Manning出版�Q�磕��绊�l��ȝ��是看完了。书的内容就不做介绍�Q�主要讲一下实�늚��q�程。�ƈ且在实践�q�程中参考的书籍的部分也会简单介�l��?br />
灰色背景部分��Z��些介�l�，或过�E�中出现问题的描�q�ͼ�可以直接忽略�?/span>

�׃��公司的业务需要，要在�|�络攉��|�页之后对网��进行结构化的解析，�q�个�l�构化过�E�希望能够基�?/span>HDFS�q�且使用MR��法实现�?/span>

我虚拟了一个需求，针对http://hadoop.apache.org/common/releases.html ��面�Q�假讑ַ��l�下载了��面�q�入库。要求最�l�体现的数据�?/span> “版本�?/span>+完整链接�Q�即a标签全部内容�Q?#8221; 的结构�?/span>

伪分布式环境搭徏在虚拟机上，操作�pȝ��?/span>centos5.5�Q?/span>hadoop的版本是1.0.0.

插入书中的一些环境搭建的介绍
书中�?/span>2.1节中介绍了每个进�E�的作用�?/span>2.2节中�?/span>ssh讄��也比较重要，否则好像会一直提�C�Z��输入密码�?/span>2.3.2节介�l�了伪分布式的配�|�方式，�?/span>core-site.xml�Q?/span>mapred-site.xml�Q?/span>hdfs-site.xml�q�行配置之后�Q�需要对namenode节点�q�行格式化�?/span>
bin/hadoop namenode –format

hadoop的根目录�?/span>/usr/local/hadoop-1.0.0�Q�直接启�?/span>start-all.sh

[root@localhost hadoop-1.0.0]# ./bin/start-all.sh

启动成功后��?/span>jps命��o

jdk��工�?/span>jps介绍
jps(Java Virtual Machine Process Status Tool)�?/span>JDK 1.5提供的一个显�C�当前所�?/span>java�q�程pid的命令，��单实用，非常适合�?/span>linux/unix�q�_��上简单察看当�?/span>java�q�程的一些简单情��c�?/span> jps存放�?/span>JAVA_HOME/bin/jps

[root@localhost hadoop-1.0.0]# jps

5694 SecondaryNameNode

5461 NameNode

5578 DataNode

6027 Jps

5784 JobTracker

5905 TaskTracker

�q�几个进�E�是非常重要的。很多时候出现意外就是因为某��Ҏ��务未启动或异常。可以看��C��面的命��o上打印出日志位置。出现异常后可以在日志中查看详细的堆栈信息�?/span>

��x��Q?/span>hadoop已经启动�Q�环境已�l�准备就�l��?/span>

下面准备我们的测试数据，��目标页面的html保存�?/span>news.txt�Q�伪分布式也同样支持hdfs�Q�所以我们��?/span> fs –put ��?/span>news.txt存入hdfs中�?/span>

[root@localhost hadoop-1.0.0]# ./bin/hadoop fs -put /mnt/hgfs/shared/news.txt /user/root

[root@localhost hadoop-1.0.0]# ./bin/hadoop fs -lsr /userdrwxr-xr-x - root supergroup 0 2012-04-01 11:22 /user/root

-rw-r--r-- 1 root supergroup 3935 2012-04-01 11:22 /user/root/news.txt

实现的代码在eclipse中��?/span>maven打包�Q�上传至虚拟机�?/span>

文�g�?/span>com.suntang.analyse.hadoop-0.0.1.jar�?br />使用hadoop的中的jar命��o调用该jar文�g�?br />

[root@localhost hadoop-1.0.0]# ./bin/hadoop jar com.suntang.analyse.hadoop-0.0.1.jar com.suntang.analyse.hadoop.AnalyseJob /user/root/news.txt output_root_test

12/04/01 14:40:04 INFO input.FileInputFormat: Total input paths to process : 1

12/04/01 14:40:05 INFO mapred.JobClient: Running job: job_201204011420_0001

12/04/01 14:40:06 INFO mapred.JobClient: map 0% reduce 0%

12/04/01 14:40:19 INFO mapred.JobClient: map 100% reduce 0%

12/04/01 14:40:31 INFO mapred.JobClient: map 100% reduce 100%

12/04/01 14:40:37 INFO mapred.JobClient: Job complete: job_201204011420_0001

…

此处注意我犯的一个错误：
[root@localhost hadoop-1.0.0]# ./bin/hadoop jar com.suntang.analyse.hadoop-0.0.1.jar AnalyseJob -libjars hadoop-core-1.0.0.jar /user/root/news.txt output_root_test
Exception in thread "main" java.lang.ClassNotFoundException: AnalyseJob
提示找不到类�Q�因为我忘了写完整类名，命��o应该改�ؓ
./bin/hadoop jar com.suntang.analyse.hadoop-0.0.1.jar com.suntang.analyse.hadoop.AnalyseJob -libjars hadoop-core-1.0.0.jar /user/root/news.txt output_root_test 卛_��?/span>

此处�q�行可能出现另外一个错误。在命��o行中出现
12/04/01 14:01:38 INFO mapred.JobClient: Task Id : attempt_201204011356_0001_m_000001_0, Status : FAILED
java.lang.Throwable: Child Error
at org.apache.hadoop.mapred.TaskRunner.run(TaskRunner.java:271)
Caused by: java.io.IOException: Creation of symlink from /mnt/hgfs/shared/hadoop-1.0.0/libexec/../logs/userlogs/job_201204011356_0001/attempt_201204011356_0001_m_000001_0 to 。。�?/span>
��׃��打全了，重点在与
Creation of symlink�Q�看详细日志�?/span>hadoop-root-tasktracker-localhost.localdomain.log中提�C?/span>org.apache.hadoop.fs.FileUtil: Command 'ln -s ....': Operation not supported�Q�即ln操作不支持�?/span>google可知�q�个是由�?/span>vm中的�׃�n区域的问题，解决�Ҏ��是��?/span>hadoop完全转移�?/span>linux目录中。本例中�?/span>/mnt/hgfs/shared/hadoop-1.0.0转移�?/span>/usr/local/hadoop-1.0.0�?/span>

执行完成后可�?/span>hdfs中查看结果，查看目录�l�构�?/span>

-rw-r--r-- 1 root supergroup 0 2012-04-01 14:40 /user/root/output_root_test/_SUCCESS

drwxr-xr-x - root supergroup 0 2012-04-01 14:40 /user/root/output_root_test/_logs

drwxr-xr-x - root supergroup 0 2012-04-01 14:40 /user/root/output_root_test/_logs/history

-rw-r--r-- 1 root supergroup 13634 2012-04-01 14:40 /user/root/output_root_test/_logs/history/job_201204011420_0001_1333262405103_root_ccAnalyseJob

-rw-r--r-- 1 root supergroup 20478 2012-04-01 14:40 /user/root/output_root_test/_logs/history/job_201204011420_0001_conf.xml

-rw-r--r-- 1 root supergroup 3580 2012-04-01 14:40 /user/root/output_root_test/part-r-00000

/user/root/output_root_test/part-r-00000即�ؓ最�l�结果文件�?/span>

=======================================================================

附加AnalyseJob代码

package com.suntang.analyse.hadoop;

import java.io.IOException;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.conf.Configured;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.LongWritable;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.mapreduce.Job;

import org.apache.hadoop.mapreduce.Mapper;

import org.apache.hadoop.mapreduce.Reducer;

import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;

import org.apache.hadoop.mapreduce.lib.input.TextInputFormat;

import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import org.apache.hadoop.mapreduce.lib.output.TextOutputFormat;

import org.apache.hadoop.util.Tool;

import org.apache.hadoop.util.ToolRunner;

public class AnalyseJob extends Configured implements Tool {

public static class MapClass extends Mapper {

@Override

protected void map(LongWritable key, Text value, Context context)

throws IOException, InterruptedException {

// TODO Auto-generated method stub

// super.map(key, value, context);

if (value.toString().matches("]*>.*?release.*?"))

context.write(

new Text(value.toString().substring(

value.toString().indexOf("release") + 8,

value.toString().indexOf("available") - 1)),

value);

}

public static class ReduceClass extends Reducer {

@Override

protected void reduce(Text arg0, Iterable arg1, Context arg2)

throws IOException, InterruptedException {

// TODO Auto-generated method stub

// super.reduce(arg0, arg1, arg2);

arg2.write(arg0, arg1.iterator().next());

}

public int run(String[] args) throws Exception {

Configuration conf = getConf();

Job job = new Job(conf, "myAnalyseJob");

job.setJarByClass(getClass());

Path in = new Path(args[0]);

Path out = new Path(args[1]);

FileInputFormat.setInputPaths(job, in);

FileOutputFormat.setOutputPath(job, out);

job.setMapperClass(MapClass.class);

job.setReducerClass(ReduceClass.class);

job.setInputFormatClass(TextInputFormat.class);

job.setOutputFormatClass(TextOutputFormat.class);

job.setOutputKeyClass(Text.class);

job.setOutputValueClass(Text.class);

System.exit(job.waitForCompletion(true) ? 0 : 1);

return 0;

}

public static void main(String[] args) throws Exception {

int res = ToolRunner.run(new Configuration(), new AnalyseJob(), args);

System.exit(res);

}

一酌散千忧 2012-04-01 15:00 发表评论

Hadoop: The Definitive Guide�Q�Hadoop权威指南�Q�Unix Tools 脚本�~�程实施

一酌散千忧 — Thu, 29 Mar 2012 08:21:00 GMT

Example 2-2. A program for finding the maximum recorded temperature by year from NCDC weather records

#!/usr/bin/env bash

for year in all/*

echo -ne `basename $year .gz`"\t"

gunzip -c $year | \

awk '{ temp = substr($0, 88, 5) + 0;

q = substr($0, 93, 1);

if (temp !=9999 && q ~ /[01459]/ && temp > max) max = temp }

END { print max }'

done

使用linux脚本打印每年最高温度，先解释一下该脚本几个注意炏V�?/span>

脚本目的是发现每�q�的最高温度，�W�一�?/span>for year in 后的all/*表示在名�U�Cؓall的文件夹下每�q�度的温度信息都�?/span> �?/span> 1990.gz 方式存在。��?/span>gunzip方式解压�q�打华ͼ��Ҏ��印的内容使用awk函数�q�行处理�Q�获取最大温度，单个文�g处理完毕后打�?/span>max�?/span>

在上一��中获取的数据包是这��P��q�度为文件夹�Q�当中包含若�q�个温度详情文�g�?/span>

E:\testData\1990\010010-9999-1990.gz

E:\testData\1990\010014-9999-1990.gz

E:\testData\1990\010015-9999-1990.gz

E:\testData\1990\010016-9999-1990.gz

…

从后�?/span>Appendix C的描�q�C��得知�Q�实际上作者对�q�样的数据进行了处理�Q�因�?/span>hadoop在处理大量的��文件时无法辑ֈ�很高的效率，因此作者��?/span>hadoop��小文�g合�ƈ�Q��ƈ且给��Z��代码�?/span>

我比较希望能够��用脚本处理，��所有的gz解压之后�Q�合�q�成��Z��个文�Ӟ��打包�?/span>gz的格式，�q�样��p��完全�W�合之前那段脚本的处理方式。所以，脚本如下�Q?/span>

packyear

#! /bin/sh

# /usr/data/packyear

# unzip all gz files in data

for yeards in data/*

# unzip all gz files in year directory

for gzfile in $yeards/*

gunzip $gzfile

done

# cat all content to year file

cat $yeards/* | head -2 >> $yeards.tc

# remove year directory

rm -rf $yeards

mv $yeards.tc $yeards

# zip the tc file

gzip $yeards

done

�Ҏ��实际路径改写的计��最大温度的脚本

maxyear

#! /bin/sh

# /usr/data/ maxyear

for year in /usr/data/*

basename $year .gz

gunzip -c $year | \

awk '{temp=substr($0, 88, 5)+0;

q=substr($0, 93, 1);

if(temp !=9999 && q ~ /[01459]/ && temp > max) max = temp}

END {print max}'

done

�q�个脚本最�l�显�C�出来会是：

1990

�q�样的格式。由于对数据�l�构的不熟悉�Q�所以不��定昄��出来的数据是否正��，但是基本的脚本和数据操作方式��是�q�样了�?/span>

一酌散千忧 2012-03-29 16:21 发表评论

一酌散千忧 — Wed, 28 Mar 2012 02:32:00 GMT

Hadoop: The Definitive Guide�Q?/span>Hadoop权威指南�Q�，�W�十六页中提��C��试数据来源来自�?/span>National Climatic Data Center (NCDC, http://www.ncdc.noaa.gov/)。在下面使用Unix Tool�~�写脚本时��用到的文件格式如下：

For example, here are the first entries for 1990:

% ls raw/1990 | head

010010-99999-1990.gz

010014-99999-1990.gz

010015-99999-1990.gz

010016-99999-1990.gz

010017-99999-1990.gz

010030-99999-1990.gz

010040-99999-1990.gz

010080-99999-1990.gz

010100-99999-1990.gz

010150-99999-1990.gz

对于数据的来源很困惑�Q�不知道如何下蝲�?/span>google之后�?/span>http://lucene.472066.n3.nabble.com/The-NCDC-Weather-Data-for-Hadoop-the-Definitive-Guide-td3736774.html �q�篇帖子中发现方法。现在记录一�?/span>

�q�接http://www.ncdc.noaa.gov/

注意到左边的Free Data�?/span>

点击后�{到的��面向下拉，�?/span>Free Data B中友一个完全免费的FTP�Q�红框所�C�）

提供ftp地址为：ftp://ftp3.ncdc.noaa.gov/pub/data/noaa/

我��用了FileZilla�Q?/span>http://dl.pconline.com.cn/html_2/1/89/id=5826&pn=0.html�Q�进行下�?/span>

�?/span>1w多个文�g�Q�可能是不需要完全下载的�?/span>

�Q�完�Q?/span>

一酌散千忧 2012-03-28 10:32 发表评论