文档章节

java map reduce简单模板

zmldndx
 zmldndx
发布于 2014/02/21 17:38
字数 368
阅读 463
收藏 1

输入文件内容:

a       a1
b       b2
c       c3
d       d4
a       a1
b       b2
c       c3
d       d4

输出:

a    a1|0    a1|20
b    b2|5    b2|25
c    c3|10    c3|30
d    d4|15    d4|35

代码:

import java.io.IOException;  
import java.util.StringTokenizer;  
       
import org.apache.hadoop.conf.Configuration;  
import org.apache.hadoop.fs.Path;  
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;  
import org.apache.hadoop.mapreduce.Job;  
import org.apache.hadoop.mapreduce.Mapper;  
import org.apache.hadoop.mapreduce.Reducer;  
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;  
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;  
import org.apache.hadoop.util.GenericOptionsParser;  
       
public class WordCount {  
       
	public static class TokenizerMapper extends Mapper<LongWritable, Text, Text, Text>{  
           
		public void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException {
			String[] oriSegs = value.toString().split("\t");
			String str = oriSegs[1] + "|" + key;
			context.write(new Text(oriSegs[0]), new Text(str));
		}
	}  
         
  	public static class IntSumReducer extends Reducer<Text, Text, Text, Text> {  
       
    		public void reduce(Text key, Iterable<Text> values, Context context) throws IOException, InterruptedException {  
			String out = "";
			for (Text val: values) {
				if (!out.equals("")) {
					out += '\t';
				}
				out += val.toString();
			}
			context.write(key, new Text(out));
    		}  
	}  
       
	public static void main(String[] args) throws Exception {  
		
		Configuration conf = new Configuration();
		conf.set("mapred.job.queue.name", "platform");
		String[] otherArgs = new GenericOptionsParser(conf, args).getRemainingArgs();  
		if (otherArgs.length != 2) {  
			System.err.println("Usage: wordcount <in> <out>");  
			System.exit(2);  
    		}
		
		Job job = new Job(conf, "word count");  
	       job.setJarByClass(WordCount.class);  
   		job.setMapperClass(TokenizerMapper.class);  
		job.setCombinerClass(IntSumReducer.class);  
		job.setReducerClass(IntSumReducer.class);  
		job.setOutputKeyClass(Text.class);  
		job.setOutputValueClass(Text.class);
		job.setNumReduceTasks(1); //set reducer number
		FileInputFormat.addInputPath(job, new Path(otherArgs[0]));  
		FileOutputFormat.setOutputPath(job, new Path(otherArgs[1]));  
		System.exit(job.waitForCompletion(true) ? 0 : 1);  
	}  
}
编译:make.sh    编译成jar文件

javac -classpath /home/hadoop/hadoop-0.20.2-cdh3u0/hadoop-core-0.20.2-cdh3u0.jar:/home/hadoop/hadoop-0.20.2-cdh3u0/lib/commons-cli-1.2.jar -d wordcount_class WordCount.java
jar -cvf WordCount.jar -C wordcount_class/ .
执行map reduce任务:exec.sh

IN=/user/zhumingliang/tanx_rtb_account/input
OUT=/user/zhumingliang/tanx_rtb_account/output/test
hadoop jar WordCount.jar WordCount $IN $OUT
注意:

mapper的输入key在针对文件输入时,是一行起始位置在文件中的字符序号;而mapper的输入value则为整行内容。

reducer的输入key则为mapper的输出key; reducer的输入value则为mapper的输出value。




© 著作权归作者所有

zmldndx
粉丝 4
博文 37
码字总数 17328
作品 0
朝阳
程序员
私信 提问
Java 8 lambda 表达式 示例

Java8中的Lambda表达式取代了匿名类,取消了模板,允许用函数式风格编写代码。这样有时可读性更好,表达更清晰。作为开发人员,我发现学习和掌握lambda表达式的最佳方法就是勇于尝试,尽可能...

阿刚ABC
2018/10/14
127
2
Java 8 Strem高级操作

Streams支持大量不同的操作。我们已经了解了最重要的操作,如,。发现所有其他可用的操作(参见Stream Javadoc)。我们深入研究更复杂的操作,,。 本节中的大多数代码示例使用以下人员列表进...

qianmoQ
2019/03/12
101
0
大数据(hadoop-mapreduce代码及编程模型讲解)

MapReduce编程模型 MapReduce将整个运行过程分为两个阶段: Map 阶段和Reduce阶段 Map阶段由一定数量的Map Task组成 输入数据格式解析: InputFormat 输入数据处理: Mapper 数据分组: Part...

这很耳东先生
2019/05/28
23
0
CDH集群中YARN的参数配置

CDH集群中YARN的参数配置 前言:Hadoop 2.0之后,原先的MapReduce不在是简单的离线批处理MR任务的框架,升级为MapReduceV2(Yarn)版本,也就是把资源调度和任务分发两块分离开来。而在最新的...

超人学院
2015/05/29
3.6K
0
通过java api提交自定义hadoop 作业

版权声明:本文为博主原创文章,未经博主允许不得转载。 https://blog.csdn.net/qq1010885678/article/details/43734989 通过API操作之前要先了解几个基本知识 一、hadoop的基本数据类型和j...

jchubby
2015/02/11
0
0

没有更多内容

加载失败,请刷新页面

加载更多

深入理解JVM - 类加载机制

类加载过程 一个类型从被加载到虚拟机内存中开始,到卸载出内存为止,它的整个生命周期将会经历加载(Loading)、验证(Verification)、准备(Preparation)、解析(Resolution)、初始化(...

xiaolyuh
14分钟前
99
0
脸盲症的小伙伴 测试下你的脸盲症程度

笔者在背单词的时候突然想到了一个问题,就是背单词的时候,相近的词容易混淆,例如:coast和roast,在我背诵的时候,我就很烦恼,不光是英文单词,还有汉字,例如“籍”和“藉“,我还是个中...

蛤蟆丸子
15分钟前
62
0
「网易官方」极客战记(codecombat)攻略-地牢-囚犯the-prisoner

解放囚犯,你会得到盟友。 简介 敬请期待! 默认代码 # 释放囚犯,击败守卫并夺取宝石。 # 从"Weak Door"后解救Patrick。 # 击败名为"Two"的守卫。 # 获得宝石。 概览 您可以按照名称 "Weak ...

极客战记
16分钟前
32
0
Final cut pro 10.4.4中文版本

1.双击打开dmg,点击红框图示 2.出现这个界面后直接回车 3直接将fcp拖拽到application文件夹 然后就可以直接打开了! 百度网盘地址:链接: https://pan.baidu.com/s/1Db9hXmzPV4EdR7_LxEqctA...

kylin_ink
17分钟前
42
0
jquery.validate

规则名称 类型 描述 required Boolean 设置该项内容为必填 remote Json|String 请求远程资源来校验内容有效性 minlength Number 设置内容的最少字符长度 maxlength Number 设置内容的最多字符...

愚蠢的土豆
18分钟前
133
0

没有更多内容

加载失败,请刷新页面

加载更多

返回顶部
顶部