Hadoop 上使用C 语言编程

企鹅博客
企鹅博客
企鹅博客
25193
文章
0
评论
2020年10月6日06:53:21 评论 12 views 2032字阅读6分46秒

今天尝试用C语言在Hadoop上编写统计单词的程序,具体过程如下:

一、编写map和reduce程序

mapper.c

  1. #include <stdio.h>   
  2. #include <stdlib.h>   
  3. #include <string.h>   
  4.   
  5. #define BUF_SIZE    2048   
  6. #define DELIM       '\n'   
  7.   
  8. int main(int argc, char * argv[])  
  9. {  
  10.     char buffer[BUF_SIZE];  
  11.     while(fgets(buffer,BUF_SIZE-1,stdin))  
  12.     {  
  13.         int len = strlen(buffer);  
  14.         if(buffer[len-1] == DELIM) // 将换行符去掉   
  15.             buffer[len-1] = 0;  
  16.   
  17.         char *query = NULL;  
  18.         query = strtok(buffer, " ");  
  19.         while(query)  
  20.         {  
  21.             printf("%s\t1\n",query);  
  22.             query = strtok(NULL," ");  
  23.         }  
  24.     }  
  25.     return 0;  
  26. }  

reducer.c

  1. #include <stdio.h>   
  2. #include <stdlib.h>   
  3. #include <string.h>   
  4.   
  5. #define BUFFER_SIZE     1024   
  6. #define DELIM       "\t"   
  7.   
  8. int main(int argc, char * argv[])  
  9. {  
  10.     char str_last_key[BUFFER_SIZE];  
  11.     char str_line[BUFFER_SIZE];  
  12.     int count = 0;  
  13.   
  14.     *str_last_key = '\0';  
  15.   
  16.     while( fgets(str_line,BUFFER_SIZE-1,stdin) )  
  17.     {  
  18.         char * str_cur_key = NULL;  
  19.         char * str_cur_num = NULL;  
  20.   
  21.         str_cur_key = strtok(str_line,DELIM);  
  22.         str_cur_num = strtok(NULL,DELIM);  
  23.   
  24.         if(str_last_key[0] =='\0')  
  25.         {  
  26.             strcpy(str_last_key,str_cur_key);  
  27.         }  
  28.         if(strcmp(str_cur_key, str_last_key))// 前后不相等,输出   
  29.         {  
  30.             printf("%s\t%d\n",str_last_key,count);  
  31.             count = atoi(str_cur_num);  
  32.         }else{// 相等,则加当前的key的value   
  33.             count += atoi(str_cur_num);  
  34.         }  
  35.         strcpy(str_last_key,str_cur_key);  
  36.     }  
  37.     printf("%s\t%d\n",str_last_key,count);  
  38.     return 0;  
  39. }  

二、编译

gcc mapper.c -o mapper

gcc reducer.c -o reducer

三、运行

(一)启动hadoop后将待统计单词的输入文件放到 input文件夹中:bin/hadoop fs -put 待统计文件 input

(二)使用contrib/streaming/下的jar工具调用上面的mapper\reducer:

bin/hadoop jar /home/huangkq/Desktop/hadoop/contrib/streaming/hadoop-streaming-0.20.203.0.jar -mapper /home/huangkq/Desktop/hadoop2/mapper -reducer /home/huangkq/Desktop/hadoop2/reducer -input input -output c_output -jobconf mapred.reduce.tasks=2

说明:hadoop-streaming-0.20.203.0.jar是一个管道工具

继续阅读
Android短信应用——短信信息实时获取 Linux编程

Android短信应用——短信信息实时获取

我们知道,只需通过代码就可以读到收件箱中的短信,发件箱中的短信;但是却没办法在短信发来的瞬间获取;如果我们在短信发来的一瞬间能得到相应的信息内容,那么我们就可以依次来展开很多应用了——也就是通过短信去...
LRU缓存设计 Linux编程

LRU缓存设计

缓存的数据结构采用哈希表,key到value的映射。 网上有些资料采用记录数据的使用时刻 实现LRU策略,此处采用双向链表 实现LRU策略。LRU Least Recently Used,MRUMos...
R 语言 简单介绍 Linux编程

R 语言 简单介绍

一.统计分析软件说明  统计分析软件有:SPSS, SAS、R语言,Matlab,S-PLUS,S-Miner。 SPSS: 最简单的,都是菜单操作,不过不利于二次程序开发。 SAS: 需要...
匿名

发表评论

匿名网友 填写信息

:?: :razz: :sad: :evil: :!: :smile: :oops: :grin: :eek: :shock: :???: :cool: :lol: :mad: :twisted: :roll: :wink: :idea: :arrow: :neutral: :cry: :mrgreen: