你好,游客 登录
背景:
阅读新闻

Hadoop 使用 MapReduce 排序 思路

[日期:2014-04-04] 来源:Linux社区  作者: [字体: ]

  本文主要讲对key的排序,主要利用hadoop的机制进行排序。

  1、Partition

  partition作用是将map的结果分发到多个Reduce上。当然多个reduce才能体现分布式的优势。

  2、思路

  由于每个partition内部是有序的,所以只要保证各partition间有序,即可保证全部有序。

  3、问题

  有了思路,如何定义partition的边界,这是个问题。

  解决办法:hadoop提供了一个采样器帮我们预估整个边界,以使数据的分配尽量平均。





收藏 推荐 打印 | 录入:Cstor | 阅读:
本文评论    (0)
评论声明
  • 尊重网上道德,遵守中华人民共和国的各项有关法律法规
  • 承担一切因您的行为而直接或间接导致的民事或刑事法律责任
  • 本站管理人员有权保留或删除其管辖留言中的任意内容
  • 本站有权在网站内转载或引用您的评论
  • 参与本评论即表明您已经阅读并接受上述条款