论文部分内容阅读
MapReduce是Google开发的在超大集群下进行海量数据运算的一种分布式编程模式。Google利用MapReduce编程模式,其搜索业务取得了巨大的成功。TF-IDF是计算词条权值的一种方法,常被搜索引擎应用,作为文件与用户查询之间相关程度的度量或评级,但是计算量特别大。本文将介绍使用MapReduce架构来解决TF-IDF实现中计算量大、速度慢的问题。