搜索引擎增量式搜集的实现与评测
作者:雷凯 王东海 北京大学深圳研究生院互联网研发中心 深圳518055
摘要:针对传统的周期性集中式搜索(Crawler)的弱点和增量式Crawler的难点,提出预测更新策略,给出判别网页更新的MD5算法、URL调度算法和URL缓存算法,描述系统各个模块的分布式构架的实现,建立测试集数据对算法进行评测。该系统在北大天网搜索引擎上运行半年多,更新周期缩短了20天,变化预测命中率达到79.4%,提高了时效性、扩展性和稳定性。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社