内容简介
本书系统地介绍了搜索引擎的核心技术,包括网络爬虫、索引构建、查询处理、排序算法、链接分析、用户行为分析等关键模块。作者张俊林以深入浅出的方式,详细阐述了搜索引擎的工作原理和实现细节,帮助读者理解从用户输入查询到返回结果的全过程。
书中不仅涵盖了经典算法,如PageRank、TF-IDF、倒排索引,还讨论了现代搜索引擎面临的新挑战,如语义搜索、个性化推荐和实时搜索。通过大量实例和图表,读者可以直观地掌握复杂概念,并了解如何在实际工程中应用这些技术。
本书适合计算机科学、信息检索及相关领域的学生、研究人员和工程师阅读,无论是初学者还是从业者,都能从中获得宝贵的知识和实践经验。它不仅是技术手册,更是对搜索引擎设计哲学和优化策略的深度剖析。
目录
第2章 网络爬虫
2.1 通用爬虫框架
2.2 优秀爬虫的特性
2.3 爬虫质量的评价标准
2.4 抓取策略
2.5 网页更新策略
2.6 暗网抓取(Deep Web Crawling)
2.7 分布式爬虫
3.2 单词词典
3.3 倒排列表(Posting List)
3.7 查询处理
3.9 短语查询
4.1 词典压缩
4.2 倒排列表压缩算法
4.3 文档编号重排序(DocID Reordering)
第5章 检索模型与搜索排序
5.1 布尔模型(Boolean Model)
5.2 向量空间模型(Vector Space Model)
5.3 概率检索模型
5.4 语言模型方法
5.5 机器学习排序(Learning to Rank)
5.6 检索质量评价标准
第6章 链接分析
6.1 Web图
6.2 两个概念模型及算法之间的关系
6.3 PageRank算法
6.4 HITS算法(Hypertext Induced Topic Selection)
6.5 SALSA算法
6.6 主题敏感PageRank(Topic Sensitive PageRank)
6.7 Hilltop算法
6.8 其他改进算法
第7章 云存储与云计算
7.1 云存储与云计算概述
7.2 Google文件系统(GFS)
7.3 Chubby锁服务
7.4 BigTable
7.5 Megastore系统
7.6 Map/Reduce云计算模型
7.7 咖啡因系统——Percolator
7.8 Pregel图计算模型
7.9 Dynamo云存储系统
7.10 PNUTS云存储系统
7.11 HayStack存储系统
第8章 网页反作弊
8.1 内容作弊
8.2 链接作弊
8.3 页面隐藏作弊
8.4 Web 2.0作弊方法
8.5 反作弊技术的整体思路
8.6 通用链接反作弊方法
8.7 专用链接反作弊技术
8.8 识别内容作弊
8.9 反隐藏作弊
第9章 用户查询意图分析
9.1 搜索行为及其意图
9.2 搜索日志挖掘
9.3 相关搜索
9.4 查询纠错
第10章 网页去重
10.1 通用去重算法框架
10.2 Shingling算法
10.3 I-Match算法
10.4 SimHash算法
10.5 SpotSig算法
11.2 缓存对象
11.3 缓存结构
11.4 缓存淘汰策略(Evict Policy)
11.5 缓存更新策略(Refresh Policy)
12.1 个性化搜索
12.2 社会化搜索
12.3 实时搜索
12.4 移动搜索
12.5 地理位置感知搜索
12.6 跨语言搜索
12.7 多媒体搜索
12.8 情境搜索
您当前的等级为
登录后免费下载登录
小黑屋反思中,不准下载!
评论后刷新页面下载评论
支付¥以后下载
请先登录
您今天的下载次数(次)用完了,请明天再来
支付积分以后下载立即支付
支付以后下载立即支付
您当前的用户组不允许下载升级会员
您已获得下载权限
您可以每天下载资源次,今日剩余次
⚠ 网盘链接如果失效了请尝试其他网盘,不再补链,因为补了也会再次失效。
免责申明:
1. 本站分享的所有书籍均来源于自互联网,部分书籍中可能有压制者放置的广告,这并不是本站所为,请注意甄别。
2. 我们分享这些书籍,纯粹是出于知识分享的热情,以及对互联网分享精神的高度认同和践行,不以盈利为目的。
3. 本站分享的所有书籍,仅供个人学习研究使用,请勿用于任何商业用途,否则产生的一切法律纠纷与本站无关。
4. 如果这些书籍让你有所收获,在条件允许的情况下,请一定购买正版书籍,这是对创作者最好的支持。
5. 如果您是此书籍的版权所有者,且您不希望此作品出现在本站,请联系我们,我们将在收到您的请求后48小时内予以删除。