摘 要:对搜索引擎个性化服务技术中的用户描述文档、资源描述文档、个性化推荐技术、个性化服务体系结构以及该领域的主要研究成果进行了综述。通过比较现有原型系统的实现方式,详细讨论了实现个性化服务的关键技术。
关键词:数据挖掘;搜索引擎;个性化;网络资源
随着网络的迅猛发展,互联网已成为人们获得信息的重要手段[1]。海量信息在给人们带来方便的同时也带来了许多问题。人们经常要耗费大量宝贵的时间在大量组织松散的信息中寻找有用信息,因此搜索引擎网上检索信息的重要工具[2-3]越来越流行。如何准确高效地为用户提供需要的信息,是搜索引擎信息推荐研究的核心[4]。在搜索引擎中提供个性化服务技术就是针对这个问题而提出的,它为不同用户提供不同的服务,以满足不同的需求。个性化服务通过收集和分析用户信息来学习用户的兴趣和行为,达到主动推荐的目的。个性化服务技术能充分提高站点的服务质量和访问效率,从而吸引更多的访问者[5]。个性化服务系统根据其所采用的推荐技术可以分为2种:基于规则的系统和信息过滤系统。信息过滤系统又可分为基于内容过滤的系统和协同过滤系统[6]。
基于规则的系统,如IBM的WebSphere,其优点是简单、直接,缺点是规则质量很难保证,而且不能动态更新。此外,系统随着规则的数量增多,变得越来越难以管理。基于内容过滤的系统有:PersonalWebWatcher,Letizia等[7],其优点是简单、有效,缺点是难以区分资源内容的品质和风格,而且不能为用户发现新的感兴趣的资源,只能发现与用户已有兴趣相似的资源[8]。协同过滤系统如WebWatcher、GroupLens等,其优点是能为用户发现新的感兴趣的信息,缺点是存在2个很难解决的问题:一个是稀疏性,亦即在系统使用初期,由于系统资源还未获得足够多的评价,很难利用这些评价来发现类似的用户;另一个是可扩展性,随着用户和资源的增多,系统的性能会越来越低[9]。还有一些个性化服务系统如WebSIFT、FAB等,结合了基于内容过滤和协同过滤2种技术。为了克服协同过滤的稀疏性问题,可以利用用户浏览过的资源内容预期用户对其他资源的评价,这样可以增加资源评价的密度。利用这些评价再进行协同过滤,从而提高协同过滤的性能[10]。
1 国内外的研究现状
为了实现个性化服务,首先需要跟踪和学习用户的行为和兴趣,并设计一种合适的表达方式。必须组织好资源,选取资源特征,采用合适的推荐方式。此外还必须考虑系统的体系结构,以及在服务器端、客户端和代理端实现的利弊。
1.1 用户描述文档
在个性化服务系统来说,最重要的是用户的参与,有必要为每个用户建立一个用户描述文档(user profile)。用户描述文档用来刻画用户特征,在制定用户描述文档之前,需考虑下面几个问题[11]:
(1)描述文档有没有现成的标准?
(2)收集什么数据?收集数据的目的?
(3)如何收集数据?根据什么信息源来收集?
(4)收集的数据如何组织?
(5)可自适应用户信息进行更新?
在收集用户的信息之前,首先需分析用户愿意提供什么信息。用户一般都很注意个人信息的保密性,调查显示,83%的用户愿意向Web站点提供自己的姓名、性别、年龄、教育背景和兴趣,但大多数用户不愿意提供私有、敏感的信息,如个人收入和信用卡号等。另一项调查显示,39%的用户愿意Web站点向其他Web站点共享自己的信息。
1.2 资源描述文档