英文摘要:Disaster Recovery (DR) for information systems is essential to ensuring business continuity and data availability when disasters occur. Cloud DR is a new paradigm whereby customers pay to use a DR service. The technical resources and mature operating and management procedure of a cloud provider can be exploited so that DR goals can be achieved quickly and the full cost of owning a DR system can be reduced. Cloud DR has three primary features: data de-duplication, cloud storage security, and operating system virtualization. The first two are designed to solve problems of efficiency and security in data-level cloud DR; the last is designed to solve the problem of flexibility in system-level cloud DR. The development of cloud security will be a determining factor in widening cloud DR application.
英文关键字:cloud disaster recovery; data de-duplication; cloud storage security; operating system virtualization
基金项目:北京邮电大学高校基金(2009RC0217)
随着社会信息化程度的提高和企事业单位对信息系统依赖性的增强,信息系统的容灾备份成为灾难发生时确保业务连续性和数据可用性的重要手段。
云灾备作为灾备领域的一个新兴概念,它的出现为企业提供了一个行之有效的解决方案。云灾备是指将灾备看做一种服务,由客户付费使用灾备服务提供商提供的灾备服务的模式。采用这种模式,客户可以利用服务提供商的优势技术资源、丰富的灾备项目经验和成熟的运维管理流程,快速实现客户的灾备目标,降低客户的运维成本和工作强度,降低灾备系统的总体拥有成本。
云灾备模式之所以被提出并逐渐得到应用,相关技术的发展起到了至关重要的作用。
1 重复数据删除技术
重复数据删除技术是指将存储系统中存在的大量内容相同的数据删除,只保留其中一份,从而缩减存储空间的技术。在云灾备中,该技术既能大幅减少灾备中心存储的数据量,降低灾备中心的建设和运维成本,又能大幅减少数据备份和恢复过程中用户和灾备提供商间的数据传输量,提高备份和恢复的性能,是一项十分重要的技术。
按照检查重复数据的粒度不同,重复数据删除技术可以分为对象/文件级和块级的重复数据删除。文件级删重技术是在文件级别的粒度下查找重复数据的方法。该技术计算速度快,但粒度太粗,即使不同文件内部存在很多相同的数据,也不能被检测并实现冗余消除。块级别的重复数据删除根据切分数据块方法的不同,又可分为固定分块和可变分块的删重技术。固定分块技术是使用固定大小的分块策略在存储系统中识别相同数据的一种方法,可以提供很高的处理速度,但是对编辑和修改的序列很敏感,处理效率低。变长分块是一种基于内容技术的分块方法。与固定分块不同的是它的块断点不以一个预设值来确定,而是以其文件内容进行计算,当满足一定的标准之后方认为其为块断点。其优点是对于插入问题和删除问题处理高效。无论是插入还是删除一小部分字节,只会影响一到两个块,其余的块保持不变。其主要缺点是计算开销较大和检测重复块时指纹值索引查找的开销较大。由于其对数据变化的低敏感性,变长分块逐渐成为重复数据删除技术的主流。
随着灾备中心的规模不断增大,存储的数据量和访问量不断增加,单一节点上的重复数据删除方法已不能满足性能和容量的需求。除上述基本重复数据删除技术外,一些优化和改进技术对云灾备是至关重要的,包括高性能、可扩展的、分布式的重复数据删除技术,以及为提高灾备中心数据可靠性的高可靠重复数据删除技术。
1.1 高性能可扩展重复数据删除技术
在提高重复数据删除性能方面,可以使用减轻磁盘瓶颈技术。在重复数据删除系统中,为了节约成本,一些系统仅具有少量的内存,因而不能支持所有的数据索引一次性地进入内存进行检测,从而导致了大量的磁盘访问,这成为性能下降的最主要因素。针对这种情况,Data Domain重复数据删除文件系统中采用了减轻磁盘瓶颈的3种技术[1],它们分别是:
(1)摘要向量,一种内存中紧凑的数据结构,用于辨别新的块。
(2)基于流的块排列,一种用于提高磁盘上的被连续访问块的访问局部性的数据排列方法。