12 现在的位置:首页 > 期刊导读 > 2016 > 12 >

内容分块算法中预期分块长度对重复数据删除率的影响

【作者】 王龙翔 董小社 张兴军 王寅峰 公维峰 魏晓林    西安交通大学电子与信息工程学院 西安710049 深圳信息职业技术学院软件学院 广东深圳518172 浪潮集团高效能服务器和存储技术国家重点实验室 济南250101

【关键词】 基于内容分块 重复数据删除率 Logistic函数

摘要】针对基于内容分块重复数据删除方法缺少能够定量分析预期分块长度与重复数据删除率之间关系的数学模型,导致难以通过调整预期分块长度优化重复数据删除率的问题,提出了一种基于Logistic函数的数学模型。在大量真实数据测观察基础上,提出了通过Logistic函数描述非重复数据的“S”形变化趋势,解决了该数据难以从理论上推导、建模的问题,证明了基于内容分块过程服从二项分布,并从理论上推导出了元数据大小模型。基于上述两种数据模型,通过数学运算最终推导得到重复数据删除率模型,并利用收集到的3组真实数据集对模型进行了实验验证。实验结果表明:反映数学模型拟合优度的R2值在0.9以上,说明该模型能够准确地反映出预期分块长度与重复数据删除率之间的数学关系。该模型为进一步研究如何通过调整预期分块长度使重复数据删除率最优化提供了理论基础。

上一篇:用户为中心的差分扰动位置隐私保护方法
下一篇:扰动环境下作业车间网络多瓶颈识别方法研究

© 2015 《西安交通大学学报》编辑部  地址:西安市咸宁西路28号  邮编:710049
互联网备案号:陕ICP备07500839号