|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 支持大数据管理的NoSQL系统研究综述显示文摘针对大数据管理的新需求,呈现出了许多面向特定应用的NoSQL数据库系统.针对基于key-value数据模型的NoSQL数据库的相关研究进行综述.首先,介绍了大数据的特点以及支持大数据管理系统面临的关键技术问题;然后,介绍了相关前沿研究和研究挑战,其中典型的包括系统体系结构、数据模型、访问方式、索引技术、事务特性、系统弹性、动态负载均衡、副本策略、数据一致性策略、基于flash的多级缓存机制、基于MapReduce的数据处理策略和新一代数据管理系统等;最后给出了研究展望. | 申德荣 于戈 王习特 聂铁铮 寇月 | 2013 | 软件学报2013,24,8: | 192 |
| 2 | 区块链数据库:一种可查询且防篡改的数据库显示文摘随着比特币、以太币等一系列加密货币的兴起,其底层的区块链技术受到越来越广泛的关注.区块链有防篡改、去中心化的特性.以太坊利用区块链技术来构建新一代去中心化的应用平台.BigchainDB 将区块链技术与传统的分布式数据库相结合,利用基于联盟投票的共识机制改进传统 Pow 机制中的节点全复制问题,提高了系统的扩展性与吞吐率.但是现有的区块链系统存储的信息大都是固定格式的交易信息,虽然在每个交易里有数据字段,但是现有的区块链系统并不能经由链上对交易内的数据字段的具体细节进行直接查询.如果想要查询数据字段的具体细节,只能先根据交易的哈希值进行查询,得到该交易的完整信息,然后再检索该交易内的数据信息.数据可操作性低,不具备传统数据库的查询功能.首先提出一种区块链数据库系统框架,将区块链技术应用于分布式数据管理;其次提出一种基于哈希指针的不可篡改索引,根据该索引快速检索区块内数据,以此实现区块链的查询;最后,通过实验测试数据库的读写性能,实验结果表明,所提出的不可篡改索引在保证不可篡改的同时具有较好的读写性能. | 焦通 申德荣 聂铁铮 寇月 李晓华 于戈 | 2019 | 软件学报2019,30,9: | 43 |
| 3 | 基于关联数据的一致性和时效性清洗方法显示文摘数据一致性和数据时效性是大数据质量管理所关注的两个重要内容.条件函数依赖(CFDs)和时效约束(CCs)分别是用于分析数据一致性和数据时效性的有效技术手段.现实生活中的数据会夹杂一些关于一致性和时效性的潜在错误,这些错误又无法为CFDs和CCs检测和修复,最终影响数据的整体质量.值得一提的是,这些数据通常是相互关联的,这种关联关系可以用来发现数据中的潜在错误.文中使用了一种条件合并的函数依赖(CCFDs)将关联数据放在一起进行处理.基于此,该文提出了一种基于关联数据的一致性和时效性清洗方法.在数据清洗过程中,数据的检测和修复是两个相互影响的过程.所以,该文设计了一种新的自动清洗框架,迭代地进行数据检测和数据修复.其次,该文对关联数据的一致性和时效性清洗的相关问题进行了分析,并且证明了关于CCFDs和CCs的最小代价修复问题是一个Σ~p_2完全(NP^(NP))问题.进而,该文采用一种启发式的修复方法对错误进行修复.为了提高修复的准确性,该文还提出了一种修复序列图的概念.最后,通过在两组真实数据上进行实验,验证了方法的实用性和高效性. | 杜岳峰 申德荣 聂铁铮 寇月 于戈 | 2017 | 计算机学报2017,40,1: | 40 |
| 4 | BOD:一种高效的分布式离群点检测算法显示文摘离群点检测是数据管理领域中的热点问题之一,在许多方面都有着广泛应用,如信用卡诈骗、网络入侵检测、环境监测等.目前现有的离群点检测算法大多针对集中式的处理环境.但随着数据规模的不断增长,传统的集中式算法处理效率受限,无法满足用户日益增长的需求.针对上述问题,文中提出了一种新型的分布式离群点检测算法.首先,在数据存储阶段(即预处理),提出了BDSP(Balance Driven Spatial Partitioning)数据划分算法.该算法可以有效地均衡每个计算节点的工作负载,并实现良好的过滤效果.此外,为划分所得到的每个块设计了一种全新的编码方式,可以快速地确定块与块之间的相邻关系,降低网络开销.基于BDSP算法,提出了BOD(BDSP-based Outlier Detection)分布式离群点检测算法.该算法包括2个步骤:在每个计算节点本地,利用R树索引进行批量过滤,快速地计算离群点并得到本地候选集;利用BDSP中提供的块编码确定需要相互通信的节点,使用少量的网络开销得到最终结果.最后,通过大量实验验证了文中所提出的BDSP和BOD算法的有效性.实验结果表明,相对于现有算法,文中算法可以显著地提高计算效率并大幅降低网络开销. | 王习特 申德荣 白梅 聂铁铮 寇月 于戈 | 2016 | 计算机学报2016,39,1: | 29 |
| 5 | 腹腔镜术后坤泰胶囊联合促性腺激素释放激素激动剂治疗卵巢子宫内膜异位囊肿的临床效果显示文摘目的探讨腹腔镜术后坤泰胶囊联合促性腺激素释放激素激动剂(GnRH-a)治疗卵巢子宫内膜异位囊肿的疗效。方法将行腹腔镜手术治疗的125例卵巢子宫内膜异位囊肿患者分为观察组(n=63)及对照组(n=62)。术后观察组给予坤泰胶囊联合GnRH-a治疗,对照组仅予以GnRH-a治疗。比较两组总有效率、治疗前后性激素[包括血清促卵泡激素(FSH)、雌激素、抗苗勒氏管激素(AMH))]及糖类抗原125(CA125)水平,并记录两组患者不良反应、复发发生情况及妊娠情况。结果观察组总有效率高于对照组(P<0.05),而失眠、潮热发生率低于对照组(P<0.05)。治疗后两组AMH、雌激素及CA125水平较治疗前降低,而FSH较治疗前升高(P<0.05),但观察组雌激素、AMH水平高于对照组,且FSH及CA125水平低于对照组(均P<0.05)。两组患者复发率及妊娠率比较,差异均无统计学意义(均P>0.05)。结论对于腹腔镜术后的卵巢子宫内膜异位囊肿患者,与单纯使用GnRH-a比较,联合坤泰胶囊可有效地减轻GnRH-a引起的低雌激素症状,并改善卵巢的储备功能。 | 周鑫 唐晖 金莉 寇月阳 | 2020 | 广西医学2020,42,10: | 19 |
| 6 | 一种基于语义及统计分析的DeepWeb实体识别机制显示文摘分析了常见的实体识别方法,提出了一种基于语义及统计分析的实体识别机制(deep Web entity identification mechanism based on semantics and statistical analysis,简称SS-EIM),能够有效解决Deep Web数据集成中数据纠错、消重及整合等问题.SS-EIM主要由文本匹配模型、语义分析模型和分组统计模型组成,采用文本粗略匹配、表象关联关系获取以及分组统计分析的三段式逐步求精策略,基于文本特征、语义信息及约束规则来不断精化识别结果;根据可获取的有限的实例信息,采用静态分析、动态协调相结合的自适应知识维护策略,构建和完善表象关联知识库,以适应Web数据的动态性并保证表象关联知识的完备性.通过实验验证了SS-EIM中所采用的关键技术的可行性和有效性. | 寇月 申德荣 李冬 聂铁铮 | 2008 | 软件学报2008,19,2: | 18 |
| 7 | D-EEM:一种基于DOM树的Deep Web实体抽取机制显示文摘随着Web数据库的不断增长,通过对Deep Web的访问逐渐成为获取信息的主要手段.如何有效地抽取Deep Web中结果页面所包含的实体信息成为一个值得研究的问题.通过分析Deep Web结果页面的特点,提出了一种基于DOM树的Deep Web实体抽取机制(DOM-tree based entity extraction mechanism for Deepweb,D-EEM),能够有效解决Deep Web环境中的实体抽取问题.D-EEM采用基于DOM树的自动实体抽取策略,利用DOM树中的文本内容和层次结构来确定数据区域和实体区域,提高了实体抽取的准确性;另外,提出了一种基于上下文距离和共现次数的语义标注方法,有效地将来自不同数据源的抽取结果进行合成.通过实验验证了D-EEM中所采用的关键技术的可行性和有效性,同其他实体抽取策略相比,D-EEM在抽取效率及抽取准确性等方面具有一定的优势. | 寇月 李冬 申德荣 于戈 聂铁铮 | 2010 | 计算机研究与发展2010,47,5: | 16 |
| 8 | 一种面向医学文本数据的结构化信息抽取方法显示文摘医学文本作为医疗领域重要的信息载体,为临床诊断和病理学研究提供了重要的数据支持,然而使用自然语言编写的文本数据往往是非结构化的,不便于机器理解和自动化处理.对于中文的医学文本数据而言,由于专业性强,需要丰富的领域知识,并且语法上多采用短句形式,这给结构化信息的抽取带来了巨大的挑战.为此,本文设计了一种针对医学领域的文本数据进行结构化信息抽取的方法,该方法首先通过文本聚类和关键词提取来获得医学描述语言中常用的表达术语,然后使用生成的医学术语库辅助中文分词处理,以提高中文医学文本的分词质量.然后,分析词与词之间的语义依存关系并随之构建依存句法树.最后,从该句法树中识别和抽取医学文本描述中的关键指标及其对应的指标值,最终得到结构化的键值对数据.本文采用真实的医学影像报告文本作为实验数据,实验结果表明该方法有效提高了中文医学文本的分词质量,准确率最高可达98.24%,并在结构化的信息抽取中效果显著,具有最高83.76%的准确率和88.09%的召回率.本文提出的方法能覆盖多种依存语法,且有很好的适用性. | 杨兵 聂铁铮 申德荣 寇月 于戈 | 2019 | 小型微型计算机系统2019,40,7: | 15 |
| 9 | 融合信息增益比和遗传算法的混合式特征选择算法显示文摘随着信息技术以及电子病历和病案在医疗机构的应用,医院数据库产生了大量的医学数据.决策树因其分类精度高、计算速度快,且分类规则简单、易于理解,而被广泛应用于医学数据分析中.然而,医学数据固有的高维特征空间和高度特征冗余等特点,使得传统的决策树在医学数据上的分类精度并不理想.基于此,提出了一种融合信息增益比排序分组和分组进化遗传算法的混合式特征选择算法(GRRGA).该算法首先使用基于信息增益比的过滤式算法对原始特征集合进行排序,然后按照密度等分的原理对排序后的特征进行分组,最后再使用分组进化遗传算法对排序后的特征组进行遗传搜索.其中,分组进化遗传算法共分为种群内和种群外两种进化方法,并使用两种不同的适应度函数来控制进化过程.此外,针对决策树的不稳定性,提出使用Bagging方法对C4.5算法进行集成学习.实验结果显示,GRRGA算法在6组UCI数据集上的Precision指标均值为87.13%,显著优于传统的特征选择算法.此外,与另外两种分类算法对比可知,GRRGA算法的特征筛选性能依然是最优的.更重要的是,Bagging方法在Arrhythmia和Cancer医学数据集上的Precision指标分别为84.7%和78.7%,充分证明了该算法的实际应用意义. | 许召召 申德荣 聂铁铮 寇月 | 2022 | 软件学报2022,33,3: | 15 |
| 10 | 创新创业教育与计算机专业教育的四位一体融合模式研究显示文摘分析高校创新创业教育的现状,提出将创新创业教育与计算机专业教育有机融合的意义及必然性,阐述培养目标融合、课程体系融合、教学内容融合和师资队伍融合四位一体的融合模式。 | 寇月 鲍玉斌 于戈 张天成 | 2018 | 计算机教育2018,,6: | 14 |
| 11 | 面向不确定文本数据的余弦相似性查询方法显示文摘最近邻查询在多个领域具有广泛的应用,如组合过滤、基于位置的服务、决策支持系统等。而且随着Web信息实体抽取、隐私保护信息转化、图像识别等技术的发展和普及,在诸多领域,不确定性文本数据普遍存在,基于信息论的TF-IDF算法,可以将文本型的相似匹配转化为数值型的向量的计算,具有严密性和有效性。但TF-IDF信息的余弦距离不属于度量空间,难于构建索引。为此主要研究了面向不确定文本数据基于余弦相似度的相似性查询方法。通过分析不确定性余弦相似度计算的特性,提出了快速相似度计算方法。通过对余弦距离的计算进行转换,构建改进的索引结构s MVP-tree(statistic multiple vantage point tree),并给出了基于余弦相似度面向不确定性数据的相似度计算方法。最后,结合该相似度计算方法提出了分布式环境下k NN查询和Rk NN查询算法。大量的基于真实数据的实验验证了算法的正确性和有效性。 | 朱命冬 徐立新 申德荣 寇月 聂铁铮 | 2018 | 计算机科学与探索2018,12,1: | 11 |
| 12 | 支持多领域动态数据集成的数据库网格系统显示文摘随着公有数据库资源的丰富,广泛分布的用户希望能够按需地、透明地访问和使用这些丰富的数据资源.DS_Grid(database grid)是一个采用SOA(service-oriented architecture)思想、支持多应用领域数据共享的数据库网格系统.系统采用一种P2P(peer-to-peer)多Chord(MultiChord)网格体系结构,实现数据资源的分布存储、查询处理和动态数据集成;基于文本相似性,可分领域地注册数据资源,实现资源的快速发现;根据领域本体知识和推理规则,实现基于语义的智能查询;采用多根节点多点维护的数据资源副本管理机制,提高系统可靠性;基于关键字过滤的数据集成策略,减少通信代价;采用分布式聚类技术,实现大数据量信息的概要显示.通过实验验证了DS_Grid中所采用的关键技术的可行性和有效性. | 申德荣 于戈 聂铁铮 寇月 | 2006 | 软件学报2006,17,11: | 10 |
| 13 | 一种对时空信息的kNN查询处理方法显示文摘互联网上每天都会产生大量的带地理位置标签和时间标签的信息,比如微博、新闻、团购等等,如何在众多的信息中找到在时间和空间地理位置上都满足用户查询需求的信息十分重要.针对这一需求,提出了一种对地理位置和时间信息的k近邻查询(ST-k NN查询)处理方法.首先,利用时空相似度对数据对象的地理位置变量和时间变量进行映射变换,将数据对象映射到新的三维空间中,用三维空间中两点之间的距离相似度来近似代替两个对象之间实际的时空相似度;然后,针对这个三维空间设计了一种ST-Rtree(spatial temporal rtree)索引,该索引综合了空间因素和时间因素,保证在查询时每个对象至多遍历1次;最后,在该索引的基础上提出了一种精确的k近邻查询算法,并通过一次计算确定查询结果范围,从而找到前k个结果,保证了查询的高效性.基于大量数据集的实验,证明了该查询处理方法的高效性. | 李晨 申德荣 朱命冬 寇月 聂铁铮 于戈 | 2016 | 软件学报2016,27,9: | 10 |
| 14 | 面向关联数据的联合式实体识别方法显示文摘文中提出一种基于图的、迭代的联合式实体识别方法.初始时,将多类型的、关联的实体数据对象集合构建实体数据对象关系图,将基于语义路径的相似度和属性相似度结合起来判断数据对象是否匹配;然后,合并匹配成功的数据对象,并对对象图中的相应数据对象结点及其周边执行局部图收缩,这两个操作使对象图的局部语义变得更丰富,促使该局部范围内产生出新的候选匹配对象对,以待后续识别,实现相似度传递,形成一个迭代的识别过程.随着不断迭代,对象图的语义不断丰富,提高了联合式实体识别的准确性.通过实验证明文中提出的方法比已有的联合式实体识别方法和基于对象关系的单类型实体识别方法具有更高的准确性. | 孙琛琛 申德荣 寇月 聂铁铮 于戈 | 2015 | 计算机学报2015,38,9: | 9 |
| 15 | SKM:一种基于模式结构和已有匹配知识的模式匹配模型显示文摘针对已有基于模式结构的模式匹配方法的局限性,提出了一种利用模式结构信息和已有匹配知识的模式匹配模——SKM(schema and reused knowledge based matching model).在该模型中,借鉴神经网络元之间的影响过程实现语义匹配推理;通过重用已有匹配知识深入挖掘模式元素之间的深层语义关系;基于已有匹配知识自动缩减不确定阈值区之间来确定匹配阈值,有效减少人工干涉;给出了简单的确定模式元素之间匹配关系的方法;同时通过自适应式迭代模型,进一步挖掘求精已有匹配知识.实验结果表明,SKM模型切实可行. | 申德荣 余恩运 张旭 寇月 聂铁铮 于戈 | 2009 | 软件学报2009,20,2: | 9 |
| 16 | 多样性感知的时空文本信息的KNN查询处理方法显示文摘如何在互联网上大量的带有地理位置标签和时间标签的信息中查找满足用户需求的信息十分重要.文中针对带有地理位置和时间标签的文本信息,提出多样性感知的时空文本信息的k近邻查询处理方法.首先,归一化处理数据对象的时空变量,并建立三维Rtree索引,有效融合数据对象的时间变量和空间变量.然后,提出多样性感知的k近邻查询算法(DST-KNN)和改进的DST-KNN(IDST-KNN).最后,通过基于大量数据集的实验验证文中查询处理方法的高效性和准确性. | 李晨 申德荣 寇月 聂铁铮 于戈 | 2017 | 模式识别与人工智能2017,30,1: | 9 |
| 17 | 数据空间中数据模型及实体关联关系挖掘的研究显示文摘数据模型的研究是目前数据空间中研究的主要问题之一,是数据空间管理系统提供其它服务的基础.由于数据空间中多种异构性数据资源的共存和松散连接的特点,有必要提出一个有效、简单而且通用的数据模型来描述和管理这些数据.本文提出了分层的图数据模型lgDM来描述数据空间中的各种数据并捕捉实体间和实体类间的语义关联信息;并给出了实体关联关系挖掘的不同策略和对图加权重的方法.lgDM具有较好地通用性和扩展性,实验结果表明所提出模型的可行性和有效性. | 杨丹 申德荣 聂铁铮 于戈 寇月 | 2012 | 小型微型计算机系统2012,33,5: | 8 |
| 18 | 面向实体识别的聚类算法显示文摘实体识别是数据质量的一个重要方面,对于大数据处理不可或缺.已有的实体识别研究工作聚焦于数据对象相似度算法、分块技术和监督的实体识别技术,而非监督的实体识别中匹配决定的问题很少被涉及.提出一种面向实体识别的聚类算法来弥补这个缺失.利用数据对象及其相似度构建带权重的数据对象相似图.聚类过程中,利用相似图上重启式随机游走来动态地计算类簇与结点的相似度.聚类的基本逻辑是,类簇迭代地吸收离它最近的结点.提出数据对象排序方法来优化聚类的顺序,提高聚类精确性;提出了优化的随机游走平稳概率分布计算方法,降低聚类算法开销.通过在真实数据集和生成数据集上的对比实验,验证了该算法的有效性. | 孙琛琛 申德荣 寇月 聂铁铮 于戈 | 2016 | 软件学报2016,27,9: | 8 |
| 19 | MapReduce集群中最大收益问题的研究显示文摘MapReduce是目前最为流行的用于大数据分析的并行系统之一.许多企业已经搭建了自己的MapReduce集群,为广大用户提供计算服务.用户可以向集群提交具有完成时限要求的MapReduce作业,若作业被按时完成,则企业可以获得一定的收益.针对这种应用场景,该文首次提出了MapReduce集群中的最大收益问题.为有效地解决该问题,首先提出了一种基于序列的任务调度策略(简称为SEQ策略),并证明了在处理具有完成时限约束的作业时SEQ策略存在优势.基于SEQ策略,该文提出了最大收益的调度算法(Scheduling Algorithm for Maximum Benefit,简称AMB算法),该算法可以快速地确定可接收作业,并给出有效的执行方案,以达到最大化收益的目的.另外,针对在实际应用中的某些异常情况(如节点宕机),该文也设计了有效的超时处理策略,进一步增加了算法的实用性.最后,通过大量的实验验证了该文所提出算法的有效性. | 王习特 申德荣 于戈 白梅 聂铁铮 寇月 | 2015 | 计算机学报2015,38,1: | 8 |
| 20 | 基于重叠社区搜索的传播热点选择方法显示文摘随着社交网络的蓬勃发展,信息传播问题由于具有广泛的应用前景而受到广泛关注,影响力最大化问题是信息传播中的一个研究热点.它致力于在信息传播过程开始之前选取能够使预期影响力达到最大的节点作为信息传播的初始节点,并且大多采用基于概率的模型,如独立级联模型等.然而,现有的影响力最大化解决方案大多认为信息传播过程是自动的,忽略了社交网站平台在信息传播过程中可以起到的作用.此外,基于概率的模型存在一些问题,如无法保障信息的有效传播、无法适应动态变化的网络结构等.因此,提出了一种基于重叠社区搜索的传播热点选择方法.该方法通过迭代式推广模型根据用户行为反馈逐步选择影响力最大化节点,使社交网站平台在信息传播过程中充分发挥控制作用.提出了一种基于重叠社区结构的方法来衡量节点影响力,根据这种衡量方式来选择传播热点.提出了解决该问题的两种精确算法(包括一种基本方法和一种优化方法)以及该问题的近似算法.通过大量实验验证了精确及近似算法的效率、近似算法的准确率以及迭代式传播热点选择方法的有效性. | 单菁 申德荣 寇月 聂铁铮 于戈 | 2017 | 软件学报2017,28,2: | 8 |