维普中文期刊产品整合服务
共被期刊论文引用了8次 您的检索式:您选中1篇文献正在查看引证文献汇总
    题名 作者 年代 出处 被引量
1基于密度峰值聚类的自适应欠采样方法显示文摘基于K-means聚类的欠采样存在仅适用于超球形状数据、未考虑重叠区对分类的影响及簇中样本的稠密程度等问题.因此,文中提出基于密度峰值聚类的自适应欠采样方法.首先利用近邻搜索算法识别重叠区的多数类样本并将其删除.然后应用改进的密度峰值聚类自动获得多个不同形状、大小和密度的子簇.再根据子簇中样本的稠密程度计算采样权重并进行欠采样,在获得的平衡数据集上进行bagging集成分类.实验表明,文中方法在大多数数据集上性能表现较优.崔彩霞 曹付元 梁吉业 2020模式识别与人工智能2020,33,9:9
2一种基于样本空间的类别不平衡数据采样方法显示文摘不平衡数据是机器学习中普遍存在的问题并得到广泛研究,即少数类的样本数量远远小于多数类样本的数量.传统基于最小化错误率方法的不足在于:分类结果会倾向于多数类,造成少数类的精度降低,通常还存在时间复杂度较高的问题.为解决上述问题,提出一种基于样本空间分布的数据采样方法,伪负样本采样方法.伪负样本指被标记为负样本(多数类)但与正样本(少数类)有很大相关性的样本.算法主要包括3个关键步骤:1)计算正样本的空间分布中心并得到每个正样本到空间中心的平均距离;2)以同样的距离计算方法计算每个负样本到空间分布中心的距离,并与平均距离进行比较,将其距离小于平均距离的负样本标记为伪负样本;3)将伪负样本从负样本集中删除并加入到正样本集中.算法的优势在于不改变原始数据集的数量,因此不会引入噪声样本或导致潜在信息丢失;在不降低整体分类精度的情况下,提高少数类的精确度.此外,其时间复杂度较低.经过13个数据进行多角度实验,表明伪负样本采样方法具有较高的预测准确性.张永清 卢荣钊 乔少杰 韩楠 GUTIERREZ Louis Alberto 周激流 2022自动化学报2022,48,10:8
3A survey on ensemble learning显示文摘Despite significant successes achieved in knowledge discovery,traditional machine learning methods may fail to obtain satisfactory performances when dealing with complex data,such as imbalanced,high-dimensional,noisy data,etc.The reason behind is that it is difficult for these methods to capture multiple characteristics and underlying structure of data.In this context,it becomes an important topic in the data mining field that how to effectively construct an efficient knowledge discovery and mining model.Ensemble learning,as one research hot spot,aims to integrate data fusion,data modeling,and data mining into a unified framework.Specifically,ensemble learning firstly extracts a set of features with a variety of transformations.Based on these learned features,multiple learning algorithms are utilized to produce weak predictive results.Finally,ensemble learning fuses the informative knowledge from the above results obtained to achieve knowledge discovery and better predictive performance via voting schemes in an adaptive way.In this paper,we review the research progress of the mainstream approaches of ensemble learning and classify them based on different characteristics.In addition,we present challenges and possible research directions for each mainstream approach of ensemble learning,and we also give an extra introduction for the combination of ensemble learning with other machine learning hot spots such as deep learning,reinforcement learning,etc.Xibin DONG Zhiwen YU Wenming CAO Yifan SHI Qianli MA 2020Frontiers of Computer Science2020,14,2:4
4面向不平衡数据的三支决策混合采样算法研究显示文摘针对不平衡数据采样算法效率低及分类效果不理想等问题,提出一种基于三支决策的三支等价粒混合采样算法(3EG-HS)。利用二元关系粒化不平衡数据集,实现三支等价粒划分,形成正等价粒、不确定等价粒和负等价粒。采用马氏距离(Mahalanobis distance)剔除负等价粒中价值密度低的多数类样本,实现负等价粒欠采样。应用SMOTE算法对不确定等价粒中的少数类样本实施过采样计算,提升价值密度高的少数类样本比例。合并正等价粒、过采样不确定等价粒和欠采样负等价粒,形成新的混合采样数据集,降低数据集的不平衡比。仿真实验结果表明,与其他采样算法相比,该算法总体性能表现优秀,根据模型评价指标,不仅G-mean值在大部分数据集上提升了5%~10%,而且F-measure1在9个数据集上得到了提升,数量上明显多于其他方法。陈丽芳 代琪 刘洋 刘保相 2020山西大学学报(自然科学版)2020,43,4:3
5面向不均衡样本空间的工件表面缺陷检测方法显示文摘针对工件表面缺陷检测中样本的非均匀状态导致检测模型难以构建问题,提出了一种面向不均衡样本空间的工件表面缺陷检测方法。构建了包含样本空间均衡化采样模型(SSE Model)与缺陷检测模型(A-C Model)的串行整体结构(SSE-D Model)。SSE Model首先通过双路并行结构分别完成原始样本的特征提取与样本区域修复,随后对所提取特征利用单样本扩充实现特征的扩充,最后利用泊松融合实现特征与已修复样本的融合,生成新样本并完成样本空间的均衡化;A-C Model以空间均衡的新样本作为检测模型输入,利用深度残差思想构建检测模型,并融合注意力机制提升模型对缺陷特征的学习能力。该模型重点解决了工件表面缺陷检测中原始样本空间不均衡问题,并提升了检测模型对特征的学习能力与鲁棒性;最后利用5类工件图像样本完成实验对比,验证了本文方法的有效性与可行性,为不均衡样本空间的表面缺陷检测提供了一种新的思路。刘佳 刘孝保 阴艳超 孙海彬 2022机械科学与技术2022,41,5:2
6万有引力近邻的多视角分类学习显示文摘不平衡数据问题对传统的近邻分类器带来了很大的挑战,它的准则函数往往会使测试样本类别偏向于多数类,且参数对数据集有很强的依赖性。基于万有引力的固定半径近邻分类器(GFRNN)算法通过引入万有引力定律的思想,实现了一个针对不平衡数据的无参、高效的分类器,但GFRNN算法仅采用欧氏距离方法来计算半径和候选集。因此,基于GFRNN算法,在算法构造层面上提出了一种多视角学习框架MGFRNN。考虑到距离计算的多样性及所对应候选集的不确定性,在距离的计算中,采用欧式距离、一范数距离和切比雪夫距离三种度量方法,根据三种距离度量方法分别计算候选集半径,并计算候选集中各类样本对测试样本的万有引力大小,从而进行分类。实验结果证明,所提MGFRNN算法在比较算法中具有最高的分类精确度。李艳琼 李冬冬 王喆 张静 2019计算机工程与应用2019,55,17:2
7基于数据驱动的配电网停电预测模型显示文摘停电事故作为影响配电网供电可靠性重要的因素之一,其预测的准确性将给整个电力系统的可靠性带来积极影响。本文提出了一种基于数据驱动的配电网停电预测模型,能够有效地预测停电事故的发生。该模型首先采用一种基于K-means聚类的停电数据集欠采样方法降低原始数据集的不平衡比;然后在此基础上,提出了一种改进的Adaboost集成学习算法,在每次权值更新时,通过使用已经训练的弱分类下的分类误差进行权重更新,用于对后面的弱分类器进行训练,进而改善分类性能。某地区的实际数据测试结果表明,本文提出的基于数据驱动的配电网停电预测模型能够有效地预测配电网停电事故的发生,相比于传统预测方法具有更好的精确度、召回率、F1值,停电预测性能得到明显提高。南东亮 冯长有 曹晖 王昕 李玉敦 谭金龙 2021电工电能新技术2021,40,12:1
8A Hybrid Evolutionary Under-sampling Method for Handling the Class Imbalance Problem with Overlap in Credit Classification显示文摘Credit risk assessment is an important task of risk management for financial institutions.Machine learning-based approaches have made promising progress in credit risk assessment by treating it as imbalanced binary classification tasks.However,few efforts have been made to deal with the class overlap problem that accompanies imbalances simultaneously.To this end,this study proposes a Tomek link and genetic algorithm(GA)-based under-sampling framework(TEUS)to address the class imbalance and overlap issues in binary credit classification by eliminating majority class instances with considering multi-perspective factors.TEUS first determines boundary majority instances with Tomek link,then take the distance from each majority instance to its nearest boundary as the radius and assigns the density of opposite class samples within the radius as the overlap potential of that majority instance.Second,TEUS weighs each non-borderline majority instance based on its information contribution in estimating class labels.After partitioning non-borderline majority instances into subgroups according to overlap potential and information contribution,TEUS applies GA to select samples from subgroups and merge them with the minority samples into a new training set.Innovatively,the design of the fitness function in GA and the grouping of the non-borderline majority not only trade off the multi-perspective characteristics of instances but also help reduce the computational complexity of the sampling optimization search.Numerical experiments on real-world credit data sets demonstrate the effectiveness of the proposed TEUS.Ping Gong Junguang Gao Li Wang 2022Journal of Systems Science and Systems Engineering2022,31,6:0
返回顶部 每页显示:
共1页 首页 上一页 第1页 下一页 末页 /1 跳转

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费