|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 基于Gaussian LDA的在线评论主题挖掘研究显示文摘针对现有主题挖掘方法生成的主题分布稀疏、语义不连贯,并导致可应用性差等不足之处,提出了一种基于Gaussian LDA的在线评论主题挖掘方法。首先,通过word2vec训练得到在线评论的词向量,并基于Gaussian LDA模型获取在线评论的主题分布;然后,通过主题分布来计算评论的相似度矩阵并应用AP聚类算法实现在线评论聚类,通过分析聚类结果实现主题发现;最后,利用TextRank算法提取各主题的关键句子生成主题摘要,以完成对主题的描述。该方法可有效缓解消费者在线评论信息过载问题,通过淘宝、京东、豆瓣等平台7种不同类型产品的评论数据的实验计算证明了方法的有效性及现实应用价值。 | 国显达 那日萨 高欢 杨心怡 | 2020 | 情报学报2020,39,6: | 14 |
| 2 | 知识共聚:领域分析视角下的知识聚合模式显示文摘[目的/意义]当前知识聚合模式研究侧重“依据何种知识关联开展知识聚合”,本文补充性地探索“利用知识关联将知识单元聚合成何种形式”这一后续问题,以完善知识聚合模式研究和引导实践的深入。[方法/过程]借鉴化学领域中对聚合反应两大类型划分的方法,提出以“是否保留知识单元间及其关联间的差异性”为根据,将知识聚合划分为知识类聚和知识共聚,并探讨知识共聚的基本实现形式。[结果/结论]领域知识是知识共聚开展的基础;以文档、词语为基本知识单元粒度,以用户需求入口和聚合目标资源为维度,知识共聚可通过四种基本形式实现:基于分面导航、基于多维概念关联推荐、基于知识元链接、基于资源潜在关联发现。 | 陈果 吴微 肖璐 | 2018 | 图书情报工作2018,62,8: | 8 |
| 3 | 基于主动学习的科技论文句子功能识别研究显示文摘【目的】为降低对人工标注语料的依赖,探索利用主动学习方法,充分结合现成的结构化摘要和有针对性的少量人工标注,以获得具有更好泛化能力的句子功能分类模型,识别文献句子功能类型(如表述研究的目的、方法、结论等)。【方法】以结构化摘要功能句为初始语料训练SVM、CNN、Bi-LSTM三种初始分类器,再展开主动学习:对大量无标签普通摘要句子进行功能预测,自动筛选不确定性高的样例提请人工标注,标注结果用于优化初始分类器,迭代进行主动学习,以提高分类器在新任务场景下的泛化性能。【结果】在图书情报学科文献集上实验表明,开展主动学习可取得较好的句子功能分类效果,准确率、召回率、F1值达84.65%、84.49%、84.57%,较主动学习前分别提升3.25%、3.24%、3.25%。【局限】为避免大量的人工语料标注工作,仅做了5次迭代。【结论】主动学习方法善于发现新任务场景下未标注语料与已有现成训练语料的差异,有针对性地降低人工标注成本,以提升基本模型的泛化能力。后续可进一步扩展应用于其他场景下(如引文、全文)的句子功能识别。 | 陈果 许天祥 | 2019 | 数据分析与知识发现2019,3,8: | 7 |
| 4 | 基于用户影响力的热点话题检测方法研究显示文摘[目的/意义]对微博消息进行热点话题挖掘,进而从海量微博文本中实时找出用户关注、讨论的热点事件,是进行舆情监测、应急管理的基础。然而,现有微博热点话题检测研究却大多忽略了不同影响力用户对话题产生及传播的作用,并且检测结果直观性较差。针对此问题,提出了基于用户影响力的热点话题检测方法。[方法/过程]首先识别用户特征要素,构建用户影响力模型,计算用户影响力;然后,综合考虑主题词影响力、影响力增长速度和增长斜率,提出基于用户影响力的微博热点话题主题词抽取方法,抽取主题词簇;之后,识别核心主题词并进行热点话题关键词抽取。最后,通过实验验证方法的有效性。[结果/结论]实验结果表明:基于用户影响力的热点话题检测方法能够有效识别并直观表达出检测时间窗口内的典型热点话题;该方法能有效提升实证性热点话题识别效率,减少娱乐性热点话题的识别;通过对不同时间窗口内同一话题的关键词抽取,可以实现对相应话题的热点跟踪。 | 裘江南 谷文静 翟劼 | 2017 | 情报杂志2017,36,4: | 5 |
| 5 | 面向查询的观点摘要模型研究:以Debatepedia为数据源显示文摘本文系统性地研究面向查询的观点摘要任务,旨在构建一种查询式观点摘要模型框架,探究不同的摘要方法对摘要效果的影响。通过综合考虑情感倾向与句子相似度,从待检文档中抽取出待摘要语句,再结合神经网络和词嵌入技术生成摘要,进而构建面向查询的观点摘要框架。从Debatepedia网站上爬取议题和论述内容构建观点摘要实验数据集,将本文方法应用到该数据集上,以检验不同模型的效果。实验结果表明,在该数据集上,仅使用基于抽取式的方法生成的观点摘要质量更高,取得了最高的平均ROUGE分数、深度语义相似度分数和情感分数,较生成式方法分别提高6.58%、1.79%和11.52%,而比组合式方法提高了8.33%、2.80%和13.86%;同时,本文提出的句子深度语义相似度和情感分数评估指标有助于更好地评估面向查询的观点摘要模型效果。研究结果对于提升面向查询的观点摘要效果,促进观点摘要模型在情报学领域的应用具有重要意义。 | 余传明 郑智梁 朱星宇 安璐 | 2020 | 情报学报2020,39,4: | 3 |
| 6 | 融合立场检测和主题挖掘的突发公共事件网络舆情演化研究显示文摘基于立场检测和主题挖掘的突发公共事件舆情演化研究,能够帮助政府及利益相关者快速地掌握突发公共事件网络舆情的演化规律,具有重要的意义。划分具体突发公共事件的舆情生命周期,提出新的立场检测模型和主题句挖掘方法,针对每个生命周期阶段,在识别大众网民的立场信息的基础上筛选出高效用的舆情信息,再挖掘高效用舆情信息的主题,以深入分析突发公共事件主题信息的演化规律。以“杭州女子失踪案”的微博数据为例,首先将本文方法与多种方法的实验结果进行对比分析,验证了方法的有效性;然后基于实验结果进行舆情演化分析,证明了其能够在实际的突发公共事件舆情中快速聚焦关键点,较好地分析突发公共事件舆情演化规律和特点。该方法能较有效、准确地识别和分析舆情内容,为网络舆情演化的研究提供了新视角。 | 刘高勇 黄靖钊 艾丹祥 | 2022 | 广东工业大学学报2022,39,3: | 2 |
| 7 | 基于子主题选择与三级分层结构的Web文本挖掘方法显示文摘针对用户和查询之间的意图差距导致的查询模糊宽泛和数据稀疏问题,根据流行性和多样性返回可能子主题的排名列表,利用子主题选择与排序的分层结构进行Web文本挖掘。首先,在名词性短语和可替代部分查询的基础上,使用简单模式提取各种相关的短语作为候选子主题;然后,使用网页文档集合中的相关文档构建候选子主题的三级层次结构;最后,综合考虑流行性和多样性,利用该结构和估计的流行度进行排序。实验使用了NTCIR-9库的100个日文查询和来自TREC 2009库的100个英文查询以及网络跟踪多样性任务,实验结果验证了本文方法可有效应用于各种搜索,对于高排名的子主题挖掘优于外部资源。 | 史玉珍 单冬红 | 2016 | 电信科学2016,32,5: | 1 |