|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 原发性高血压全基因组关联研究进展显示文摘原发性高血压是一种由遗传与环境因素共同导致的复杂疾病,具有高度的遗传异质性。自2007年首个高血压全基因组关联研究(Genome-wide association studies,GWAS)报道以来,许多GWAS相继开展。文章首先对2007年1月至2011年9月期间报道的24篇血压/高血压易感基因的GWAS按人种与染色体位置对其结果进行汇总,经统计位点rs17249754、rs1378942和rs11191548报道频数最多。其次介绍了GWAS方法学的研究进展,包括选择高质量的数量表型和选择多阶段研究设计来增加研究发现阳性关联的机会。统计分析方面,除强调了已经报道过的多重比较和重复(验证)研究等问题外,文章还介绍了通过Meta分析对GWAS数据进行深度发掘,并应用基因型填补法对缺失数据进行填补可以提高全基因组遗传标记的覆盖率的方法。尽管GWAS发现了许多我们未知的基因与疾病表型的关联,为了解高血压的发病机制提供了更多线索,但是目前GWAS发现的血压/高血压相关变异多为对人群血压的影响极其微弱的常见变异。因此今后的研究中可加强深度功能学研究对易感基因精细定位和外显子组测序技术的应用,结合GWAS的成果进行生物信息学通路分析和表观遗传学机制研究等,逐步揭示高血压的遗传机制。 | 许睿玮 严卫丽 | 2012 | 遗传2012,34,7: | 13 |
| 2 | 高维肺癌病例-对照研究资料的随机森林降维分析显示文摘目的探讨随机森林算法在肺癌高维病例-对照资料分析中的应用效果。方法选取500例医院来源肺癌患者作为病例组,以517名社区来源对照人群作为对照组,每名研究对象均常规采集静脉抗凝血5ml,位点基因型通过GoldenGate定制芯片平台分型,经筛选获得399个SNP位点,先利用随机森林算法进行降维,再用传统的logistic回归对降维后的变量进行分析,并采用受试者工作特征曲线(ROC)曲线下面积(AUC)分析多个SNP位点与肺癌的遗传易感性。结果经随机森林算法筛得50个平均重要性得分最高且错误率最低的变量,其中环境变量(吸烟、年龄分组、性别)的重要性得分均位于前20,分别为4.05、3.12、1.16;在调整3个环境变量后,经阳性结果错误率(FDR)法进干亍多重性校正,结果仍有统计学意义的SNP位点有6个(FDR—P〈0.05),而如果直接采用传统logistic回归分析,则无法发现有统计学意义的SNP位点。对于2个ROC曲线(分别为只包含环境变量模型ROC曲线、包含环境变量和SNP位点模型的ROC曲线)AUC(分别为0.6491±0.0172、0.6811±0.0166)的似然比检验结果表明,6个SNP位点与肺癌的关联性有统计学意义(χ^2=43.82,P=3.6×10^-11)。结论利用随机森林算法先剔除高维数据的噪声位点,再利用logistic回归分析,可提高检验效能,优于直接利用logistic回归分析。 | 朱晶晶 赵杨 陆凤 胡志斌 陈峰 | 2012 | 中华预防医学杂志2012,46,9: | 7 |
| 3 | 使用肺癌GWAS数据进行遗传风险预测的方法和策略研究显示文摘目的探讨基于肺癌全基因组关联研究数据的遗传风险预测方法和策略。方法将肺癌GWAS数据中的南京子样本和北京子样本分别作为训练集和测试集,分别使用预测全集和最优预测子集两种策略,比较三种预测方法在不同连锁不平衡结构(LD)和初筛检验水准(α)下的预测准确度。结果 w GRS在高LD结构下,随着-log(α)增大,预测准确度呈现上升趋势;RF和SVM对LD结构不如w GRS敏感,但三种方法在低LD结构(r2<0.2)下预测准确度优于高LD结构;w GRS方法下最优预测子集效果略优于预测全集效果,SVM下子集效果与全集近似,但略逊于全集,RF下子集效果则不如全集,且差距较大。结论基于LD结构修剪SNP位点和选择适当的初筛水准可以提高遗传风险预测准确度,此时w GRS方法预测效果优于SVM和RF。 | 段巍巍 赵杨 张丽伟 胡志斌 陈峰 | 2015 | 中国卫生统计2015,32,4: | 5 |
| 4 | 基于全基因组的遗传性疾病和性状的关联位点分析显示文摘研究发现,通过全基因组关联分析,找出与疾病相关的位点或基因,对于人们防治遗传病,具有重要意义.首先,考虑固定效应(SNP位点)和随机效应(人群中的群体结构和亲缘关系),建立了混合线性模型,并且利用基于FDR标准的BH法对多重检验的P值进行校正,找出最有可能的致病位点.其次,利用Fisher的P值组合方法,将基因所包含的所有SNP位点组合,找出与疾病最可能相关的基因.由于遗传疾病可能与基因所包含的位点的子集关联,我们参考已有的ARTP模型,对模型进行了改进.最后,建立多表型联合模型MultiPhen找出与10个性状有关联的位点. | 孙冬青 沈洋 闫桦 | 2017 | 数学的实践与认识2017,47,14: | 2 |
| 5 | 基于统计检验与机器学习的全基因组关联研究框架显示文摘采用统计检验和机器学习的方法来研究SNP或基因与疾病(可测性状)的关联性.先对SNP选择合适的数值编码方式,并设计了相应的统计检验流程,随后通过P值初步筛选出了与疾病或性状相关联的位点.在此基础上,对筛选出的位点,采用随机森林,XGBoost等机器学习方法,从样本外预测的角度判断SNP与疾病或性状的关联度.相关结果,显示发现运用该分析框架能较好地筛选出与疾病或性状关联的SNP(基因).并且框架由于考虑了多种分类模型,有着稳健性高,计算开销较小以及可以交叉比对等优势.框架未来在还可在金融,社交网络等方面发挥作用. | 钱亦欣 毛宁 王阔 | 2017 | 数学的实践与认识2017,47,14: | 1 |
| 6 | 抵抗素与多发性骨髓瘤:两样本孟德尔随机化研究显示文摘目的探讨抵抗素与多发性骨髓瘤(MM)发生风险之间是否存在因果关系。方法采用两样本孟德尔随机化分析方法,将抵抗素相关遗传变异数据作为工具变量,使用MM的全基因组关联研究数据作为结局事件,采用逆方差加权法(IVW)、MR-Egger、加权中位数、加权模式和简单模式5种方法分析抵抗素对MM发生风险的因果影响。结果5种分析方法均显示抵抗素与MM之间不存在因果关系(P>0.05)。敏感性分析显示,结果稳健,基因无水平多效性、异质性及离群值,无单独的SNPs影响结果。结论本研究不支持抵抗素与MM发生风险存在因果关系。 | 王洪波 王秀娟 郭新红 江明 | 2023 | 中国循证医学杂志2023,23,9: | 1 |
| 7 | 全表观基因组关联研究的数据质控、分析流程和可视化显示文摘表观遗传是指在基因遗传序列不变的前提下,外界和内在环境因素对基因产生修饰作用,导致基因表达水平或功能发生改变,进而对多种表型或疾病结局产生影响,近年来愈发受到关注。其中,DNA的甲基化修饰已被证实与人类发育和疾病发生发展密切相关。而全基因组尺度的甲基化检测所产生的高维度基因组学数据,能够较为全面地体现基因组层面整体和局部的表观遗传修饰情况,已成为该领域的主要研究内容之一。本文基于全基因组甲基化芯片数据,总结该类组学数据的质控流程,常见表观遗传组学关联性的统计分析方法和思路,以及基于SAS JMP Genomics 10软件的主要结果的可视化实现,为同类研究提供参考。 | 樊娟娟 吉昕宇 沈思鹏 张汝阳 魏永越 陈峰 | 2021 | 中国循证医学杂志2021,21,6: | 0 |
| 8 | 从本科生角度浅谈生物医学数据的统计建模心得显示文摘由于生物医学研究领域数据的复杂性,高效的统计建模尤为重要。笔者以肺癌全基因组关联研究为例,结合建立肺癌风险预测模型的切身体会,建议研究者需要重视数据质量控制体系、反复推敲建模方法和策略、培养熟练的软件操作技能。 | 陈欣 郁可沁 鲁涵 魏永越 赵杨 于浩 陈峰 张汝阳 | 2017 | 教育教学论坛2017,,52: | 0 |
| 9 | gwasfilter:用于筛选全基因组关联研究的R脚本显示文摘目的开发一套能高效准确地从GWAS Catalog公开数据库中筛选全基因组关联研究(GWAS)的R脚本。方法参考既往研究制定GWAS的筛选原则。将人工在GWAS Catalog的筛选过程抽象为标准的算法,2名程序员共同撰写R脚本(gwasfilter.R)后,由他人多次对脚本进行测试。结果采用gwasfilter.R筛选GWAS包含6个步骤。该脚本内置5个主要函数,可以同时根据'是否有验证人群''样本量大小'和'研究人群种族'等条件对GWAS进行筛选。筛选单个性状时,程序用时不超过1秒。结论 gwasfilter.R操作简便,筛选过程高效而标准化,可灵活应用于GWAS筛选。脚本源代码网址:http://gffzz188fe103f8f1460aswp9vkvv5fp6c6qnq.ffgz.tsg.suse.edu.cn/lab319/gwasfilter。 | 杨淞淳 李重阳 胡一祯 孙秋芬 潘建桥 孙点剑一 马宝山 吕筠 李立明 | 2021 | 中华流行病学杂志2021,42,10: | 0 |
| 10 | 候选基因关联研究的统计分析方法显示文摘随着新一代测序技术的发展及全基因组关联研究(genome-wide association study,GWAS)策略的推广,复杂性疾病基因关联研究涉及的SNP位点逐渐增加,且资料收集的逐渐完善促使描述疾病结局相关的指标增多,使样本信息多元化。 | 肖纯 史晓雯 刘芸良 张奇 刘艳 | 2017 | 中国卫生统计2017,34,1: | 0 |
| 11 | 基于IMPUTE2的全基因组关联性研究的基因型填补显示文摘多数全基因组关联性研究(GWAS)采用不同的分型芯片,导致遗传变异位点的数目及选择准则不同。基因型填补可以依据已有的基因分型数据,对未分型的位点进行填补。在应用IMPUTE2软件对基因型和表型数据库(db Ga P)中胃癌GWAS数据进行全基因组填补,以详细介绍全基因组填补的原理和过程。以第九号染色体为例,使用1000 Genome Project模板介绍全基因组填补的过程,包括填补前的质量控制、Pre-phasing、填补过程、填补的质量评估及填补后的关联性分析。第九号染色体在填补前有21 033个位点;而在填补后有1 630 406个SNP;其中INFO>0.3的SNP位点有817 494个;而填补质量较高(INFO>0.5)的位点数目有584 755个。IMPUTE2软件可以快速准确的对未分型的基因型进行填补,从而可以将多个GWAS数据整合到相同的位点数和密度上,再进行联合分析可以提高检验的把握度以便发现新的遗传易感性位点。 | 辛俊逸 葛雨秋 邵卫 杜牧龙 马高祥 储海燕 王美林 张正东 | 2018 | 科学技术与工程2018,18,15: | 0 |