目的 筛选鸡肉不耐受患者与健康人之间的差异蛋白,富集分析识别差异蛋白的相关通路,为探讨鸡肉不耐受发生机制提供依据.方法 收集鸡肉不耐受患者及健康对照的血清样本,利用DIA技术平台对样本进行蛋白组学检测;PLS-DA结合PPI分析筛选具有相互作用的蛋白质,Cytoscape获得鸡肉不耐受患者与对照组间的差异蛋白;GO和KEGG富集分析获得差异蛋白的生物学通路与代谢通路.结果 血清样本的蛋白表达数据检测结果,共获得 2210 种蛋白质.PLS-DA分析筛选出和鸡肉不耐受相关的蛋白质 786 个,结合蛋白互作分析获得PPI网络,聚类后得到两个主要的模块:cluster1和cluster2;cluster1包括18个蛋白质,cluster 2包括12个蛋白质.两模块蛋白质进行重要性排序,筛选出鸡肉不耐受患者与健康对照间的差异蛋白为:ORM1、FGB、SERPINF2、HRG、A2M、ORM2和QSOX1.前五个为上调蛋白质,后两个为下调蛋白质.cluster1评分为10.12,GO富集分析发现差异蛋白主要参与血小板脱颗粒、肽链内切酶活性的负调节、炎症反应等生物学通路,KEGG分析富集到补体和凝血级联通路;cluster 2评分6.00,共包括12个蛋白质,GO富集分析发现差异蛋白与急性期反应、血小板脱颗粒、固有免疫应答等生物学通路有关,KEGG分析富集到补体和凝血级联通路、阮病毒病和系统性红斑狼疮的疾病通路.结论 本研究筛选出7个与IgG介导的鸡肉不耐受相关的差异蛋白,其参与的生物学和代谢通路与机体免疫、炎症过程有关,在免疫、炎症发生发展中可能起重要作用,将为探讨鸡肉不耐受发生机制提供依据.
目的 应用蛋白质组学技术,基于sigFeature变量筛选方法,获得小麦不耐受患者血清差异表达蛋白;利用富集分析获得差异蛋白生物学解释,为小麦不耐受发病机制的研究提供依据.方法 收集小麦不耐受患者和对照组血清样本;应用TMT标记定量蛋白质组学技术获得蛋白表达数据、sigFeature方法筛选差异表达蛋白;进行差异蛋白GO功能注释和KEGG富集分析,外部数据集进行差异蛋白验证.结果 TMT技术鉴定蛋白849个,sigFeature筛选获得差异蛋白22个.富集分析结果:GO富集分析发现差异蛋白参与血小板脱颗粒、急性期反应等生物学过程;KEGG富集分析发现差异蛋白参与补体与凝血级联通路.外部验证结果:ITIH2蛋白的ROC曲线下面积最大,AUC值为0.8673.结论 补体系统抑制和脂质代谢过程的改变是小麦不耐受发生的重要环节;ITIH2蛋白可能是小麦不耐受的关键蛋白;本研究从人体血清蛋白质组学的角度,为探究小麦不耐受的发生和调控机制提供依据.
目的 验证ESPCA模型降维及变量选择的效果优于SPCA;利用ESPCA模型分析结肠癌基因数据,寻找不同主成分的通路信息,筛选结肠癌的差异基因.方法 模拟实验比较ESPCA模型与SPCA的降维及变量选择能力,通过灵敏度、特异度、准确度评价其变量筛选效果;收集TCGA结肠癌基因数据,利用ESPCA模型对结肠癌基因数据进行降维及变量筛选.结果 模拟实验获得的ESPCA模型具有较高的灵敏度、特异度和准确度,降维及变量选择效果优于SPCA.结肠癌数据分析结果显示:降维后ESPCA模型第一主成分中基因与18条GO-BP通路及7条KEGG通路有关,ESPCA模型第二主成分中基因与19条GO-BP通路有关;根据度中心性及中介中心性对主成分基因排序筛选出6个差异基因:MYC、CD44、PKM、FBL、PSMA7、RPS2,经GSE137327数据集验证具有较高的AUC值.结论 ESPCA模型在降维过程中既考虑数据本身信息,又考虑了生物网络信息,具有良好的降维及变量选择效果.结肠癌数据分析中ESPCA第一主成分中基因参与癌症相关的通路;ESPCA第二主成分中基因参与的通路与免疫相关;通路中基因参与癌症的发生发展过程、可能通过免疫反应相关通路调节结肠癌的发生发展过程;获得的6个结肠癌差异基因可为研究疾病发生机制和鉴别诊断提供依据.
目的 基于加权基因共表达网络分析(weighted gene co-expression network analysis,WGCNA)方法识别IgG介导的西红柿不耐受相关蛋白质共表达模块及枢纽蛋白,为其发生机制研究提供依据.方法 收集IgG介导的西红柿不耐受患者及健康对照血清样本,使用DIA全扫描蛋白质组学定性定量技术获得蛋白质表达数据;利用WGCNA方法构建共表达网络,识别与IgG介导的西红柿不耐受相关的模块,并进行模块GO功能注释及KEGG通路富集分析;利用Cytoscape获得IgG介导的西红柿不耐受相关模块的枢纽蛋白.结果 获得IgG介导的西红柿不耐受相关的蛋白质模块两个,分别为blue模块和turquoise模块.blue模块与IgG介导的西红柿不耐受相关系数为-0.90;GO富集分析发现,该模块中蛋白主要参与脂蛋白重构、脂质代谢等相关生物过程以及蛋白质级联激活、补体激活等免疫调节过程;KEGG分析富集到5条通路,包括胆固醇代谢通路、PPAR信号通路、补体和凝血级联通路、类维生素A代谢和运输通路、维生素和辅酶因子代谢通路.turquoise模块与IgG介导的西红柿不耐受相关系数为0.72;GO富集分析发现,该模块主要与蛋白质级联激活、补体激活经典途径、体液免疫应答、受体介导的内吞,血小板脱颗粒、抗氧化活性等生物过程有关;KEGG分析富集到2条通路,补体和凝血级联通路、吞噬体通路.筛选出IgG介导的西红柿不耐受相关模块中的枢纽蛋白为APOA1、APOA4、APOC3、APOA2、APOC1、C3、HRG、FGB、HP、TF.结论 WGCNA方法进行IgG介导的西红柿不耐受蛋白质表达数据分析发现:脂质、胆固醇代谢等过程的改变可能是其发生的重要环节;获得的载脂蛋白类蛋白质及其他枢纽蛋白是其潜在关键调控蛋白;本研究从系统生物学的角度,为IgG介导的西红柿不耐受发生机制探索提供了依据和研究方向.
目的 探索基于压缩感知理论变量筛选方法在小样本量蛋白质组学研究中应用的效果和特点,为小样本量的蛋白质组学的变量筛选提供更灵敏、可靠的方法.方法 模拟实验比较基于CS理论的变量筛选方法与偏最小二乘(PLS)及随机森林(RF)筛选变量的能力,通过灵敏度、特异度及平衡准确度评价其变量筛选效果;利用CS变量筛选方法筛选非小细胞肺癌两亚型组(腺癌和鳞状细胞癌)的差异蛋白.结果 模拟实验表明,CS理论的变量筛选方法在样本量较小时具有较好的变量筛选效果,灵敏度、特异度及平衡准确度均较高;利用基于CS理论的变量筛选方法筛选,获得肺腺癌和鳞状细胞癌间差异表达蛋白22种,被证明是肺腺癌和鳞状细胞癌间有差异的蛋白为:Cytokeratin 6A、Cytokeratin 6B、Cytokeratin 6C、PKP1、P63、MCT1.结论 基于CS理论的变量筛选方法在样本量特别少时,筛选变量的效果优于PLS和RF,更适用于小样本蛋白质组学数据变量筛选研究.
目的 建立权重概率主成分分析模型,通过模拟实验进行模型评价,选择最优模型进行代谢组学数据分析,为代谢组学数据分析提供降噪优化的分析方法.方法 使用折刀抽样法计算变量载荷的置信区间和变异系数,利用变量载荷的变异信息设计倒数式、开根式、对数式三种加权方式进行原始数据中的变量加权,结合概率主成分分析模型建立权重概率主成分分析模型;通过模拟实验从第一主成分载荷的估计和预测效能进行模型评价,选择最优权重概率主成分分析模型;绘制代谢组学数据主成分得分图,利用中心距离比较权重概率主成分分析模型与概率主成分分析模型在可视化分组效果.结果 倒数式加权概率模型在第一主成分载荷的估计和模型预测方面优于另外两种权重概率模型.在可视化方面,权重概率主成分分析不仅缩小了模型估计的不确定性,而且增大组间的中心距离.结论 构建了权重概率主成分分析模型,不仅结果解释和可视化优于概率主成分分析模型,而且为差异变量的筛选提供了一个较小的参考范围.
Objective This paper aims to identify differentially expressed metabolites between patients of purpura ne-phritis and those with anaphylactoid purpura.Methods Four ranked lists from Student’s t test,Wilcoxon rank sum test,partial least square,and the random forest,respectively,are aggregated to get a combined single ranking list for identifying differentially expressed variables between groups.The ranking aggregation model was cross-validated and compared with the Least absolute shrinkage and selection operator(LASSO)model using simulation,and then applied to an real dataset,in which the ability of i-dentifying differentially expressed metabolites between patients of purpura nephritis and those with anaphylactoid purpura were compared between these two methods.Results The simulation experiment shows that:(1)when the number of observations and differential variables are small,the average area under the curve(AUC)value from the rank aggregation model is greater than that from LASSO;(2)when the number of observations and differential variables are larger,two AUCs are similar to each other;(3) no matter how the parametersare set,the number of differential variables selected by the rank aggregation model is basically less than that selected by LASSO.The real dataset analysis finds that 12 differential variables in patients with purpura nephritis are i-dentified to be differentially expressed as compared with patients with anaphylactoid purpurausing the rank aggregation model, with the AUC reaching its highest value of 0. 96.Conclusion Comparing with the LASSO model,the rank aggregation model is more reliable and accurate when being used to select differentially expressed variables,which may provide us with a new idea in metabolomics data analysis.
代谢组学的概念自20世纪90年代被正式提出[1],已被广泛应用于医学研究领域,其一般研究流程包括样本采集、样本检测、数据预处理、数据分析和生物学解释等.常用的样本检测技术有核磁共振(nuclear magnetic resonance,NMR)和高分辨率色谱-质谱联用技术[2],本文所述方法针对后者.经色谱-质谱联用平台检测的数据具有以下特点:高维度,小样本,变量间高度相关,高噪声,高缺失,以及高度变异性.基于以上数据特征,在代谢组学数据分析之前需要对数据进行预处理[3],以消除或减小数据中高噪声、高缺失和高度变异性对统计分析结果的干扰.数据预处理是数据分析的前提,有利于统计分析过程的多变量模型构建;若数据未经过充分预处理而直接用于统计分析,可能会掩盖数据中某些真实特征(如组间差异),使研究结果模糊化.数据预处理包括缺失数据处理,数据标准化,以及数据的中心化、标度化和转换等内容.本文将全面介绍基于色谱-质谱联用平台的代谢组学数据预处理方法,并进行各方法比较,为研究者选择合适的数据预处理方法提供思路.
Objective To compare the effect of one cross-validation and multiple cross-validations on PLSDA optimal model and discuss the effect of multiple cross-validations on stability of the optimal model when a few individuals are wrong grouped and when all individuals are right grouped,respectively.Methods The order of individuals in one dataset was disor-ganized to perform multiple cross-validations.Simulative data and real data were analyzed using one cross-validation and multiple cross-validations.The variation and stability of the models were tested using parameters like principal component number and MSEP.Results For simulative data,the principal component number of one cross-validation is 3 and MSEP is 0.3792;for re-sult of 5000 cross-validations when the data is not disordered,the range of principal component number is 2~6 and the range of MSEP is 0.2569~0.5794;for result of 5000 cross-validations when the data is 5%disordered,the range of principal component number is 1 ~8 and the range of MSEP is 0.2061 ~0.6463;for result of 10000 times cross-validation of real data,the range of principal component number is 4~10 and the range of MSEP is 0.0802 ~0.3761.Conclusion PLSDA models built by one cross-validation are not stable whereas multiple cross-validations can help build PLSDA models more stably when a few individ-uals are wrong grouped.So multiple cross-validation is recommended to ensure the stability of PLSDA model.