- 发布
- 杭州景杰生物科技股份有限公司
- 电话
- 400-100-1145
- 手机
- 400-100-1145
- 发布时间
- 2026-08-15 10:47:12
和癌症相关的生物标志物是表明肿瘤状态、进展特征和对相关治疗产生反应的生物功能分子(基因、蛋白质或小分子物质)。已发现的癌症相关生物标志物大多是转录因子,细胞表面受体或其他组织细胞响应癌症细胞而产生的分泌蛋白。针对蛋白质组学中的大规模质谱样本或临床样本,获取在不同样本类别间(二类别或者多类别)表达量具有显著差异的一组蛋白或基因,作为筛选得到的潜在候选生物标志物。适用范围:
1、二分类或多类别样本,每个类别内的样本不少于 40 个。
2、对于二分类样本,要求数量较多样本与数量较少样本的数量比例应小于 2:1;对于多类别样本,要求数量最多样本与数量最少样本的数量比例应小于 2:1。
分析方法本分析流程主要基于 Scikit-learn 机器学习函数库,包括特征排序、模型构建、模型评估和结果可视化展示等分析模块。可以基于已有结构化数据得到全局最优模型、局部最优模型、候选生物标志物及可视化结果。
图表展示注:筛选得到特征蛋白打分柱状图。根据目标变量(样本类别)和特征(蛋白或基因)的数值,计算两者之间统计量和显著性绘制特征排序柱状图。横轴为特征的统计量值,纵轴为基因特征名称,特征的显著性值 -log10 转换后用于标注柱状图颜色。
注:前向特征选取法构建模型的评估折线图。根据特征排序结果,使用前向特征选取法在训练集上依次构建模型,使用交叉验证对基于训练集的模型进行评估。主要使用马修斯相关系数和 ROC 曲线下面积(AUC)来评估模型对训练集中样本的预测准确率。其中,马修斯相关系数到达最高点时,对应的模型为全局最优模型;马修斯相关系数在前 10 个特征上达到局部最高点时,对应的模型为局部最优模型。
注:全局最优模型在训练集和测试集上的ROC曲线。ROC 曲线用于判断模型的预测能力,横轴为假阳性率,纵轴为召回率。通过观察曲线下面积 AUC 可以定量判断模型的预测性能,AUC 值范围为 [0, 1]。其中,AUC=0.5 是随机分类模型的期望曲线下面积值,AUC 值越接近于 1,模型的分类能力越好。
注:高排序蛋白在不同类别样本中的表达量箱型图。根据特征排序的结果,对排序靠前和对模型预测性能贡献较大的蛋白或基因定量值进行可视化。
注:训练集中前5个高排序蛋白建模的ROC曲线。
参考文献
Bzdok, Danilo, Krzywinski, Martin, Altman, & Naomi. (2018). Machine learning: supervised methods. Nature Methods.
Lever, J. , Krzywinski, M. , & Altman, N. . (2016). Points of significance: logistic regression. Nature Methods, 13(7), 541-542.
Krzywinski, Martin, Altman, & Naomi. (2017). Points of significance ensemble methods: bagging and random forests. Nature methods.