- 发布
- 杭州景杰生物科技股份有限公司
- 电话
- 400-100-1145
- 手机
- 400-100-1145
- 发布时间
- 2026-08-15 10:47:10
聚类是基因表达数据分析中的重要工具 - 无论是在转录本还是蛋白质水平上,这种无监督分类技术通常用于揭示隐藏在大型基因表达数据集中的结构。其中大多数聚类算法都会对数据进行硬分区,即每个基因或蛋白质都jingque分配给一个聚类。如果群集分离良好,则硬群集是有利的,基因或蛋白质表达数据通常不是这种情况,因为基因或蛋白质簇经常重叠。硬聚类算法通常对噪声非常敏感。为了克服硬聚类的局限性,我们实施了软聚类,软聚类具有更强的噪声鲁棒性,并且可以避免对基因或蛋白质进行先验的预过滤,这样可以防止从数据分析中排除生物学相关的基因或蛋白质。
分析方法我们采用 Mfuzz 方法对不同连续样本(如不同处理时间或药物浓度)下蛋白的表达进行聚类分析。该方法采用了一种新的聚类算法 fuzzy c-meansalgorithm,相比 K-means 等 hard clustering 算法,一定程度上降低了噪声对聚类结果的干扰,这种算法有效的定义了基因和 cluster 之间的关系。为了进一步了解每个 cluster 中蛋白参与的生物学过程,我们分别对对每个 cluster 中的蛋白进行了 GO 功能、KEGG 通路和蛋白结构域的富集分析。
注:连续样本表达模式聚类分析结果图。 图中左侧采用折线图直观展示了蛋白在连续样本中表达量变化的趋势,进而通过聚类分析分为 6 种不同的变化趋势(cluster)。针对每种变化趋势的蛋白集分别绘制了表达量热图并进行 GO 功能、KEGG 通路和蛋白结构域的富集分析。
注:基于蛋白 cluster 的功能富集聚类分析热图。 横向代表不同的 mfuzz clsuter;纵向为 clsuter 蛋白显著富集的 KEGG 通路。不同 cluster 中的蛋白与 KEGG 通路对应的色块表示富集程度强弱。红色代表富集程度强,蓝色代表富集程度弱。
参考文献Gao, Y. , Liu, X. , Tang, B. , Li, C. , Kou, Z. , & Li, L. , et al. (2017). Protein expression landscape of mouse embryos during pre-implantation development. Cell Reports, 21(13), 3957.
Kumar, Lokesh, Futschik, & Matthias. (2007). Mfuzz: a software package for soft clustering of microarray data. Bioinformation.