甘草根茎中提取的光甘草定具有心血管保护、抗糖尿病及抗肿瘤等活性,但传统植物提取效率低且受农业波动影响,化学合成步骤繁琐,微生物发酵产量也仅停留在每升数毫克至数十毫克水平。中山大学研究团队在《Advanced Biotechnology》发表论文,宣布通过无细胞酶催化技术结合机器学习与自组装蛋白支架,将光甘草定产量提升至每升439.42毫克,较初始起点提高约百倍。
该研究构建了一条由五种酶组成的级联反应路径,以廉价氨基酸L-酪氨酸为底物,经对香豆酸和异甘草素等中间体转化为光甘草定。所用酶分别来源于玉米、拟南芥、大豆和苜蓿。研究人员对比了无细胞代谢工程(CFME)与无细胞蛋白合成驱动的代谢工程(CFPS-ME)两种路线,发现CFPS-ME能实现更高的有效酶浓度,初始产量达每升4.55毫克,显著优于粗酶液直接投料的CFME方案。
在反应条件优化阶段,团队通过单因素实验确定37摄氏度、pH 8.0、36小时反应时间及75微升体系为有利条件,随后利用Plackett-Burman设计筛选出ZmPAL、GmCHS、MsCHR浓度、pH及反应体积五个关键参数,使产量升至每升104.42毫克。面对多酶、辅因子与环境变量交织的复杂优化空间,传统统计学方法推进缓慢。
为此,团队引入机器学习进行迭代寻优。将75组前期实验数据输入包含随机森林、XGBoost、高斯过程回归等七种算法的循环框架中,采用嵌套交叉验证防止过拟合,并通过Stacking集成策略融合模型。最终RidgeCV元学习器构成的集成模型测试集R平方值达0.903,解释了超九成实验结果方差。经过三轮机器学习指导的实验,最优预测条件的平均产量从每升106.55毫克逐步攀升至138.11毫克。SHAP可解释分析进一步指出ZmPAL、ATP和NADPH是主要正向驱动因素,而CoA、酪氨酸和GmCHS呈负相关。基于模型输出的最终配方将产量推高至每升155.32毫克,较纯统计优化提升48.7%,转化效率翻倍。
最后一步借鉴生物学策略,通过共价自组装肽标签(如SpyTag/SpyCatcher等)将五种酶定向连接,并测试八种候选支架蛋白。源自嗜热古菌的丝状伴侣蛋白γ-前折叠蛋白(gamma-prefoldin)表现AlphaFold 3结构模拟显示,该支架形成致密棱柱状构型,使酶活性中心紧密相邻,中间产物可直接传递而非扩散损失。采用N-C-C-N-C结合构型并添加每毫升5毫克支架蛋白后,产量实现2.83倍跃升,最终达到每升439.42毫克。在2毫摩尔酪氨酸条件下,系统底物转化率高达85.8%。
该成果表明,将自动化模型驱动的反应条件调优与催化机器的理性物理组装相结合,可为停滞于活细胞内的代谢通路提供体外高效表达的新范式,有望打破药用黄酮类化合物规模化生产的瓶颈。
