Towards Applying Large Language Models to Complement Single-Cell Foundation Models
文章主要内容总结本文聚焦于大语言模型(LLMs)与单细胞基础模型(如scGPT)的互补应用,旨在解决单细胞基础模型无法利用生物文本信息的局限性。研究背景:单细胞基础模型(如scGPT)在单细胞组学任务中表现优异,但仅基于基因表达数据训练,无法利用海量生物文本知识;而LLMs因预训练时涵盖生物知识,被尝试用于单细胞分析,但现有研究多将其作为替代方案,对其性能驱动因素及与单细胞模型的互补性探索不足。核心方法:通过可解释性方法(集成梯度、LIME)和消融实验,探究LLMs在单细胞数据分析中的性能机制;提出融合模型scMPT,结合scGPT与LLMs(Ember-V1文本编码器)的表征,利用两者协同效应;实验对比不同融合方法(如生成式LLMs与scGPT结合),验证互补策略的有效性。主要发现:LLMs通过预训练的生物知识(尤其是标记基因)和简单基因表达模式(如基因排序)实现高性能;scMPT在细胞类型分类和疾病表型预测中表现优于单一模型,且性能更稳定;具有推理能力的LLMs与scGPT结合可进一步提升性能,为未来研究提供方向。创新点揭示LLMs性能机制:首次通过可解释性分析和消融实验,明确LLMs在
上一篇/下一篇内容由系统自动关联
返回资讯列表 →