转载自腾讯AI Lab微信公众号(tencent_ailab) 感谢阅读腾讯 AI Lab 公众号第 153 篇文章。本文介绍腾讯 AI Lab 在「AI+生命科学」领域的最新研究成果 scBERT,相关论文已发表于 Nature 子刊《Nature Machine Intelligence》。

9 月 27 日,腾讯 AI Lab 公布「AI+生命科学」跨学科应用领域的最新研究成果《scBERT as a Large-scale Pretrained Deep Language Model for Cell Type Annotation of Single-cell RNA-seq Data(基于大规模预训练语言模型的单细胞转录组细胞类型注释算法)》。论文已发表于国际顶级学术期刊《Nature》子刊**《Nature Machine Intelligence》**。

论文链接: https://www.nature.com/articles/s42256-022-00534-z

作为在计算机科学、人工智能领域期刊中影响因子最高(25.898)的顶级期刊,《Nature Machine Intelligence》只关注对该领域具有重要影响的科研成果。因其严格的评审标准,每年收录论文数量平均仅60篇左右。

论文创新性地提出关于单细胞注释的 scBERT 算法模型,实现了高解释性、高泛化性、高稳定性****的单细胞类型注释技术。该成果受到《Nature Machine Intelligence》杂志评审高度认可,表示该成果对于单细胞转录组测序数据分析领域未来研究具有深远意义。

单细胞测序技术是生命科学领域的一项革命性技术。可以细粒度地观察和刻画各个物种中组织、器官和有机体中单细胞分子图谱(细胞表达),便于更好地了解肿瘤微环境,以达到精细分析病因、精准匹配治疗方案的效果,对于「精准医疗」具有极高的应用价值。

受数据样本量小、人工干预多、过度依赖marker gene(已报道的特异性基因)等因素的影响,单细胞测序细胞类型注释技术一直面临着泛化性、可解释性、稳定性均比较低的问题,现存的算法难以有更广泛的应用。

针对以上问题,论文中首次提出「基于大规模预训练语言模型的单细胞转录组细胞类型注释算法」,即「scBERT」模型,首次将「transformer」(自然语言处理算法经典计算单元)运用到单细胞转录组测序数据分析领域。该模型基于****BERT范式,将细胞中基因的表达信息转化成可被计算机理解、学习的「语言」,并对细胞进行精准标注。

为了保证全基因组内基因级别的可解释性,「scBERT」在预训练数据上没有做任何的降维或筛选处理,最大程度上保留数据本身的特性和信息。此外,该模型复用了大规模的公开数据集,包含不同实验来源、批次和组织类型的单细胞数据,以保证模型能学习到更为「通用」的知识,精准捕获单个基因的表达信息及两两基因之间的作用关系。

从结果上来看,「scBERT」模型实现了高解释性、高泛化性、高稳定性的单细胞类型注释技术。截至目前,通过了9个独立数据集、超过50万个细胞、覆盖17种主要人体器官和主流测序技术组成的大规模benchmarking测试数据集上,该算法模型的优越性均得以验证。其中,在极具挑战的外周血细胞亚型细分任务上,相较现有最优方法的70%准确度提升了7%。

在应用价值层面,该项技术能给细胞中的每个基因都印上专属「身份证」,可用于临床单细胞测序数据,并辅助医生描述准确的肿瘤微环境、检测出微量癌细胞,从而实现个性化治疗方案或者癌症早筛。同时,对疾病致病机制分析、耐药性、药物靶点发现、预后分析、免疫疗法设计等领域都具有极其重要的作用。

腾讯 AI Lab 是腾讯的企业级 AI 实验室,于 2016 年 4 月在深圳成立。实验室强调研究与应用并重发展。基础研究关注机器学习、计算机视觉、语音技术及自然语言处理等四大方向;技术应用聚焦在游戏、数字人、内容、社交四大领域,并初探 AI 在工业、农业、医疗、医药、生命科学等领域的研究应用。

此前,腾讯 AI Lab 团队科研成果曾多次入选《Nature Communications》、ACL-IJCNLP等国际权威期刊。未来,腾讯会继续基于自身先进 AI 技术的积累,与下游临床、制药和生命科学基础研究领域进行密切合作,为行业贡献更多价值。

Yang, F., Wang, W., Wang, F. et al. scBERT as a large-scale pretrained deep language model for cell type annotation of single-cell RNA-seq data. Nat Mach Intell (2022). https://doi.org/10.1038/s42256-022-00534-z

成为VIP会员查看完整内容
14

相关内容

医学领域的人工智能是使用机器学习模型搜索医疗数据,发现洞察,从而帮助改善健康状况和患者体验。 得益于近年来计算机科学和信息技术的发展,人工智能 (AI) 正迅速成为现代医学中不可或缺的一部分。 由人工智能支持的人工智能算法和其他应用程序正在为临床和研究领域的医学专业人员提供支持。
Nat. Biomed. Eng.| 综述:医学和医疗保健中的自监督学习
专知会员服务
39+阅读 · 2022年8月25日
基于人工智能(AI)的蛋白结构预测工具合集
专知会员服务
9+阅读 · 2022年8月25日
【Nature.Mac.Intel】基于DNA调控电路的分子卷积神经网络
专知会员服务
10+阅读 · 2022年8月7日
Nat Mach Intel|用语言模型进行可控的蛋白质设计
专知会员服务
14+阅读 · 2022年7月14日
阿里达摩院发布2022十大科技趋势
THU数据派
0+阅读 · 2021年12月28日
机器学习中的数据级联
TensorFlow
0+阅读 · 2021年7月15日
详细解读谷歌新模型 BERT 为什么嗨翻 AI 圈
人工智能头条
10+阅读 · 2018年10月25日
国家自然科学基金
3+阅读 · 2017年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2011年12月31日
Arxiv
25+阅读 · 2018年1月24日
VIP会员
相关基金
国家自然科学基金
3+阅读 · 2017年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2011年12月31日
微信扫码咨询专知VIP会员