单细胞数据里藏着"故乡"记忆?AI大模型用对抗微调还原细胞的空间语境
空间转录组学能告诉人们基因在组织里"长"在什么位置,却难以在亚细胞尺度上同时覆盖成千上万个基因;单细胞 RNA 测序能一口气读出全转录组,可细胞早已从组织里被"打散"、丢掉了空间坐标。这两种模态各有所长,配对数据却稀缺得可怜。研究团队提出一个大胆设想:既然被打散的单细胞仍保留着关于它"故乡邻里"的蛛丝马迹,那能不能用 AI 在完全不配对的两种数据之间做跨模态翻译?他们提出的 SCXM 方法,通过对单细胞基础模型做对抗式微调,成功地从单细胞表达数据里还原出空间语境,并在与专为多组学翻译打造的方法比拼中表现更优。
两种测序模态各有长短,为何难以兼得?
空间转录组学(ST)能够提供带有空间分辨率的基因表达读数,让研究者看清基因在组织样本中"长"在哪里。尤其是以 MERFISH、Xenium 为代表的荧光原位杂交(FISH)类方法,可以把空间生物学推进到亚细胞分辨率的精细程度。然而它们有一个绕不开的短板:对整个转录组的覆盖往往十分有限,一次只能测量为数不多的一批基因。想在亚细胞尺度上同时看清成千上万个基因,对这类方法来说力不从心。
与之互补的是单细胞 RNA 测序(scRNA-seq)。它能够给出全转录组的读数,一口气读出一个细胞里几乎所有基因的表达水平——但代价是,这些细胞已经从其原本所在的组织语境中被解离、打散,丢失了赖以定位的空间坐标。一个测得"全"却没了"位置",一个知道"位置"却测不"全",正因为这两者各擅胜场,空间转录组学与单细胞测序目前被视为彼此互补的两种模态。
理想情况下,若能同时采集两种模态的数据,自然最为理想。可现实是,同时捕获两种模态在成本与样本可得性上常常令人望而却步。于是,一种能够在两种模态之间做"翻译"的计算方法就变得亟需——如果能仅凭单细胞数据反推出空间语境,就等于用更易获得的一种数据,撬动了另一种数据的价值。更妙的是,这样的翻译本身还可能揭示出两种模态之间的关系,以及它们各自捕捉到的、关于生物状态的不同侧面快照。

▲ 图1:SCXM model architecture, with $G _ { \mathrm { E } }$ a fine-tuned foundation mo
被打散的单细胞,真的还记得自己的"故乡"吗?
这项工作的目标,是在单个细胞的层面上,学会把 scRNA-seq 的基因表达翻译成源自空间转录组的、经过空间聚合的表达。这一设想背后,藏着一个看似违反直觉却有据可循的判断:尽管单细胞在测序前已经从组织里被解离出来,它们的全转录组读数却依然保留着关于其昔日原位邻里的信息。换句话说,一个细胞被"打散"之后,它的基因表达里仍旧残留着它曾经身处怎样的空间环境的记忆。
真正的挑战在于,这种翻译必须在完全不配对的数据上完成。配对的空间转录组与单细胞数据本就稀缺,可这两种模态各自却都相当丰富、易于获取。因此研究团队索性绕开对配对数据的依赖,直接在不配对的两种数据之间做跨模态翻译。而破解这一难题的关键洞见在于:无论是空间转录组还是单细胞测序,两种模态最终都以"计数数据"的形式呈现。正是这一共同的数据形态,为在没有一一对应关系的前提下建立起两者之间的桥梁,提供了可以借力的支点。
这一朴素观察之所以能成为破局的支点,是因为它把两组看似风马牛不相及的数据,纳入了同一种统计语言之下。空间转录组测到的是某个位置附近若干基因的计数,单细胞测到的是某个细胞里全部基因的计数——尽管测量对象和覆盖范围迥异,但它们在数学形态上是同构的。有了这层共通性,模型就有可能在不依赖任何一一对应标注的前提下,学会把一种计数分布"翻译"成另一种,这正是不配对跨模态翻译得以成立的基石。
基于此,研究团队提出了 SCXM(single-cell cross-modal,单细胞跨模态)——一种面向单细胞基础模型的对抗式微调方法,专门用于把 scRNA-seq 翻译成空间转录组的语境特征。通过这套方法,研究团队证明了那些被解离细胞的基因表达,确实保留着关于其昔日空间语境的线索。他们进一步指出,虽然这种关联的强弱因基因而异,但对于某些通路,其翻译上相对更高的成功率是可以从生物学角度得到合理解释的——这说明模型抓住的并非随机噪声,而是真实存在的、有生物学意义的空间印记。
对抗微调基础模型,凭什么比专用翻译方法更强?
要理解 SCXM 的位置,不妨先看看前人是怎么处理不配对翻译这个问题的。scConfluence 采用最优传输来判定跨模态之间可能的配对关系,再据此训练编码器,让不同模态的潜在嵌入对齐。scACT 则走了另一条路,它训练编码器在 scRNA-seq 与 ATAC-seq 两种模态之间相互映射,并通过一个循环一致性损失来加以约束。CellContrast 又是一种思路——它在空间转录组数据上做对比学习,从而为单细胞数据恢复出一个"伪空间"。此外,空间语境常被建模为在连接相邻细胞的图上对表达值的聚合。
SCXM 与上述这些方法有一个根本区别:它被训练来直接从单细胞数据推断空间语境,而不是绕道去做配对或图聚合。而它之所以有底气这么做,靠的是"单细胞基础模型"这一利器。近年来,对大型 Transformer 网络进行生成式预训练,在组学分析中日益走红,延续了这类模型在自然语言处理与计算机视觉领域的成功。凭借在细胞分型、批次整合、扰动分析等经典单细胞任务上出色的少样本迁移能力,这类模型已被视为"基础模型"。其中,Geneformer 是一个开创性的转录组学 Transformer,它把 BERT 式的架构与一个非参数的秩值编码器结合起来,按归一化表达水平给基因排序;Nicheformer 则在 Geneformer 的基础上更进一步,通过在空间与非空间数据上联合训练加以扩展。
这些基础模型之所以被冠以"基础"之名,正是因为它们在海量组学数据上完成生成式预训练后,展现出对下游任务惊人的少样本适应力——只需少量样本、有时甚至无需额外训练,就能胜任细胞分型、批次整合、扰动分析等经典应用。这份跨任务的通用性,让它们越来越像自然语言处理与计算机视觉里那些"通吃"的大模型。SCXM 正是站在这些前人工作的肩膀上,把基础模型既有的强大表征能力,导向了跨模态翻译这一此前未被充分开垦的新战场——不是从零训练一个专用翻译器,而是唤醒并调校一个已经"见多识广"的基础模型。
下表梳理了几种不配对跨模态方法在核心机制、涉及模态与配对需求上的差异,方便读者把 SCXM 放到已有工作的坐标系中来看:
SCXM在实测中交出了怎样的成绩单?
在效果上,研究团队展示,SCXM 相较那些专为多组学翻译打造的方法表现更为出色。这一比较颇有分量,因为它把一个通过对抗微调改造而来的单细胞基础模型,放到了与专用翻译方法同台竞技的擂台上,而结果显示,借助基础模型在海量数据上习得的通用归纳能力,再辅以对抗式微调的针对性调校,足以在不配对的跨模态翻译任务上取得优势。
除了整体性能的领先,SCXM 还带来了一层更深的生物学洞见。研究团队指出,被解离细胞的基因表达与其昔日空间语境之间的关联强度,是因基因而异的——有的基因几乎不携带空间线索,有的基因则保留得相当明显。更可贵的是,对于某些通路为何在翻译上相对更成功,研究团队能够从生物学角度给出合理的解释。这意味着 SCXM 学到的并不是一堆无从解读的统计巧合,而是与真实生物学机制相吻合的、可被理解的空间印记。
这种因基因而异的可翻译性,本身就是一条值得玩味的生物学线索。它暗示着,不同基因在细胞里所扮演的角色,与其空间语境的绑定程度并不相同:有些基因的表达高度依赖于细胞周遭的环境,因而在被解离之后仍顽强地保留着空间印记;另一些基因则更多由细胞的内在状态所主导,与它身处何方关系不大。SCXM 能够把这种差异定量地刻画出来,等于为研究"哪些生物学过程是空间依赖的"提供了一把新的尺子——这层附带的洞见,甚至可能比翻译任务本身更耐人寻味。
把这些发现连起来看,SCXM 事实上回答了一个颇具想象力的问题:一个已经脱离组织、被打散测序的单细胞,其表达谱里究竟还残存着多少关于它"从哪里来"的信息?答案是——足够多,多到可以用一个经过对抗微调的基础模型把它相当程度地还原出来。这不仅在方法上给出了一条从单细胞数据推断空间语境的可行路径,也在概念上印证了"解离细胞仍保有原位邻里记忆"这一判断的真实性。
这项工作为单细胞与空间组学的融合带来了哪些启示?
纵观整项研究,它最具突破性的地方,在于把"不配对"这个原本棘手的障碍,转化成了一个可以被巧妙利用的设定。配对的空间转录组与单细胞数据固然稀缺,但两种模态各自都无比丰富;研究团队没有在稀缺的配对数据上死磕,而是抓住"两种模态同为计数数据"这一共通形态,直接在不配对的数据之间架桥翻译。这种化被动为主动的思路,为数据获取受限的组学研究提供了一个极具参考价值的范例。
同样值得关注的,是这项工作对单细胞基础模型潜力的进一步挖掘。以 Geneformer、Nicheformer 为代表的基础模型,此前已在细胞分型、批次整合、扰动分析等任务上展现出强大的少样本迁移能力;而 SCXM 证明,通过对抗式微调,这类基础模型还能被引导去完成跨模态翻译这样此前未被充分探索的新任务。这提示业界,基础模型在预训练阶段习得的通用表征,其可迁移的边界或许比人们想象的还要宽广,只待用合适的微调方式去唤醒。
更长远地看,SCXM 传递出一个鼓舞人心的信号:空间信息或许并不像人们担心的那样,会在细胞解离的一瞬间彻底湮灭。只要基因表达里还残留着可被算法捕捉的空间印记,就有可能用更易获取、更廉价的单细胞数据,去逼近那些昂贵而稀缺的空间测量。当这样一条从单细胞反推空间语境的通路被打通,研究者便能在成本可控的前提下,为海量已有的单细胞数据重新赋予"空间维度"。这不仅拓宽了空间生物学的研究边界,也让 AI 基础模型在连接不同组学模态、还原组织内在结构方面,展现出令人期待的广阔前景。
arXiv 链接:https://arxiv.org/abs/2606.07676
论文标题:Single-Cell Cross-Modal Transfer by Adversarial Fine-Tuning of Foundation Models
作者:Joseph Boyd, Matthew Lyon, Martino Mansoldo, Christian Hurry, Finnian Firth