导读:空间转录组(ST)技术能够揭示组织切片中基因表达的空间异质性,但受限于高昂的成本和较低的空间分辨率。本文解读发表于BIBM 2024(IEEE International Conference on Bioinformatics and Biomedicine:IEEE 生物信息学与生物医学国际会议)的前沿论文《High-Resolution Spatial Transcriptomics from Histology Images using HisToSGE》。该研究提出了一种创新框架,巧妙地结合了预训练的病理学大模型 PILM(Pathology Image Large Model)与多头注意力机制,实现了从低成本的 H&E 组织学图像向高分辨率基因表达谱的精准跨越。
论文地址:https://arxiv.org/html/2407.20518v1
1. 研究背景与核心痛点
空间转录组(ST)技术是近年来生物学领域的重大突破,它保留了基因表达的空间位置信息,对于理解疾病机制和微环境相互作用至关重要。然而,当前的 ST 技术面临两大挑战:
成本高昂:设备和试剂昂贵,限制了大规模应用。
分辨率不足:测序斑点(Spots)分布稀疏,导致特定区域的基因表达信息缺失。
相比之下,H&E 染色的全切片图像(WSIs)不仅成本极低,而且在临床上非常普及。因此,利用深度学习“以图推基因”成为了一种极具性价比的替代方案。
现有方法的局限性:
图像特征提取不充分:仅使用有限的数据训练图像提取器(如 STNet, DeepSpaCE)。
特征表征能力弱:过度依赖低维的空间坐标信息,难以准确表征高维复杂的基因表达谱(如 STAGE)。
HisToSGE 的破局之道:
为了解决上述问题,研究团队开发了HisToSGE。其核心优势在于:引入在亿级图像上预训练的病理学大模型 (UNI)提取丰富的多模态特征,并结合多头注意力机制深度融合空间位置,最终稳健地生成任意高分辨率的基因表达图谱。
2. 方法框图 (Methodology) 深度拆解
HisToSGE 的网络架构设计非常清晰,主要分为训练阶段 (Training)和预测/生成阶段 (Predicting)。其核心流程由三大模块紧密串联:
2.1 模块一:多模态特征提取 (Feature Extraction Block)
在这个阶段,模型将输入转化为包含丰富信息的特征图。对于每一个对应于测序 Spot 的像素的图像块 (Patch):
病理特征提取 (
):借助在海量数据上预训练的UNI 大模型,提取出具有强大表征能力的 1024 维组织学特征向量
。
空间位置特征 (
):直接利用像素的二维空间坐标
形成 2 维向量
。
全局 RGB 特征 (
):将整张 H&E 图像平均池化至相同尺寸,提取整体 RGB 背景信息,得到 3 维向量
。
最终,这三者在通道维度上进行拼接 (Concat),形成包含高级语义、位置和颜色信息的多模态特征矩阵。
2.2 模块二:特征学习与融合 (Feature Learning Block)
为了捕获图像块之间复杂的全局空间依赖关系,HisToSGE 引入了 Transformer 架构的核心——多头自注意力机制 (MHSA)。
输入:融入了可学习位置编码 (
) 的多模态特征,即
。
处理流程:数据依次流经多头自注意力层、残差连接与层归一化 (Add & Norm)、以及前馈神经网络 (FeedForward)。
输出:经过深度提炼和上下文融合后的高维特征表征
。
2.3 模块三:基因投影头 (Gene Projection Heads)
处理:采用多层感知机 (MLP)。
输出:将学习到的高维图像特征
直接映射到基因表达空间,输出预测的基因表达谱
。
损失函数 (Loss Function):模型采用均方误差 (MSE) 作为损失函数,以最小化预测表达量与真实观测值
之间的差异。
3. 实验设计与结果分析
为了验证模型的有效性,作者在 4 个公开的 ST 数据集(包括 DLPFC 的 12 个切片、Mouse Brain 以及两例人类乳腺癌样本 BC1、BC2)上进行了全面的评估,并与 5 种基线方法(STnet, DeepSpaCE, HistoGene, THItoGene, STAGE)进行了对比。
3.1 表达量补全能力评估 (Table II)
实验设置:随机遮蔽(移除)50% 的真实斑点作为测试集,剩余 50% 作为训练集。
评估指标:皮尔逊相关系数 (PCC, 越高越好)、均方误差 (MSE) 和平均绝对误差 (MAE)。
结果:HisToSGE 在所有数据集上均取得了最高分数,PCC 相比最强基线提升了9%~32%,展现了卓越的缺失数据恢复能力。
3.2 预测结果的空间可视化 (Fig. 2 & 3)
实验设计:针对特定的 Marker 基因(如 DLPFC 层的 PCP4,脑组织的 Prkcd),将各模型在 50% 遮蔽数据集上的预测结果以空间热力图的形式呈现。
结果:直观对比显示,HisToSGE 生成的热力图与真实值 (Ground Truth) 的空间模式最为吻合,没有出现其他模型中明显的模糊或伪影。
3.3 跨分辨率基因表达谱生成 (Fig. 4)
实验设计 (超分辨率生成):测试时,模型在原始稀疏斑点之间按 2x、4x、8x 的比例进行极坐标插值,获取密集的虚拟坐标,并输入对应的图像 Patches。
结果:结果惊艳。相比于原始的稀疏表达谱,HisToSGE 生成的 8x 高分辨率图谱不仅细节更丰富,且呈现出极其平滑和连贯的髓鞘高表达模式,成功实现了表达谱的“超分辨率增强”。
3.4 下游任务:空间域聚类识别 (Fig. 5)
实验设计:使用各模型预测的完整基因表达矩阵,输入到流行的 ST 聚类算法(K-means, STAGATE, STMask)中进行空间区域划分。
评估指标:ARI (调整兰德指数),衡量聚类结果与人工病理标注的吻合程度。
结果:无论使用哪种聚类算法,基于 HisToSGE 生成数据的聚类结果其 ARI 值始终最高。这强有力地证明了其生成的表达谱不仅数值上准确,更保留了真实且具有生物学意义的组织空间拓扑结构。
3.5 消融实验探究 (Table III)
模块替换:将特征学习模块替换为 FeedForward 或 GAT,结果表明 Transformer 的自注意力机制效果最佳。
特征重要性:设计
STAGE_Plus模型,用 UNI 提取的图像特征取代 STAGE 原本的 2D 坐标输入。性能显著提升,证明了“强大的病理图像特征 + 优秀的特征学习网络”是实现高精度预测的关键组合。
4. 代码工程结构速览
代码地址:https://github.com/wenwenmin/HisToSGE
深入开源代码可以发现,HisToSGE 的工程实现非常规范且模块化,便于复现和二次开发。核心文件结构如下:
config.py: 配置中心,集中管理超参数、路径和控制开关。dataset.py: 数据管道,负责图像裁剪、基因数据标准化及 PyTorch Dataset 的构建。get_image_feature.py:关键效率工具。用于离线调用 UNI 大模型预先提取图像特征。此举极大地降低了训练时的显存消耗并加速了训练过程。
model.py: 主网络架构定义,将特征提取与投影头组装。transformer.py: 核心特征学习模块的具体实现 (MHSA)。train.py&test.py: 完整的训练循环、验证逻辑与权重管理。utils.py: 包含指标计算(PCC、ARI等)及空间可视化绘图工具。
5. 总结与启发
HisToSGE 为空间转录组数据的分辨率增强提供了一个强有力的范式,其研究思路带来了两点重要启发:
AI 大模型在垂直领域的重要作用:引入在十亿级病理图像上预训练的 Foundation Model(如 UNI),其在生物学纹理特征提取上的能力,远胜于在小样本上从头训练(Train from scratch)的常规 CNN/ViT 网络。
多模态上下文的深度融合是关键:预测高维基因表达,单纯依赖低维位置坐标或单纯依靠局部图像块都是不足的。HisToSGE 成功证明:将高级图像语义、精确位置编码与全局自注意力机制相结合,是恢复复杂空间基因表达分布的关键。
欢迎在评论区留言交流!