空间ATAC-seq全解析:从基因开关到组织定位

空间ATAC-seq全解析:从基因开关到组织定位 做表观遗传研究的人这几年大概都听过一句话ATAC-seq是找基因开关最快的一把钥匙。我第一次跑完ATAC的flowcell看到Peak Calling出来的几万个开放区域其实有点恍惚——我拿到了全基因组开放染色质的位置但组织切片上那些细胞本来长在哪里我却完全不知道。后来接触到百创空间ATAC才觉得这问题终于有了像样的解法在不丢失染色质可及性信息的前提下把位置坐标还回去做一张真正意义上的调控元件地图。这篇内容我打算按自己的上手路径来聊从基因开关到底指什么讲到Tn5转座酶为啥能一步到位再从常规ATAC的痛点引出空间ATAC的设计思路最后把下机后我习惯的分析流程和踩过的坑统统摆出来。无论你是刚接触表观组学的研究生还是已经在常规ATAC里滚过一圈、正想往空间维度延伸的从业者相信都能在里面找到能直接用的东西。1. 开关不是比喻是染色质上物理可及的片段1.1 为什么管它叫开关启动子、增强子与染色质可及性做分子生物学的人爱说基因表达是开关控制以前这是比喻但放到染色质层面开关是可以被测出来的物理实体。真核生物的DNA并不裸奔它缠在组蛋白上形成核小体再折叠成染色质。转录因子想要结合到DNA上调控基因表达前提是目标序列没有被核小体埋得太死。那些相对暴露、能被调控蛋白够到的区域就叫开放染色质或可及染色质区域也就是我常说的开关位置。这些位置大多对应启动子、增强子、绝缘子等调控元件。以启动子为例基因转录起始位点附近通常会有一个开放的核小体缺失区域转录因子、RNA聚合酶才能上去工作。增强子更狡猾它可以远离靶基因几万甚至几十万碱基通过染色质环把空间距离拉近但如果它不开放再远的环也白搭。所以拿到一张开放染色质图谱基本就等于拿到了一张哪些调控元件正在岗位上的清单。这里有个概念需要澄清开放不是绝对的开关状态。同一个细胞里有的启动子天生开放有的增强子是发育或刺激后才被解锁还有的是被表观修饰焊死了。ATAC-seq测到的信号强度还能反映开放程度差异这就为细胞状态转化、疾病异常调控研究提供了非常精细的线索。1.2 从DNase-seq到ATAC-seq几代开锁工具的演进早年间想做全基因组开放区域主流方案是DNase-seq。DNase I是一种能切开DNA的核酸酶但它在染色质上切不了被保护得严严实实的区域所以消化后剩下的片段里会富集开放区域的DNA。这个方法思路没问题但操作繁琐需要大量细胞、酶切时间窗口窄、背景噪音偏高稍微做不好就整张图花掉。后来又有MNase-seq主要是用微球菌核酸酶切核小体间的连接DNA更偏向研究核小体占位而不是直接找开放区域。它也能给出可及性信息但定位开放增强子的能力不如DNase。再到2013年Buenrostro等人在Nature Methods上发ATAC-seq用高活性Tn5转座酶替代传统核酸酶一次建库只需要几百到几万个细胞实验流程从两天压缩到几小时。技术代际的变化本质上是把切DNA和加测序接头这两件原本分开的事合并成一步效率和精度都上了个台阶。1.3 一张ATAC-seq数据里不只是峰新接触ATAC-seq的人总盯着Peak看其实一张ATAC数据里信息密度很高。首先比对后reads会在开放区域形成富集峰这是最直接的信号其次核小体造成的周期性信号会体现在插入片段大小分布上片段短于100bp的富集代表核小体缺失区200bp左右代表单核小体再往后还有双核小体、三核小体的特征峰。这个分布不仅是质控指标还能帮你判断建的库是不是真的来自开放染色质。TSS富集分数Transcription Start Site Enrichment也是必看的指标之一它计算reads在基因转录起始位点附近聚集的程度。正常图谱应该是TSS中心有个尖峰然后两侧像山谷一样低下去。如果TSS富集分低于5我这批数据基本就判重做不是建库问题就是样本已经降解得不成样子。2. Tn5转座酶为什么一把剪刀就能定位全基因组开放位点2.1 野生型转座酶变身自动化工具的关键改造Tn5本来是一种细菌转座子编码的酶天然功能是把转座子从一个DNA位置剪切并插入到另一个位置。ATAC-seq用的不是野生型而是经过定向突变优化出的高活性版本。这版Tn5有两个核心特点一是转座活性极高能在极短时间和微量DNA条件下完成大量插入事件二是它可以直接装载定制的DNA接头也就是我们常说的Adapter序列。于是它在切断染色质DNA的同时把测序接头也缝到了断口上。这一步的意义怎么强调都不过分因为传统建库流程需要先打断DNA、再做末端修复、加A尾、连接接头每一步都可能损失样本。Tn5把打断接头连接融成一步让建库从多步变成一管反应这对低起始量样本尤其友好。很多做过微量ChIP-seq再转过来做ATAC的人都会被这种一步到位的体感震惊到。2.2 Tn5为什么只切开放的位置这个问题是ATAC-seq原理的核心也是面试、组会里最常被问的问题。答案是空间位阻而不是序列偏好。Tn5要插入DNA必须先形成一个转座体结构它需要同时接触DNA双螺旋并完成切割。当DNA被组蛋白缠成核小体时Tn5的体积和物理位阻让它在核小体表面几乎找不到立足点所以即便序列完全一样闭合区域的切口效率也远低于开放区域。简单类比你在拥挤的地铁里想转身很难但站在空旷站台上随便就能迈步。Tn5就是那个想迈步的转座酶开放染色质是空站台闭合染色质是早高峰车厢。不过Tn5也不是完全随机地尊重开放程度它对高AT含量的序列有轻微偏好也会在一些拓扑结构特殊的位置产生低水平噪音。好在这些偏好相对稳定通过背景建模、Peak Calling时的input对照基本能校正回来不影响主图谱的可靠性。2.3 建库反应的控制点酶量、时间与线粒体占比建库时三个参数最要命Tn5用量、反应温度、反应时间。标准参考是37摄氏度反应30分钟但不同产品、不同样本类型的最佳条件差异很大。细胞核提取后我一般会先做一个酶量梯度比如按说明书酶量的0.5倍、1倍、2倍哪组TSS富集分数最高就选哪组。反应时间太长会导致背景升高太短又切不够出现峰形钝化。还有一个容易被忽视的指标线粒体DNA占比。线粒体DNA没有组蛋白保护完全开放Tn5见它就切所以测序数据里往往有相当比例reads是线粒体序列。如果线粒体占比超过50%说明你的核提取或细胞核纯度出了问题也可能是转座过度如果特别低反而要小心是不是转座不够。我通常在建库后先做一次浅层测序或qPCR确认线粒体占比在合理范围再决定是否加大测序量。3. 空间ATAC的核心思路把在哪里还回去3.1 常规ATAC的致命痛点解离让位置归零常规ATAC-seq不管做整组织还是培养细胞第一步几乎都是把样本处理成单细胞悬液或提取全细胞核。这一步做完组织里的空间架构就彻底归零了。你可以知道某个细胞类型有哪些开放位点却不知道它在组织里靠哪根血管、挨着哪些邻居、处在肿瘤核心区还是边缘区。对很多生物学问题来说这个坐标缺失是无法接受的。举个例子肿瘤微环境中的巨噬细胞在缺氧区和炎性区的开放图谱差异很大但当你把整个肿瘤消化成悬液后所有巨噬细胞被混成一个大池子异质性信息被平均化甚至掩盖。有空间ATAC之后我们能直接看到同一类型细胞在不同地带的状态切换这是传统流式加测序怎么都做不到的。3.2 空间条形码与显微镜图像对齐的技术骨架空间ATAC目前比较通用的路线是组织切片直接贴芯片。芯片表面排列了大量带位置条形码的捕获点每个捕获点相当于一个微小的空间ID。操作时先把冷冻组织切成10微米左右的薄片贴在芯片上然后做透化处理让Tn5进入核内进行转座。切下来的DNA片段因为带着Tn5接头的序列会被附近捕获点上的空间条形码抓住后续扩增时就可以把片段来源追溯到具体的位置坐标。这个过程的关键是显微图像与条形码阵列的对齐。芯片上同时设计有荧光探针或刻痕标记可以拍到和HE染色高度匹配的组织形态图分析时再把测序得到的条形码矩阵映射到这张图上于是每个spot都带着两个身份细胞层面的可及性图谱和组织层面的空间坐标。只要对齐做得好最后就能把开放染色质的信号画在组织切片照片上一眼看清哪些区域开关密集、哪些区域一片沉寂。3.3 百创空间ATAC的样本前处理要点我拿百创空间ATAC这套流程开箱用的样本是液氮速冻的鼠脑冠状切片。整个前处理有几个必须注意的点第一组织包埋尽量用OCT切片厚度控制在10到15微米之间太薄细胞核被切穿图谱信号弱太厚又会阻碍通透Tn5进不去第二固定剂不能过度常见的甲醇固定能帮组织维持形态但固定时间太长会降低染色质可及性我一般控制在10分钟以内第三通透处理必须做梯度预实验因为脑组织脂质丰富通透剂浓度不够时信号全堆在切片边缘。还有一个来自实践的提醒取材到包埋之间越短越好尽量保证组织缺血时间在10分钟以内。ATAC-seq对细胞状态的敏感性比RNA-seq高得多取到的组织如果常温放半小时开放染色质状态就会出现人为漂移明明还活着的细胞调控元件已经开始关闭了。4. 拿到百创空间ATAC下机数据后我按什么顺序做分析4.1 第一道关卡QC指标与片段分布下机数据到手第一件事不是急着画图而是把QC指标看一遍。百创空间ATAC下机一般会产出R1和R2两个方向的reads里面包含DNA片段序列和条码信息。质检我会关注三个东西碱基质量Q30比例、有效条形码的识别率、以及插入片段长度分布。插入片段长度分布是ATAC特有的指纹如果图谱里短片段和单核小体片段两个峰都很清楚说明Tn5确实主要切在开放染色质区域如果两个峰糊成一团甚至还有一个异常的大片段拖尾多半是固定或纯化出了问题。另外还要看不同spot的reads数分布有的spot可能完全没抓到片段有的spot则是巨无霸在后续分析里要按质控阈值筛掉。4.2 比对、去重与Peak Calling比对我习惯用bwa mem或者bowtie2也可以但一定要包括线粒体和核糖体DNA序列作为参考。比对完要标记重复reads因为PCR扩增容易产生偏好重复率过高会导致对开放信号强度的错误估计。Peak Calling方面过去常用MACS2但空间ATAC数据其实更推荐用SnapATAC2或ArchR这类专门处理单细胞开放染色质的工具。它们能直接读进片段矩阵做双联体去除、聚类后再调峰。空间ATAC的spot数量一般没有单细胞ATAC的细胞多但每个spot覆盖的组织区域更大信号噪声比也不一样所以MACS2那套基于局部背景的算法并不总是最优。用ArchR时我会在Fragment对象上建PeakMatrix再用自己设定FDR阈值跑一遍出来的峰文件再回到空间坐标上做可视化。4.3 空间聚类与组织坐标图谱绘制分析空间ATAC和单细胞ATAC最大的差异点是需要把无监督聚类的结果贴回组织切片坐标。我常用的流程是先用降维聚类把开放图谱相似的spot聚成一类然后在组织图像上给每个spot上色。这一步一做出来很多生物学问题立刻就肉眼可见了比如大脑皮层不同层的细胞类型会因为开放的marker不同而自动分成清晰的条带。落到工具上ArchR可以输出Clusters之后直接对接自写可视化脚本R里的Seurat也扩展了spatial相关功能不过更顺手的还是Python里直接处理坐标矩阵。把spot坐标、聚类标签、某个基因附近的开放信号叠加到一个坐标系最后用matplotlib或plotly出图。数据量大时建议用六边形网格聚合显示既快又能避免每个spot单独绘图带来的过密重叠。4.4 空间层面的差异开放区域分析聚类只是第一步真正的生物学发现在差异分析里。空间ATAC可以把研究对象从整组织平均信号变成指定空间区域的信号。比如划一条边界取出肿瘤中心区的spot做一组差异Peak再把边界外区域的spot做另一组就可以拿到肿瘤核心区特异开放的调控元件。做差异分析时千万注意归一化。空间ATAC每个spot的测序覆盖深度差异大直接用原始count比较会得出虚假信号。我习惯先做TF-IDF归一化Term Frequency-Inverse Document Frequency再用Wilcoxon检验比较两组spot的Peak信号结果按FDR校正后筛选。这个流程在单细胞ATAC分析里已经很成熟空间数据多了一个坐标属性但统计逻辑是可以平移的。5. 实操避坑从组织切片到能出图的完整链路5.1 样本形态与质量是决定成败的一半在最开始做百创空间ATAC的时候我最深的感触就是绝大多数失败都是从样本端带进来的。空间ATAC要求组织切片既保留完整形态又要让Tn5能均匀地切到开放染色质。OCT包埋如果不注意防冰晶切片上会有大量窟窿这些窟窿周围的组织实际上已经受过物理损伤可及性图谱会产生大片假信号。我的补救经验是液氮速冻前先把组织放入异戊烷中冷却能有效减少冰晶形成如果实验室没有异戊烷用液氮速冻时拿镊子夹住组织不停晃动让它快速通过相变温度区。另外取到的新鲜组织尽量别泡在PBS里太久。之前我做过一组对照新鲜鼠脾脏取材后立刻包埋 vs 在冰PBS里泡了40分钟再包埋后者的峰信号和TSS富集分数肉眼可见地掉了一档。空间实验里组织形态和核状态经不起等待能多快就多快。5.2 透化时间和Tn5反应条件的梯度大法空间ATAC比普通单细胞ATAC多一个透化步骤目的是让Tn5能进入完整细胞核。不同组织透化难度天差地别肝脏这类细胞结构松散的可能1分钟足够大脑和心肌这种致密组织可能要5分钟甚至更久。透化不足的表现是信号只在切片表层或者整个图谱信号极弱透化过头则会出现背景升高spot之间信号糊成一片。我建议每一个新的组织类型都在正式实验前做一次透化时间梯度 Tn5浓度梯度的小实验各取两个时间点、两个浓度交叉做四管看看哪个组合跑出来的片段分布最漂亮。虽然会多花一天时间但比整批样本翻车重做到头来划算得多。5.3 双联体真的比单细胞ATAC还让人头疼单细胞ATAC里有双联体两个细胞被当成一个细胞测空间ATAC里同样存在而且更隐蔽两个空间spot如果太近或者组织切片贴歪了捕获点可能同时捞到邻近区域的DNA片段。这会让聚类结果里出现一些混合状态的spot既像A又像B。处理办法有几个层次。第一层是在建库前就尽量加低浓度Tn5减少跨spot污染第二层是分析时用ArchR或SnapATAC里已有的双联体评分工具结合每个spot的reads多样性和片段数来判断第三层是做聚类时对边界上的模糊spot打上未分配标签不影响整体空间图的干净度。5.4 批次效应多个切片一起分析时最容易被忽视空间ATAC实验如果一次只做一张切片批次效应不严重。但很多课题需要比较不同病人、不同发育时期或者多张连续切片批次效应就会冒出来。不同批次的spot测序深度不同、Tn5批次活性不同、切片厚度有细小差异都会让聚类结果先去分开批而不是分生物学状态。我的做法是质控时保留所有spot的片段数中位数分析时把切片样本编号作为协变量用Harmony或Seurat的integrate方法做批次校正。校正后聚类再映射回空间坐标视觉效果会自然很多。记住空间信息带来视觉信任感的同时也很容易让人忽略统计上的批次问题宁可先多跑一轮整合再下生物学结论。6. 这张地图到底能读出哪些生物学故事6.1 细胞类型鉴定开放区域就是标记基因的表观指纹有了空间ATAC数据后最简单直接的应用是细胞类型鉴定。和单细胞RNA测序根据基因表达矩阵聚类不同ATAC聚类靠的是开放染色质区域的相似性。每个细胞类型都会有一些特异开放的调控元件拿到一个新聚类后我第一件事就是看这个聚类是否富集已知的细胞类型marker基因附近的可及性信号。例如神经元会有SYT1、RBFOX3附近的峰少突胶质细胞会富集MBP、OLIG2附近的开放区域。这种鉴定的好处是它直接反映潜力而非瞬时表达。一个细胞通过关闭一批调控元件、打开另一批调控元件决定自己将来的命运走向。所以在发育时间序列样本里ATAC聚类往往能比RNA聚类更早捕捉到细胞命运决定的倾向性。6.2 增强子-启动子互作的预测共可及性分析单点看开放Peak还不够更上一层楼的是看不同Peak之间是不是在空间组织中同进同出地开放。如果某个远端的增强子位点和某个基因的启动子位点在很多spot中同时开放且共变性很强就可以推测它们存在潜在的物理互作关系可能通过染色质环连到一起。ArchR里提供了co-accessibility score基于chromVAR框架计算Peak与Peak之间的共变趋势。设定阈值后就能画出增强子—启动子连线再叠加到空间坐标上甚至可以观察这些互作在某些组织区域是不是特异出现。这对寻找未知enhancer、解释sQTL位点很有价值。6.3 空间异质性疾病样本里的局部开关紊乱空间ATAC在疾病样本上的优势是能够把异常开放位点精确定位到组织脆弱区。我在肿瘤样本里见过非常有意思的图同一个肿瘤切片核心缺氧区里HIF1A靶位点附近的开放程度明显上升而免疫浸润区里干扰素响应相关调控元件变得活跃。这些区域在单细胞解离后几乎都被稀释掉只有带着坐标去看才能发现原来异常是局部的。类似的逻辑也能用在发育生物学。早期胚胎的体轴建立、神经管的背腹分化本质都是细胞在空间上获得不同开放图谱。空间ATAC提供的分辨率能让你把形态学上的区域和分子上的开关状态直接对上这是别人讲半天都讲不清楚的证据。6.4 多组学整合把ATAC与RNA放进同一张组织图测了ATAC只能看到调控元件状态要了解这些区域最终启动了哪些基因最好把同一切片的RNA信息也拿到手。目前空间多组学的主要路线有两种一种是像百创空间这类平台支持连续切片一张做ATAC一张做转录组然后基于组织形态和坐标系统做整合分析另一种是在同一个spot里同时捕获RNA和开放片段成本更高但精度更好。整合分析时最常用到的是RNA表达 × 开放区域联动矩阵。某个基因的高表达如果和它启动子附近的开放Peak在空间上高度重合基本可以断定这个基因在该区域是被推进转录的状态。再加上增强子共可及性信息就能构建出从增强子开放→启动子开放→转录激活→蛋白功能的完整空间链条这是单组学完全做不到的。做空间ATAC这一年多我最大的体感是技术本身的灵敏度上限已经很高真正的瓶颈在人的耐心。样本质量、透化条件、批次校正、聚类参数每一环都决定了最终那张开关地图是能讲故事还是只能糊墙。我个人的习惯是每次拿到新数据分析前先把上面几个质控指标过一遍再进Peak和可视化实验上也坚持给每种组织留一套梯度测试的备选方案。这样虽然看起来多花时间但实际跑下来反而比一开始就冲正式样本要快得多。如果你正准备从普通ATAC往空间ATAC转又恰好想用百创空间这类平台那就先拿一块自己最熟的组织把从切片到出图的全流程走通再上真正要发文章的样本。这张地图越早画明白后面的课题设计就越踏实。