跳到正文
bioinfo.zle.ee
返回

复现Mathys et al.阿尔茨海默snRNA-seq数据:从GSE138852到细胞类型、疾病构成和解释边界

发布于:

Mathys et al.的阿尔茨海默snRNA-seq数据适合训练脑疾病单细胞复现的基本功。脑组织里细胞类型差异很大,疾病组和对照组如果不按细胞类型拆开看,很容易把composition、marker强弱、样本结构和疾病表达混在一起。更具体的问题是:公开counts和covariates能否复核主要细胞类型;AD与control之间的构成差异能说到什么程度;snRNA数据的解释边界在哪里。

本文从GSE138852公开数据出发,围绕major brain cell types做复现。文章不重新解释阿尔茨海默机制,先建立一条可审计证据链:数据层级、UMAP、cell type marker、AD/control composition、signature score、pooled-library热图、cluster交叉和边界说明。对学生和新科研人员来说,这比直接读疾病差异基因更重要。

论文和数据来源

项目信息
论文Single-cell transcriptomic analysis of Alzheimer’s disease
期刊Nature, 2019
DOIhttps://doi.org/10.1038/s41586-019-1195-2
PubMedhttps://pubmed.ncbi.nlm.nih.gov/31042697/
数据https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE138852
本文输入公开counts矩阵和covariates
复现对象数值
nuclei13214
基因10849
sample hint6
分组AD、ct
主要标签oligo、astro、OPC、neuron、mg、endo、unID、doublet

本文使用的是snRNA-seq公开数据。snRNA能降低完整细胞解离偏差,适合脑组织,但核转录组与全细胞RNA并不完全等同。文章中所有表达解释都保留这个前提。

数据规模:snRNA复现先确认细胞核和metadata

GSE138852 data scale and QC summary

图1展示本次复现的矩阵规模和公开标签结构。13214个nuclei、10849个基因和6个sample hint足以做主要细胞类型审计,也能描述AD和ct在本次子集中的composition。6个sample hint分别是AD1_AD2、AD3_AD4、AD5_AD6、Ct1_Ct2、Ct3_Ct4、Ct5_Ct6,代表成对pooled library,不能当作6个独立donor。当前公开字段无法把每个细胞核可靠拆回12位个体,因此本文不做donor-level疾病推断。

这一步看似基础,却决定后文写法。脑疾病数据里,细胞类型构成和疾病标签往往纠缠在一起。如果不先确认metadata、样本提示和主要标签,就很容易把“某类细胞比例不同”写成“疾病改变该细胞类型”。本文后面的构成图都会保留这个边界。

疾病分组UMAP:AD和control不是唯一阅读层

UMAP colored by AD and control condition

图2按AD和ct着色。分组在UMAP中有一定结构,但这张图不能单独说明疾病程序。脑组织的主要变化常常被细胞类型主导:oligo、astro、OPC、neuron和microglia之间的表达差异远大于同一细胞类型内部的疾病差异。

因此,疾病图必须和cell type图一起读。若直接在全体细胞上比较AD与control,结果可能主要反映细胞类型比例差异。复现文章要先把“有哪些细胞类型”解释清楚,再讨论分组。

主要细胞类型:oligo占主体,边界标签也要保留

UMAP colored by major brain cell type

图3按cell_type着色。主要标签包括oligo 7432个、astro 2171个、OPC 1078个、unID 925个、neuron 656个、mg 449个、doublet 405个和endo 98个。oligo占主体,这是本次子集解释中必须反复记住的背景。

unID和doublet不应被隐藏。公开数据复现如果只展示“漂亮标签”,会让读者误以为所有细胞核都有同等置信度。保留边界标签能提醒后续分析:一部分细胞不适合参与精细结论,一部分可能需要额外QC或回到原文注释层级。

signature面板:脑细胞身份要用成组marker确认

Feature panels for brain cell-type signatures

图4展示Neuron_synaptic、Astrocyte、Oligodendrocyte、OPC、Microglia、Endothelial和AD_inflammatory等模块。神经元模块使用RBFOX3、SNAP25、SYT1、SLC17A7、GAD1、GAD2;星形胶质使用AQP4、GFAP、ALDH1L1、SLC1A3、SLC1A2;少突胶质使用MBP、PLP1、MOG、MOBP;小胶质使用P2RY12、CX3CR1、AIF1、C1QA、TYROBP。

这张图帮助读者把细胞类型标签和marker证据对应起来。脑数据的marker不是每个细胞都高表达,尤其是snRNA层面,部分胞质转录本和低表达marker会更稀疏。成组marker比单基因更适合做公共复现的证据。

marker dotplot:身份、表达比例和稀疏性放在同一张图里

Marker dotplot for major brain cell types

图5显示marker在各细胞类型中的平均表达和检测比例。oligo中MBP、PLP1、MOG、MOBP较强;astro中AQP4、GFAP、ALDH1L1、SLC1A3可读;OPC中PDGFRA、CSPG4、VCAN提供支持;neuron中RBFOX3、SNAP25、SYT1等提供神经元证据;mg中P2RY12、CX3CR1、AIF1、C1QA、TYROBP支持小胶质身份。

这张图也是解释snRNA边界的入口。某些marker检测比例不高,并不一定说明标签错误;可能是核转录组、表达稀疏或样本处理带来的影响。文章应描述marker panel整体是否支持身份,而不是用一个未检出的基因否定整类细胞。

AD和control构成:比例差异要回到细胞类型

Cell-type composition by AD and control condition

图6显示本次子集中AD组oligo约69.76%、astro约7.07%、OPC约2.68%、neuron约3.73%、mg约2.58%;ct组oligo约42.46%、astro约25.97%、OPC约13.74%、neuron约6.22%、mg约4.23%。这种差异很明显,但写法必须严谨。

可以写的是:在本次复现矩阵和标签框架下,AD与ct的细胞类型构成不同,oligo比例在AD组更高,astro和OPC在ct组更高。不能直接写的是:AD导致oligo扩增或astro减少。要讨论疾病导致的细胞比例变化,需要donor层统计、样本匹配、病理分层和批次控制。

disease signature:炎症相关模块不能脱离细胞类型解释

Signature scores by AD and control condition

图7比较不同条件下的signature score。AD_inflammatory模块包含APOE、CLU、CST3、C1QA、TYROBP、HLA-DRA等基因,这些基因在脑疾病背景中常被关注,但它们跨细胞类型和样本的解释必须谨慎。

这类score图容易被误读为“疾病强度”。更稳的读法是:score提示某些炎症/胶质相关表达模块在公开矩阵中可检测,但后续解释要按细胞类型、样本和病理信息拆开。如果不控制细胞类型构成,score差异可能反映的是某类细胞比例变化,而不是同类细胞内部表达改变。

pooled-library热图:不能当作donor层重复

Sample-level signature median heatmap

图8把signature中位数放到sample hint层面。AD1_AD2、AD3_AD4、AD5_AD6和Ct1_Ct2、Ct3_Ct4、Ct5_Ct6之间存在模块差异,尤其是Oligodendrocyte和AD_inflammatory相关信号。每一列对应一个成对pooled library,不代表单个donor,也不能提供6个独立生物学重复。

如果一个表达模块只在少数pooled library中偏高,文章应写出这种异质性,不能只给总体均值。snRNA-seq还需要考虑核质量、死后时间、病理分层和批次。要建立疾病组统计结论,需要恢复单个donor身份,并在donor×cell type层面汇总或建模。

cluster交叉:细胞类型标签和矩阵分群互相核对

Cluster and cell type crosswalk

图9显示matrix cluster和cell_type的交叉。C1、C6、C8、C9以oligo为主;C3和C7以astro为主;C0以OPC为主;C2以mg为主;C5以neuron为主;C4混有unID、doublet、neuron和endo等标签。这样的交叉支持主要标签,但也保留了混合区域。

复现文章需要这种交叉检查。若cluster与标签一致,说明身份解释更稳;若某个cluster高度混合,就不适合被写成清晰亚群。对脑疾病数据来说,混合和低置信度区域往往比“漂亮分群”更能提示后续需要补的QC和注释工作。

复现边界:snRNA能支持哪些解释

Analysis scope and interpretation boundary

图10总结本文边界。可以支持的层面包括:公开counts和covariates可用于主要细胞类型复核;AD与ct在本次子集中有细胞类型构成差异;marker panel能支撑主要标签;pooled-library热图提示不同组合库之间存在差异。需要谨慎的层面包括donor层疾病效应、细胞比例因果、性别或病理分层结论、细胞通讯和空间结构。

这个边界不削弱文章,反而让结果更可用。脑疾病单细胞复现的难点,正是在“细胞类型差异”和“疾病表达差异”之间建立清楚分界。公开文章要让读者知道每张图承担什么证据,不能让composition替代机制。

与原文对照:原文关注细胞类型特异变化,复现先守住身份层

Mathys et al.原文讨论AD中不同脑细胞类型的转录组变化。本文复现暂不进入完整差异模型,先复核细胞类型、marker、AD/control构成和snRNA边界。这个顺序更适合公开复现文章:没有稳定细胞身份,就没有可靠的细胞类型特异疾病解释。

读者如果有类似脑组织snRNA数据,也应先完成这一步。先检查主要细胞类型是否可读,边界标签是否保留,AD/control或其他分组是否被细胞类型构成影响,再决定是否做差异表达、通路、细胞状态或病理分层分析。

深度解读:这篇复现应该怎么读?

它能回答的问题

本文能回答GSE138852公开数据是否支持主要脑细胞类型复核,能描述AD和ct在本次子集中细胞类型构成如何不同,也能检查marker panel是否支撑oligo、astro、OPC、neuron、mg和endo等标签。它还能提示pooled-library差异和snRNA解释边界;无法回答独立donor层面的疾病效应。

raw/processed matrix的边界

本文使用公开counts和covariates,不是FASTQ重新比对,也没有重建原文全部统计模型。snRNA-seq来自细胞核,和全细胞scRNA在捕获转录本类别、胞质RNA、低表达基因检测上都有差异。表达未检出不能被简单写成基因不存在。

关键图怎么读

图3确认主要细胞类型,图5给出marker证据,图6显示AD/control构成,图8显示样本层差异,图10给出边界。若只看图6,很容易把composition写成疾病机制;若只看图5,又可能忽略分组和样本。脑疾病数据必须把这几层一起读。

哪些地方不能过度解释

不要把AD组oligo比例更高直接写成病因机制,不要把astro或OPC比例差异写成细胞损失,不要把AD_inflammatory score直接写成炎症程度,也不要从snRNA表达层推出空间接触或细胞互作。更强解释需要donor层模型、病理分级、细胞类型内部差异和额外验证。

后续可以怎么深入

可以按cell type分别比较AD和ct的表达模块,例如在microglia或astro内部分析APOE、C1QA、TYROBP、HLA-DRA等炎症相关信号。也可以对oligo和OPC做子集分析,检查样本层差异是否仍然存在。若目标是发表级解释,donor-level统计和批次/病理因素必须纳入。

snRNA-seq和普通scRNA-seq的解释差别

脑组织数据大量使用snRNA-seq,是因为成年脑细胞完整解离难度高,细胞核更容易获得。但这个技术选择也改变了表达解释方式。核RNA更偏向未剪接或核内保留转录本,胞质富集基因的检测可能更弱,低表达marker更容易表现为表达未检出。复现文章如果忽略这一点,就会用全细胞scRNA的直觉误读snRNA图。

在本文中,marker panel因此比单基因判断更重要。oligo身份要看MBP、PLP1、MOG、MOBP这一组,不只看MBP一个基因;astro要把AQP4、ALDH1L1、SLC1A3和SLC1A2一起看,不只看GFAP;microglia也要把P2RY12、CX3CR1、AIF1、C1QA、TYROBP放在同一个证据框架里。某个marker检测比例低,并不自动推翻细胞身份。

这个边界对AD数据尤其关键。AD_inflammatory模块中APOE、CLU、CST3、C1QA、TYROBP、HLA-DRA等基因可能与胶质反应相关,但在snRNA层面,它们受到细胞类型构成、核捕获、样本质量和病理分层影响。本文把它们写成表达线索,而不是疾病机制终点。

donor和细胞类型哪个更该优先?

这不是二选一问题。细胞类型决定了表达差异的主要背景,donor决定了疾病和样本层解释的可靠性。若全体细胞直接做AD vs control,很可能得到细胞类型构成驱动的结果;若只看donor总表达,又会把oligo、astro、OPC、neuron和microglia混在一起。复现时需要先确认细胞类型,再把疾病差异拆回donor。

本文的composition图显示AD和ct在细胞类型比例上差异明显。这是当前子集的描述结果,也提醒后续差异表达不能在全体细胞上简单比较,应按cell type或至少按major lineage分层。pooled-library热图用于判断某个signature是否在多个组合库中方向相近,仍不能替代donor层重复。

对准备做AD公共数据再分析的人来说,这一步很实用。很多公开对象已经有注释,但缺少“细胞类型-样本”二维审计。补上这一层后,才适合继续做差异表达、通路、细胞状态或病理分层。

unID和doublet为什么要写出来?

公开文章常常不喜欢展示unID和doublet,因为它们让图显得不够整齐。但这两类标签正是复现质量的一部分。unID提示有些细胞核没有足够清晰的身份,doublet提示潜在混合信号。把它们从图里删掉,读者会误以为所有点都能被稳定解释。

Mathys这类脑疾病数据里,低置信度区域还会影响疾病解释。若某个疾病组中unID或doublet比例偏高,后续差异分析就可能受到影响。本文没有把这些标签写成主要生物学发现,但把它们保留在UMAP、composition和cluster crosswalk里,方便读者判断解释边界。

继续深入时,哪些分析最有价值?

第一条线是按细胞类型做AD vs control比较。可以在astro、microglia、oligo或OPC内部计算疾病相关模块,而不是在全体细胞中求平均。这样能减少composition差异对结果的影响。

第二条线是donor-level伪bulk。把同一donor、同一细胞类型的表达汇总,再做组间比较,可以更接近统计意义上的样本层分析。snRNA数据中每个nucleus不是独立患者,不能把细胞数误当成样本数。

第三条线是病理和性别分层。Mathys原文对细胞类型特异差异有更完整讨论,若复现目标进入疾病机制,就需要把原文的病理层级和样本变量纳入,而不是只靠公开counts矩阵中的AD/ct标签。

如何避免把细胞数量当成样本数量?

单细胞和单核数据的一个常见误区,是把细胞数当作统计重复。本文有13214个nuclei,但公开标签只有6个成对pooled-library hint,不是6个独立donor。若直接把每个nucleus当作独立样本做AD和ct比较,结果会显得很稳定,却可能只是细胞数量放大了显著性。疾病结论必须先恢复donor身份,再回到donor层。

这也是本文反复强调pooled-library heatmap和composition的原因。这些图用于提醒读者:细胞类型比例、marker score和疾病分组都受库组成影响。若一个signature只在某个sample hint中高,写作时应标为组合库线索,不能泛化到所有AD donor。

对后续分析来说,更稳的方法是恢复单个donor映射后做伪bulk,把同一donor、同一cell type的细胞核表达汇总,再做组间比较。这样会减少细胞数膨胀带来的假稳定,也能让统计单位回到生物学重复。当前子集缺少可用的单细胞核到donor映射,因此这一步尚未完成。

脑疾病复现的图表顺序为什么要慢?

脑数据里,主要细胞类型之间差异太大。如果文章一开始就展示AD_inflammatory score,读者很难判断这个score来自microglia、astro、oligo比例,还是来自同类细胞内部表达变化。因此本文先放cell type UMAP和marker dotplot,再放AD/control composition,随后才讨论signature score。

这种顺序关系到证据链。身份不清,疾病解释就不清;样本层不清,组间比较就不清;snRNA边界不清,marker未检出就容易被误读。每一步慢一点,收束时能写出的结论反而更稳。

如果用这篇数据训练学生,最该练什么?

第一项训练是区分cell type effect和disease effect。让学生先在全体细胞上看AD/ct,再按cell type拆开,就能直观看到composition对疾病解释的影响。第二项训练是marker panel审计,比较单个marker和成组marker在snRNA中的稳定性。第三项训练是边界写作,把“观察到构成差异”和“证明疾病机制”分开。

这些训练比单纯跑差异基因更重要。许多疾病单细胞文章的问题不在于代码没跑通,而在于统计单位和解释层级混乱。Mathys数据的经典价值,也正在于它能把这些问题集中呈现出来。

结论审计

判断当前证据写作边界
主要脑细胞类型可复核UMAP、dotplot和cluster交叉支持可写成细胞类型身份证据
AD与ct构成不同composition图支持只能写成当前子集构成差异
AD炎症相关表达线索signature score提供线索需要按细胞类型和样本拆分
疾病因果和病理机制本文未做完整donor模型不能由本文直接推出

小结

Mathys AD snRNA-seq复现的重点,是把疾病问题压回细胞类型和统计单位。GSE138852公开数据能支持主要脑细胞类型复核,也能显示AD和control在本次子集中的composition差异;marker panel为oligo、astro、OPC、neuron和microglia提供证据;pooled-library热图只能提示组合库差异。snRNA不是全细胞RNA,composition不能替代机制,疾病差异需要恢复donor映射后按细胞类型和donor模型继续拆解。


分享这篇文章:
通过邮件分享

上一篇
复现Vieira Braga et al.人肺公开子集:从GSE130148到细胞类型复核和受控数据边界
下一篇
复现van Galen et al. AML单细胞数据:从GSE116256到白血病层级、正常造血和免疫背景