这篇长文复现 Tasic et al. 小鼠视觉皮层单细胞分类数据。与疾病数据不同,这组数据的重点是用公开表达矩阵和作者聚类注释重新观察 adult mouse visual cortex 中的兴奋性神经元、抑制性神经元和非神经元细胞。本文从 GSE71585 的 RefSeq counts 与 Clustering Results 出发,复现 1,749 个作者 QC 通过细胞的 UMAP、broad type、primary type、marker、signature score 和聚类对照。
为什么选 Tasic 视觉皮层数据?
Tasic et al. 是单细胞神经科学里非常经典的细胞类型分类数据。它不只是把细胞分成 neuron 和 glia;进一步把视觉皮层中的 glutamatergic neuron、GABA-ergic neuron、astrocyte、oligodendrocyte、OPC、microglia、endothelial cell 等大类拆开,并提供 primary type 与 Cre line / dissection 相关信息。
这类数据很适合作为“细胞类型图谱复现”案例。原因有三点。第一,公开文件结构清楚,表达矩阵和聚类结果可以严格对齐。第二,作者注释层次完整,既有 broad type,也有 primary type 和 secondary type。第三,canonical marker 很容易复查,适合展示图谱不只靠作者标签;它由表达证据支持。
这篇数据对应的真实研究痛点
神经系统 taxonomy 数据的痛点在于层级太多:broad type、primary type、secondary type、Cre line、dissection 和 cluster 都可能同时出现。如果只把作者标签重新上色,很难说明复现是否可靠;如果直接追求每个细亚型的机制解释,又容易超出公开矩阵和本次分析范围。读者需要的是一套可复查的层级注释逻辑。
本文把 Tasic 数据作为“层级注释审校”案例来读。先看 broad type 是否在 UMAP 上形成清楚结构,再看 primary type 和 marker dotplot 是否支持更细分类,结尾处用聚类和 dissection 对照检查标签是否存在明显错位。这个流程适合迁移到其他神经系统或复杂组织 atlas:先确认层级身份,再决定哪些亚型值得继续深挖。
论文和数据来源
- 论文:Tasic et al. Nature Neuroscience, 2016
- 论文题名:Adult mouse cortical cell taxonomy revealed by single cell transcriptomics
- DOI:10.1038/nn.4216
- PubMed:PMID 26727548
- 公开数据:NCBI GEO GSE71585
- 公开文件:RefSeq counts / TPM + Clustering Results
复现边界说明 本文使用 GEO 公开 RefSeq counts 与作者 Clustering Results 复现表达图谱,未从 FASTQ 重新比对,也不复刻原文所有 taxonomy 建模步骤。本文的目标是检查公开矩阵、作者注释、marker 和低维结构之间是否一致。
数据规模与注释层次
GSE71585 中共有 1,809 个细胞列,作者 clustering table 中 1,749 个细胞通过 QC。本次复现保留这些 pass_qc_checks = Y 的细胞。作者注释包含 8 个 broad type、50 个 primary type 和 35 个 secondary type。
- 作者 QC 通过细胞:1,749
- 原始基因:24,057
- 保留基因:19,430
- primary type:50
- secondary type:35
- Leiden cluster:15

图 1. 数据集概览。Glutamatergic neuron 和 GABA-ergic neuron 是主体,同时包含 astrocyte、oligodendrocyte、OPC、microglia、endothelial cell 和少量 unclassified 细胞。图中也展示了 primary type、mouse line 与 dissection 信息。
这张图先用于核对输入层级。细胞数、基因检测量、样本标签和矩阵层级如果没有对齐,后面的降维、marker 和组成分析都只能算可视化,不能作为复现结论。
质控:保留作者 QC 通过细胞后再统一分析

图 2. counts、detected genes 和 broad type 层面的检测基因分布。公开 counts 具有较高 read count 尺度,因此本文把它作为 processed count-like matrix 使用,重点做注释对照和 marker 复查。
Tasic 这组数据的一个优势是作者已经提供了 pass_qc_checks 字段。复现时直接尊重作者 QC,可以减少不必要的主观过滤。保留细胞后,本文再统一执行归一化、log transform、高变基因选择、PCA、邻接图、UMAP 和 Leiden 聚类。
分析流程
- 下载 GSE71585 RefSeq counts、TPM 和 Clustering Results。
- 按 sample title 对齐表达矩阵列名和作者注释表。
- 保留
pass_qc_checks = Y的 1,749 个细胞。 - 计算 counts、detected genes 和基因检测频率,过滤低检测基因。
- 基于 log-normalized 表达矩阵选择高变基因并执行 PCA、UMAP 和 Leiden 聚类。
- 用 broad type 和 primary type 对照低维结构。
- 用 canonical marker 与 signature score 检查兴奋性、抑制性和胶质/血管细胞注释。
- 用 Leiden crosswalk 与 primary type heatmap 检查无监督结构和作者注释之间的关系。
Broad type UMAP:兴奋性和抑制性神经元清楚分区

图 3. UMAP 按 broad type 着色。Glutamatergic neuron 与 GABA-ergic neuron 形成清楚分区,astrocyte、oligodendrocyte、OPC、microglia、endothelial cell 等非神经元小群也能分离。
低维图只能说明表达空间的相似性。群体分开、阶段相邻或标签聚集,可以支持后续检查 marker 和组成,但不能单独写成谱系方向、空间位置或机制强弱。
这张图说明作者 broad type 与表达结构高度一致。兴奋性和抑制性神经元分别占据主要区域,非神经元细胞虽然数量少,但在低维空间中形成清楚小群。对于细胞类型图谱复现来说,这是最基本的可信度检查。
Primary type:更细粒度分类的可视化

图 4. UMAP 按 primary type 着色。Primary type 数量较多,图例复杂,但它能展示作者 taxonomy 的层次化结构:同一 broad type 内部还有多个亚类。
Primary type 图不适合用来读每一个标签的细节,因为 50 个类型会让图例很密。它更适合说明层次:broad type 是大方向,primary type 是内部亚群,secondary type 则进一步细分。公开文章里需要避免把所有细小标签都写成强结论。
Marker UMAP:注释的表达证据

图 5. canonical marker 在 UMAP 上的表达。Slc17a7、Satb2、Tbr1 支持 glutamatergic neuron;Gad1、Gad2、Slc32a1 支持 GABA-ergic neuron;Aqp4/Gja1/Slc1a3 支持 astrocyte;Mog/Mbp/Plp1 支持 oligodendrocyte;Pdgfra/Cspg4/Vcan 支持 OPC;Cx3cr1/C1qa/Tyrobp 支持 microglia;Pecam1/Cldn5/Kdr 支持 endothelial cell。
Marker 图是复现中最重要的证据层。可以看到兴奋性、抑制性、胶质、免疫和血管相关 marker 的空间分布与 broad type UMAP 基本一致。少数非神经元群体细胞数较少,但 marker 信号仍然集中,说明公开注释不是单纯由标签表给出,而能在表达矩阵中被重新观察。
Dotplot 和 signature score

图 6. 按 broad type 汇总 marker 的平均表达和检测比例。Dotplot 用于把 UMAP 上的空间信号转成按注释类别汇总的证据。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

图 7. 多基因 signature score 在 UMAP 上的分布。它补充单 marker 的不稳定性,帮助确认各 broad type 的表达方向。
Dotplot 与 signature score 共同支持主要注释层级。神经元大类中 Slc17a7 与 Gad1/Gad2 分别区分兴奋性和抑制性方向;非神经元细胞中 Aqp4/Gja1、Mog/Mbp/Plp1、Pdgfra/Cspg4、Cx3cr1/C1qa 和 Pecam1/Cldn5 等组合对应清楚。
聚类、primary type 和 dissection 对照

图 8. Leiden cluster 与 broad type 的交叉表。多数 cluster 有明确 broad type 倾向,说明无监督结构和作者注释整体一致。
这里的结果适合作为复现证据链的一环。它能帮助判断公开矩阵是否支持当前解释,但不能替代原文全部上游处理、统计模型或验证实验。

图 9. 高频 primary type 与 broad type 的嵌套关系。这个图帮助理解作者 taxonomy 不是单层标签;broad type 内部的细分。
这一处要把结论强度收住。公开矩阵能支持表达结构、marker 和 metadata 层面的复核;机制、空间、功能或临床判断,需要 raw reads、原文模型或额外实验继续补证据。

图 10. 不同 dissection 中 broad type 的组成比例。Dissection 与 Cre line 是解释这类数据时必须保留的实验背景。
这张图回答的是来源和比例问题。它适合用来发现样本不平衡、分组偏移或需要子集分析的地方;更强的生物学解释还要结合原文设计和额外证据。
与源论文主线的对照
本次复现与源论文主线一致:成人小鼠皮层细胞可以在单细胞转录组层面分成兴奋性神经元、抑制性神经元和多个非神经元大类;作者 primary type 的层次结构在公开矩阵中可以重新观察;canonical marker 和 signature score 支持主要注释。
本文没有复刻原文完整 taxonomy 建模、所有亚型命名和细胞类型层级推断。本文更强调公开数据复现中最关键的部分:矩阵与注释对齐、作者 QC 使用、UMAP/marker 证据、层级标签解释和结论边界。
复现这类 taxonomy 数据容易出错的地方
- 只看 broad type:会忽略 primary/secondary type 的层级结构。
- 只看 primary type:又会被 50 个标签淹没,难以读出主结构。
- 忽略作者 QC:会把未通过检查的细胞混入图谱。
- 不查 marker:会把标签表误当成结果本身。
- 过度解释非神经元小群:需要注意这些群体细胞数较少。
- 忽略 Cre line/dissection:会丢掉实验设计背景。
深度解读:这篇复现应该怎么读?
Tasic 视觉皮层数据的阅读重点,是“taxonomy 层级能不能被公开矩阵和 marker 证据支撑”。它不是疾病处理数据,也不是发育轨迹数据。本文复核的是:GSE71585 的 RefSeq counts 与作者 Clustering Results 能否对齐,pass_qc_checks = Y 的 1,749 个细胞能否重建 broad type / primary type 层级,以及 canonical marker 是否支持这些分类。
1. 这篇复现回答了什么?
它回答的是“成人小鼠视觉皮层细胞分类体系是否能在公开表达矩阵中重新读出”。从本文结果看,glutamatergic neuron、GABA-ergic neuron、astrocyte、oligodendrocyte、OPC、microglia、endothelial cell 和少量 unclassified 细胞在 UMAP、dotplot 和 signature score 中都有相应证据。
这里还需要说明的是,本文没有只停留在 broad type。primary type 图、Leiden 与 broad type 的 crosswalk、primary type heatmap、dissection 组成图共同说明:Tasic 这组数据应该按“作者注释层级 + marker 证据 + 实验设计背景”来读,而不只看一个彩色 UMAP。
2. raw / processed matrix 的边界在哪里?
本文使用的是 GEO 公开 RefSeq counts 和作者聚类表,不是 FASTQ 重新比对,也不是完整复刻原文 taxonomy 建模。它可以支持表达层面的复核:按作者 QC 保留细胞、重做降维聚类、检查 broad type/primary type 与 marker 是否一致。
它不能支持的是:重新证明所有细胞类型命名、重建原文分类树的全部统计步骤、把 UMAP 距离解释成皮层空间距离,或把 primary/secondary type 之间的相邻关系解释成发育关系。这里的矩阵层级允许我们检查“标签是否有表达支撑”,但不等于重新发明一套视觉皮层 taxonomy。
3. 主要图应该怎么读?
图 1 和图 2 先确认数据规模、QC 和 broad type 的检测特征;图 3 看兴奋性/抑制性神经元与非神经元细胞是否形成清楚主结构;图 4 看 primary type 层级,但不要试图从一张图里读完 50 个标签;图 5-7 用 Slc17a7/Satb2/Tbr1、Gad1/Gad2/Slc32a1、Aqp4/Gja1/Slc1a3、Mog/Mbp/Plp1、Cx3cr1/C1qa/Tyrobp、Pecam1/Cldn5/Kdr 等 marker 复核身份;图 8-10 再看无监督聚类、primary type 和 dissection 背景。
这几类图要连起来看。Broad type 图告诉我们主干结构,primary type 图告诉我们分类层级,marker 图告诉我们标签是否站得住,dissection 图告诉我们实验背景。只看其中任何一张,都会让解释偏薄。
4. 哪些地方不能过度解释?
第一,不能把 Leiden cluster 当成作者 primary type。Leiden 是本文重新计算的无监督结构,primary type 是作者 taxonomy 标签,两者只能对照,不能互相替代。第二,不能把 50 个 primary type 都写成本文独立证明的新亚型。第三,不能把 UMAP 上相邻写成真实皮层空间相邻。第四,非神经元小群虽然 marker 支持明确,但细胞数较少,不适合在本文中继续展开过深功能叙事。
严肃的写法应该是:本文支持 Tasic 视觉皮层 broad type 与主要 primary type 层级能在公开矩阵中被重新观察,且主要 marker 与注释方向一致;本文没有重做原文全部 taxonomy 建模,也不把分类层级扩展成空间、发育或功能机制结论。
5. 如果继续深入,下一步做什么?
继续深入时,应该按 broad type 分开做子集复核。兴奋性和抑制性神经元可以分别对照原文 primary/secondary type 和 layer-related marker;astrocyte、oligodendrocyte、OPC、microglia 和 endothelial cell 可以单独检查低丰度群体是否仍有稳定 marker。还可以把 Cre line、dissection 和 primary type 做更系统的交叉表,判断某些标签是否受取样设计影响。
对类似神经系统 taxonomy 复现,最有价值的不是把 cluster 数调得更多;关键在于把层级关系讲清楚:大类是什么,内部亚型是什么,哪些 marker 支持它,哪些实验背景可能影响它。这样整理出来的结果才适合被用作公开文献复现或后续课题注释参照。
小结
Tasic et al. GSE71585 是一个非常适合做细胞类型 taxonomy 复现的经典神经系统数据。本次复现从 RefSeq counts 和作者 Clustering Results 出发,保留 1,749 个 QC 通过细胞,重建 UMAP、broad type、primary type、marker、signature score、Leiden crosswalk 和 dissection 组成。结果显示,兴奋性神经元、抑制性神经元和多个非神经元细胞类型都可以在公开矩阵中被重新读出。
对类似公开单细胞图谱,如果需要把文献中的分类体系重新整理成可解释结果图,关键是同时保留三层信息:作者注释层级、表达 marker 证据和实验设计背景。