Haber et al. 的小肠上皮单细胞数据是理解上皮干细胞、 transit-amplifying 细胞、吸收型 enterocyte 和多种分泌谱系的经典公开案例。这篇复现从 GEO 的 UMI count matrix 出发,整理 7216 个小鼠小肠上皮细胞,重点检查原始细胞类型注释、样本来源、marker 证据、干细胞-增殖轴和分泌谱系信号。
为什么选这篇小肠上皮单细胞论文?
Haber et al. 2017 年发表于 Nature 的文章 A single-cell survey of the small intestinal epithelium,是小肠上皮单细胞图谱中非常常用的一篇。它的优势不是“细胞数特别大”;细胞类型层级清楚:从 Stem 到 TA,再到成熟吸收型 enterocyte,以及 Goblet、Paneth、Tuft、Endocrine 等分泌谱系,几乎覆盖了小肠上皮复现里最常见的解释框架。
这类数据很适合做公开复现,因为它能同时回答几个问题:
- 公开 GEO 矩阵能不能重新整理成结构清楚的单细胞对象?
- 原始细胞类型注释是否能被经典 marker 支持?
- 干细胞、增殖过渡细胞、成熟 enterocyte 和分泌细胞是否在 UMAP 上形成可解释的连续结构?
- 哪些结论可以由 processed matrix 支持,哪些属于原文更深层的实验设计和机制分析,不能被简单外推?
如果只放一张 UMAP,这组数据会被讲得很薄。更有用的复现,应该把“细胞身份是否可靠”“谱系顺序是否合理”“低丰度细胞是否能被 marker 支撑”“与源论文相比复现到了哪一层”都写清楚。
论文和数据来源
- 论文:Haber et al. Nature, 2017
- 论文题名:A single-cell survey of the small intestinal epithelium
- DOI:10.1038/nature24489
- 公开数据:GSE92332
- 公开矩阵:GSE92332_atlas_UMIcounts.txt.gz
复现边界说明 本文使用 GEO 提供的 processed UMI count matrix,复现公开矩阵层面的细胞图谱、原始注释、marker 和 signature。本文不声称从 FASTQ 重新比对,也不完整重做源论文中全部实验处理、空间区域、感染或扰动相关分析。
数据结构:细胞类型就藏在列名里
GSE92332_atlas_UMIcounts.txt.gz 的结构相对直接:第一行是 7216 个细胞名,后续每一行是一个基因及其在所有细胞中的 UMI counts。细胞名本身包含三段信息:样本编号、barcode 和原始细胞类型。例如 B1_AAACGCACAGCCTA_Goblet 可以解析出样本 B1、细胞 barcode 和细胞类型 Goblet。
这类数据比某些旧 GEO 文件友好,但也有一个容易忽略的点:第一行没有额外的 gene 列标题。读取时需要先单独取出细胞名,再从第二行开始把第一列作为 gene symbol。否则列数会错位,后续 AnnData 对象就会出现隐藏错误。
- QC 后细胞数:7,216
- 过滤后基因数:15,252
- 样本编号:10
- 原始细胞类型:15
- Leiden clusters:14
- Stem 细胞:1,267
分析流程
- 下载 GEO processed UMI count matrix,并保留原始压缩文件。
- 解析细胞名中的 sample、barcode 和 cell type,构建细胞 metadata。
- 读取 gene × cell 计数矩阵,转成 cell × gene 单细胞对象。
- 计算每个细胞的 UMI、检测基因数和线粒体比例,过滤低检出基因。
- 进行归一化、log 转换、高变基因选择、PCA、邻接图、UMAP 和 Leiden 聚类。
- 保留原始细胞类型注释,并用经典 marker dotplot 检查标签可靠性。
- 计算 stem、TA proliferation、enterocyte、goblet、paneth、tuft、enteroendocrine 和 分泌谱系 signature。
这个流程的重点是“从公开矩阵恢复可解释图谱”。对于已有细胞类型标签的数据,复现时不应只把标签画出来就结束,而要把标签、marker 和结构三者交叉核对。
总体 UMAP:小肠上皮谱系能否重新铺开?

图 1 7216 个小肠上皮细胞按原始细胞类型标记的 UMAP。Stem、TA、enterocyte progenitor、成熟 enterocyte、Goblet、Paneth、Tuft 和 Endocrine 等群体形成了可解释的结构。
这张图先说明公开矩阵可用:细胞类型不是随机散在;它呈现出上皮谱系的层次。Stem 和 TA 相关细胞位于增殖和过渡区域,enterocyte progenitor 与成熟 enterocyte 呈现连续分布,Goblet、Paneth、Tuft、Endocrine 等分泌谱系形成相对独立或局部富集区域。
这里不要把 UMAP 当成严格发育轨迹。它提供的是转录相似性和局部邻近关系,不等于精确时间轴。更稳妥的表述是:UMAP 支持小肠上皮细胞在公开矩阵中保留了从干细胞/增殖细胞到成熟和分泌谱系的主要结构。
样本来源:复现图谱前要先看 batch/sample

图 2 按样本编号标记的 UMAP。这个图用于检查样本来源是否主导降维结构,并提醒后续解释不能脱离样本和实验来源。
公共单细胞复现经常会忽略样本层面的检查。对于小肠上皮这类数据,细胞类型、肠段区域、实验条件和样本处理都可能影响结构。如果某些样本集中在某个细胞类型区域,后续解释就需要更谨慎:它可能是真实生物学差异,也可能和采样、处理或条件有关。
本文的重点是复现公开 atlas matrix 的主体图谱,因此没有把每个样本背后的全部实验条件重新展开。保守做法是保留 sample metadata,把它作为解释背景,而不是把所有结构都直接写成普遍的小肠上皮规律。
细胞类型组成:Stem 和 enterocyte 轴是主体,分泌细胞是关键少数

图 3 QC 后不同细胞类型的数量。Stem、Enterocyte progenitor、TA 和成熟/未成熟 enterocyte 构成主体;Goblet、Paneth、Tuft、Endocrine 等分泌谱系细胞数较少但生物学辨识度高。
| 细胞类型 | 细胞数 | 占比 | 复现解读 |
|---|---|---|---|
| Stem | 1267 | 17.56% | 干细胞/隐窝相关主体 |
| Enterocyte Progenitor Early | 829 | 11.49% | 吸收型上皮早期前体 |
| TA Early | 665 | 9.22% | transit-amplifying 早期增殖状态 |
| Enterocyte Mature Proximal | 581 | 8.05% | 近端成熟吸收型 enterocyte |
| Enterocyte Immature Distal | 512 | 7.10% | 远端未成熟 enterocyte |
| Goblet | 510 | 7.07% | 黏液分泌细胞 |
| TA G2 | 410 | 5.68% | G2/M 倾向的增殖过渡细胞 |
| TA G1 | 408 | 5.65% | G1 倾向的增殖过渡细胞 |
| Enterocyte Progenitor Late | 404 | 5.60% | 较晚期 enterocyte 前体 |
| Enterocyte Progenitor | 356 | 4.93% | enterocyte 前体中间状态 |
| Endocrine | 310 | 4.30% | 肠内分泌细胞 |
| Enterocyte Immature Proximal | 297 | 4.12% | 近端未成熟 enterocyte |
| Paneth | 260 | 3.60% | Paneth 细胞 |
| Enterocyte Mature Distal | 241 | 3.34% | 远端成熟 enterocyte |
| Tuft | 166 | 2.30% | Tuft 细胞,低丰度但 marker 特征鲜明 |
这张组成图提醒我们:低丰度细胞并不等于不重要。Tuft、Endocrine、Paneth 等群体细胞数少,但正是这些细胞决定了小肠上皮图谱的生物学层次。复现时要避免两种错误:一是只讲数量最多的 Stem/TA/Enterocyte,忽略分泌谱系;二是对低丰度群体做过度细分,超出公开矩阵能支持的范围。

图 4 不同样本中的细胞类型比例。样本层面的组成差异是解释 atlas 类数据时必须保留的背景。
这张图回答的是来源和比例问题。它适合用来发现样本不平衡、分组偏移或需要子集分析的地方;更强的生物学解释还要结合原文设计和额外证据。
marker 复核:细胞类型标签是否站得住?

图 5 小肠上皮经典 marker dotplot。Lgr5/Ascl2/Olfm4 支持 Stem,Mki67/Top2a 支持增殖 TA,Alpi/Apoa1/Apoa4/Fabp1 支持 enterocyte,Muc2/Tff3 支持 Goblet,Lyz1/Defa24 支持 Paneth,Dclk1/Trpm5 支持 Tuft,Chga/Neurod1 支持 Endocrine。
这张 dotplot 是本篇复现最重要的质量控制图之一。原始列名已经给了细胞类型标签,但标签本身不能替代证据。对于小肠上皮数据,marker 证据链可以按谱系理解:
Stem 相关细胞应当有 Lgr5、Ascl2、Olfm4、Smoc2 等隐窝干细胞相关信号。TA 细胞应当带有 Mki67、Top2a、Pcna、Stmn1 等增殖相关信号。成熟吸收型 enterocyte 应当有 Alpi、Apoa1、Apoa4、Fabp1 等吸收和代谢相关基因。Goblet 细胞应当有 Muc2、Tff3、Agr2、Spdef。Paneth 细胞应当有 Lyz1、Defa24、Mmp7、Reg3g。Tuft 细胞则需要 Dclk1、Trpm5、Pou2f3、Gfi1b 等 marker 支持。Endocrine 细胞可以从 Chga、Chgb、Neurod1、Pax6 等基因观察。
从复现角度看,这些 marker 的方向整体符合预期,说明公开细胞类型标签可以作为后续解释基础。不过仍要注意:marker dotplot 是表达证据,不是谱系命运证明。要讨论的分化方向,还需要 pseudotime、RNA velocity、谱系追踪或原文实验设计支持。
Stem signature:隐窝干细胞相关信号

图 6 基于 Lgr5/Ascl2/Olfm4/Smoc2 的 Stem signature。高分区域集中在 Stem 相关区域,支持原始干细胞注释。
Stem signature 的作用是把多个 marker 压缩成一个整体信号。相比单独看 Lgr5,signature 更能减少单基因表达未检出、检测不稳定和表达噪音带来的误判。图 6 的高分区域与 Stem 注释相互支持,说明这批公开矩阵仍保留了小肠隐窝干细胞群体的主要转录特征。
但这里也要克制:Stem signature 高并不等于这些细胞一定具有体内干细胞功能。它只能说明这些细胞在转录层面接近 Lgr5/Ascl2/Olfm4 标记的 stem-like 状态。功能层面的干细胞能力,需要结合原文实验、培养或谱系追踪证据。
TA proliferation:增殖过渡细胞是否清楚?

图 7 基于 Mki67/Top2a/Pcna/Stmn1 的 TA proliferation signature。高分区域对应 TA 和 enterocyte progenitor 相关区域,符合 transit-amplifying 细胞的增殖属性。
小肠上皮图谱里,TA 细胞是连接 Stem 和成熟谱系的关键中间层。复现时如果 TA 区域和增殖 marker 对不上,就要怀疑读取、归一化、注释或 UMAP 结构是否有问题。本次复现中,TA proliferation score 在 TA 相关区域较高,与 TA Early、TA G1、TA G2 和部分 enterocyte progenitor 的标签相互吻合。
需要强调的是,G1/G2 标签来自原始细胞名和表达结构。本文没有单独重建完整 cell-cycle phase 分类,因此不把它写成新的细胞周期发现;并作为原始注释和增殖 signature 的互相验证。
分泌谱系:Goblet、Paneth、Tuft、Endocrine 的共同线索

图 8 基于 Muc2/Tff3/Lyz1/Dclk1/Chga/Neurod1 的 分泌谱系 signature。该分数用于概览 Goblet、Paneth、Tuft 和 Endocrine 等分泌相关谱系的分布。
小肠上皮复现里,分泌谱系经常被一句话带过,但它们是这组数据最值得看的部分之一。Goblet 细胞负责黏液屏障,Paneth 细胞与抗菌肽和隐窝微环境有关,Tuft 细胞与化学感受和 2 型免疫相关,Endocrine 细胞则承担激素和神经内分泌相关功能。
分泌谱系 signature 不是把所有分泌细胞强行合并成一个“新类群”;它帮助读者在 UMAP 上快速看到这些低丰度但功能重要的细胞大致分布。解释某个分泌谱系时,仍要回到对应 marker:Goblet 看 Muc2/Tff3/Agr2,Paneth 看 Lyz1/Defa24/Mmp7,Tuft 看 Dclk1/Trpm5/Pou2f3,Endocrine 看 Chga/Chgb/Neurod1。
与源论文结论如何对照?
源论文系统性描绘了小肠上皮单细胞组成,并展示上皮细胞类型、区域性和特定实验背景下的响应。本文复现其中最适合公开矩阵重建的一层:从 processed UMI matrix 恢复主要细胞类型结构,并用 marker 和 signature 检查标签是否可信。
本文与源论文方向一致的地方包括:
- 小肠上皮细胞可以分解为 Stem、TA、enterocyte 及多种分泌谱系。
- Stem/TA/enterocyte 轴在表达空间中形成可解释的层级结构。
- Goblet、Paneth、Tuft、Endocrine 等低丰度群体可以通过经典 marker 识别。
- 公开矩阵足以支持 atlas 层面的复现、注释检查和基础谱系解释。
本文没有覆盖或没有声称完成的部分包括:
- 没有从原始 FASTQ 重新比对和 UMI 定量。
- 没有完整重做源论文中的全部处理条件、感染/扰动模型或区域性分析。
- 没有把 UMAP 直接解释为严格分化轨迹。
- 没有对每个分泌细胞群继续做更深的亚群拆分。
- 没有把 signature score 扩展为功能实验证据。
这种边界需要先确认。一个复现文章应该清楚说明“这一步能证明什么”,也要说明“这一步不能证明什么”。否则,公开数据复现很容易变成好看的图,而不是可靠的研究证据。
复现这类上皮 atlas 时容易出错的地方
第一,读取矩阵时要确认 header 和 gene 列是否错位。Haber 这个文件第一行是细胞名,第二行开始才是基因表达,如果直接按普通带表头矩阵读取,很容易产生列数错配。
第二,不要把原始注释当作无需验证的真相。即使列名里已经有 cell type,也要用 marker dotplot 做复核。公开数据的价值来自可核查,而不是直接引用标签。
第三,不要把 UMAP 当作发育时间轴。Stem、TA、enterocyte progenitor 和 mature enterocyte 的连续结构很有解释价值,但严格的分化方向需要更多方法支持。
第四,低丰度分泌细胞要既重视又克制。Tuft、Endocrine、Paneth 数量不多,但 marker 特异性强;可以展示和解释,不适合在没有额外证据时过度拆分。
第五,atlas 复现和机制复现不能混为一谈。本文完成的是公开矩阵层面的图谱复现,源论文中更深的扰动、区域和机制问题,需要单独设计复现目标。
主要结论 GSE92332 可以稳定复现小肠上皮主要细胞图谱:Stem 和 TA 细胞构成增殖/过渡轴,enterocyte 形成吸收型上皮主体,Goblet、Paneth、Tuft 和 Endocrine 等分泌谱系可以由经典 marker 支持。更有用的复现不只画 UMAP;关键在于把文件结构、注释来源、marker 证据、signature 解释和源论文边界一起讲清楚。
这篇复现能作为哪些项目的模板?
- 上皮 atlas 复现:从公开矩阵恢复组织上皮主要谱系结构。
- 旧 GEO 矩阵整理:处理非 10X 三件套格式,把列名 metadata 解析成可分析对象。
- marker 证据链:用 DotPlot 检查 Stem、TA、Enterocyte 和分泌谱系标签。
- 谱系 signature:把单基因 marker 转为更稳健的多基因 score。
- 低丰度细胞解释:对 Tuft、Endocrine、Paneth 等群体保持重视和边界。
- 报告结果图整理:将 UMAP、组成图、marker 和 signature 图统一成可汇报材料。
后续可以继续加深的方向
| 增强方向 | 价值 |
|---|---|
| Stem/TA/Enterocyte 子集重分析 | 更细地检查吸收型上皮成熟过程 |
| 分泌谱系单独重聚类 | 深入 Goblet、Paneth、Tuft、Endocrine 内部差异 |
| 结合原文条件 metadata | 区分 atlas、处理、感染或区域相关结构 |
| 拟时序分析 | 在合适边界内探索 Stem 到成熟谱系的连续变化 |
| marker 与源论文结果图逐项对照 | 把复现结果和原文关键图逐项核查 |
| 面向汇报的结果图重绘 | 将图谱、组成、marker 和 score 统一成文章或课题申请可用风格 |
深度解读:这篇复现应该怎么读?
Haber 小肠上皮复现要按“上皮谱系结构”来读。本文不是把 UMAP 直接当发育轨迹;本文从 GSE92332_atlas_UMIcounts.txt.gz 解析出 7,216 个细胞的 sample、barcode 和原始 cell type,再用 marker dotplot 和 signature score 复核 Stem、TA、enterocyte、Goblet、Paneth、Tuft 和 Endocrine 等主要结构。
1. 这篇复现回答了什么?
它回答的是“公开 UMI count matrix 是否能恢复小肠上皮 atlas 的主要细胞类型和谱系层次”。从本文结果看,Stem/TA/enterocyte 轴清楚,Goblet、Paneth、Tuft、Endocrine 等分泌谱系虽然细胞数较少,但 marker 特征明确。Lgr5/Ascl2/Olfm4、Mki67/Top2a、Alpi/Apoa1/Apoa4/Fabp1、Muc2/Tff3、Lyz1/Defa24、Dclk1/Trpm5、Chga/Neurod1 等 marker 共同支持原始注释。
这个层级的复现有价值,因为小肠上皮不是简单的几个离散细胞类群;包含干细胞、增殖过渡、吸收型成熟和分泌谱系的层级结构。
2. raw / processed matrix 的边界在哪里?
本文使用的是 GEO processed UMI count matrix,不是 FASTQ 重新比对,也不是源论文全部处理条件和扰动实验的完整复现。它可以支持 atlas 层面的表达图谱、细胞类型标签、marker 和 signature score 复核;但不能单独支持完整分化轨迹、肠段空间生态位、感染/扰动响应或功能实验证明。
这个文件还有一个具体格式边界:细胞类型藏在列名里,第一行是细胞名,第二行开始才是基因表达。如果读取时把 header 或 gene 列处理错,后续所有结果都会错位。因此这篇复现的“矩阵解析”本身就是可信度的一部分。
3. 主要图应该怎么读?
图 1 先看 Stem、TA、enterocyte progenitor、成熟 enterocyte 和分泌谱系是否形成主结构;图 2 和图 4 看 sample/composition,避免把样本来源差异写成普遍规律;图 3 看各细胞类型数量,特别要注意 Tuft、Endocrine、Paneth 等低丰度但生物学重要的细胞;图 5 是 marker 证据;图 6-8 用 stem、TA proliferation 和 分泌谱系 signature 概括谱系方向。
读这组图时要区分“连续结构”和“严格轨迹”。Stem、TA、enterocyte progenitor 和 mature enterocyte 的排列很有解释价值,但 UMAP 只是转录相似性图,不是时间轴或谱系追踪结果。
4. 哪些地方不能过度解释?
第一,不能把 UMAP 直接写成严格分化轨迹。第二,不能把 Stem signature 写成功能性干细胞能力证明。第三,不能把 分泌谱系 signature 高分写成一个新细胞类型,它只是概览 Goblet、Paneth、Tuft、Endocrine 等分泌相关群体。第四,低丰度细胞需要重视,但不能在没有额外证据时继续深拆机制。第五,源论文里的处理、感染、区域性和扰动相关分析,不属于本文已经完成的复现范围。
本文能严肃支持的是:GSE92332 的 atlas matrix 可以复现小肠上皮主要细胞类型和表达层面的谱系结构。本文不能支持的是完整谱系命运、空间生态位、刺激响应机制或功能实验结论。
5. 如果继续深入,下一步做什么?
继续深入时,可以把 Stem/TA/Enterocyte 子集单独拿出来做拟时序,但必须明确它是表达连续性分析,不是谱系追踪。也可以对 Goblet、Paneth、Tuft、Endocrine 分泌谱系分别做子集复核,检查 marker panel 是否稳定。若要复现源论文更深内容,应补充原文条件 metadata,区分 atlas、处理、感染或区域相关结构。
这篇文章对上皮 atlas 复现的启发是:图谱、marker、signature 和边界要一起讲。只有这样,Stem-TA-Enterocyte 轴和分泌谱系才不会被写成一条未经验证的机制故事。
小结
这次复现从 GEO GSE92332 的 GSE92332_atlas_UMIcounts.txt.gz 出发,整理 7216 个小鼠小肠上皮细胞,复现了 Stem、TA、enterocyte progenitor、成熟 enterocyte、Goblet、Paneth、Tuft 和 Endocrine 等主要细胞类型。marker dotplot 和多基因 signature 支持原始注释的主体可靠性,也提示解释时必须注意样本来源、低丰度细胞和公开矩阵边界。