跳到正文
bioinfo.zle.ee
返回

复现 Klein et al. inDrops ESC 分化数据:从 GSE65525 到多能性下降和早期分化状态

发布于: · 更新于:

Klein et al. 是早期 droplet barcoding 单细胞转录组方法中的经典文章。本文选择 ESC 去 LIF 后 d0、d2、d4、d7 的公开 count matrix,复现多能性下降和早期分化状态变化。

科学更正(2026-07-19) 早期页面曾把每个细胞最高的 5 个 program score 强制写成 marker_state,没有绝对阈值、top-two margin 和 unassigned。约 5.16% 细胞最高分不为正,约 23.19% top-two margin 不超过 0.05;这些硬状态随后被用于 day 组成图。相关离散状态比例已撤回。本文现只保留连续 program score。GEO 第一方设计显示,d0 的 GSM1599495/1599496 是同一个 sample 2 的两份技术重复,分析时先在技术库层汇总,再折叠到 d0_bio2GSM1599494 作为另一个 d0 生物样本。d2、d4、d7 各只有一个生物样本,因此不报告总体 day 效应或命运比例。

为什么复现这篇?

这组数据适合展示单细胞复现中“时间序列”比单张 UMAP 更重要的情况。d0 细胞占多数,d2/d4/d7 数量较少,解释时必须同时看样本规模、分化天数和 marker signature,不能只凭聚类标签写结论。

本文合并 6 个 ESC 输入矩阵,构建 8,669 个细胞的公开 count matrix。d0 包括 sample 1 以及带两份技术库的 sample 2;d2、d4、d7 各有一份矩阵。经过归一化和降维后,用 pluripotency、early differentiation、mesendoderm、neural ectoderm 和 cell cycle 的连续 score 描述状态变化,不再把最大值转成离散状态。

结果中 pluripotency、early differentiation、neural ectoderm、mesendoderm 和 cell-cycle program 在 UMAP 和样本层汇总中呈现差异。由于 d2/d4/d7 各只有一个样本,这些差异只适合写成该公开矩阵中的探索性时间趋势,而不是总体分化效应或完整发育命运图谱。

和源论文相比,本文没有重做全部 barcode 方法学评估,也没有做精细 trajectory/pseudotime 模型。这里的价值来自把早期 droplet scRNA-seq 公开矩阵重新整理成可读的图谱、marker 证据和中文解释。

这篇数据对应的真实研究痛点

发育/分化数据最怕被写成离散分类。Klein 这组 ESC 去 LIF 时间序列要回答的,不是某个 cluster 的名字;它需要多能性下降、早期分化、mesendoderm/neural ectoderm 倾向和 cell cycle 状态是否在时间轴上形成连续变化。d0 细胞占多数,d2/d4/d7 细胞较少,如果不先讲清楚样本规模和矩阵边界,后面的状态解释就容易失真。

本文的痛点处理是把时间点、输入样本、UMAP、留出 marker 和连续 signature 串起来读。它能支持“公开矩阵中可见 ESC 分化相关表达趋势”,但不能用细胞数代替样本数,也不能在后续时间点缺少重复时写成总体命运规律。

论文和公开数据

**复现边界:**本文使用 GEO RAW tar 中的 processed CSV count matrices,聚焦 ESC 分化时间序列,不纳入 K562 对照文件,也不声称完整复现原文所有方法学性能评估。

数据规模

公开数据复现先要回答“拿到的矩阵到底能支持什么”。这里的细胞数、基因数、样本分组和 marker 证据共同决定了文章能讲到什么程度。本文尽量把可复核的部分讲清楚,把不能过度解释的地方单独写出。

分析流程

数据入口:d0/d2/d4/d7 的样本规模是否平衡?

Klein 这组 ESC 分化数据必须先看时间点规模。d0 细胞远多于 d2、d4、d7,因此任何总体组成或 UMAP 占比都不能直接解释成“分化过程中某状态最多”。第一张图的任务是把细胞规模、QC 和时间点不平衡先暴露出来,让后面的 marker 和 signature 解读有前提。

d0/d2/d4/d7 细胞规模和 QC 概览。

图 1d0/d2/d4/d7 细胞规模和 QC 概览。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

图 1 说明这篇文章不能只看总体细胞比例。d0 主体规模更大,后期细胞数量相对少,因此读图时要把 day 信息和 signature 趋势结合起来,而不是把 UMAP 上最大的一片区域直接写成最重要的分化结论。

时间结构:分化天数是否进入低维空间?

确认规模后,再看 day 标签在 UMAP 上的分布。这里要问的是:去 LIF 后的 d0、d2、d4、d7 是否在表达空间中呈现时间相关结构。如果时间点完全混杂,后续解释就要非常保守;如果时间点沿某些区域有方向性分布,也只能继续检查连续 program 和样本一致性,不能直接生成离散命运标签。

按分化天数标记的 UMAP,观察时间结构和样本数量差异。

图 2按分化天数标记的 UMAP,观察时间结构和样本数量差异。

图 2 应该被读成时间结构检查,而不是最终轨迹模型。它能提示公开矩阵中保留了分化天数信息,但不能单独证明细胞命运转换。对于 ESC 去 LIF 数据,后续还必须看多能性 marker 是否下降、早期分化 marker 是否上升,以及这些信号是否和 day 分布一致。

无监督结构:cluster 是读图辅助,不是命运标签

Leiden 聚类用于检查表达空间结构。分化数据中的 cluster 可能截取连续状态的一段,不能直接当作互相独立的细胞类型。这里先看无监督结构,随后再结合 day、sample、连续 program 和留出 marker。

无监督 Leiden 结构,用于避免直接依赖时间标签。

图 3无监督 Leiden 结构,用于避免直接依赖时间标签。

图 3 的意义是提供中间坐标系。后面的 pluripotency、early differentiation、neural ectoderm、mesendoderm 和 cell cycle 都应该回到这个结构里解释。不能看到一个 cluster 就直接命名为某个固定命运,也不能忽略 cell cycle 对早期分化图谱的影响。

样本结构:时间趋势是否被单个输入样本驱动?

有了 day 和 cluster 两层检查后,必须回到重复结构。d0 有三个输入矩阵:GSM1599494 对应 sample 1,GSM1599495/1599496 是 sample 2 的两份技术重复。后两份矩阵不能作为两个独立生物样本。d2、d4、d7 各只有一个生物样本,时间趋势很容易和单样本特征混在一起。

6 个输入矩阵在 UMAP 上的分布。

图 4. 6 个输入矩阵在 UMAP 上的分布。d0 sample 2 的两份技术重复分别着色,用于检查技术库是否异常分离。

图 4 不提供细胞命运标签。它用于比较 d0 sample 2 的两份技术库,并检查 d0 两个生物样本之间的结构差异。d2/d4/d7 各由单个样本代表,后续所有 program 趋势都要保留这一重复结构边界。

Marker dotplot:时间点上的基因证据是否一致?

UMAP 告诉我们信号在空间上怎么分布,dotplot 则回答 marker 是否按时间点形成一致方向。对这篇文章来说,关键不是某个单基因是否漂亮;它需要多能性、早期分化和 lineage-related marker 是否形成一组可解释的趋势。

按分化天数查看关键 marker。

图 5按分化天数查看关键 marker。

图 5 使用未参与 program score 构建的留出 marker,按 day 做表达汇总。它可用于检查多能性下降或分化相关方向是否有额外基因支持,但 day 内大量细胞仍不是独立重复;尤其 d2/d4/d7 各只有一个输入样本,不能据此做总体推断。

Signature score:把连续状态变成可比较指标

signature score 的作用是降低单个 marker 表达未检出或检测不稳定带来的影响。pluripotency、early differentiation、mesendoderm、neural ectoderm 和 cell cycle 分数可以帮助判断每个细胞处在哪种表达倾向上,但它们仍然是表达层面的指标,不是细胞命运实验。

signature score 在 UMAP 上的空间分布。

图 6signature score 在 UMAP 上的空间分布。

图 6 需要和图 2、图 4、图 5 一起读。如果 pluripotency score 与 d0 富集区域一致,而 early differentiation 或胚层相关 score 在后期或特定区域升高,说明公开矩阵支持分化趋势。如果 score 与 day 和 marker dotplot 冲突,则应优先检查样本规模、细胞周期和批次因素。

样本层统计:连续 program 中位数能说明什么?

结尾处先计算每个技术库的 program 中位数,再把 GSM1599495/1599496 等权折叠到 d0_bio2。图中展示 5 个生物样本层汇总:d0 两个,d2、d4、d7 各一个。这个处理避免技术重复被重复计权,也避免发布由最高分规则产生的硬状态比例。

按生物样本汇总的连续 program score。

图 7. 技术重复嵌套后的生物样本层 program score。d0 有 2 个生物样本,其中 sample 2 由两份技术库折叠;d2/d4/d7 各 1 个。

图 7 可以描述每个生物样本的 program 方向,并检查 d0 两个生物样本是否一致。由于后续时间点没有重复,不能据此估计总体时间效应、硬状态比例或命运转换概率;这些结果只能作为该批公开矩阵中的探索性时间趋势。

结果图应该怎么读?

这组 ESC 分化数据的读图重点是样本不平衡。d0 细胞远多于 d2、d4、d7;多能性、早期分化、mesendoderm、neural ectoderm 和 cell cycle 是连续表达倾向。day、sample、score 和留出 marker 要一起读。

这些图的顺序是有意安排的。图 1 看时间点规模和 QC;图 2 看 day;图 3 看无监督结构;图 4 检查输入样本;图 5 看留出 marker;图 6 看连续 score;图 7 回到样本层中位数。这样读,能避免把连续分化状态硬切成几个过度确定的类型。

在公开复现文章里,结果图要承担具体任务:确认矩阵可读性、时间点不平衡、day 与表达结构的关系、marker 对状态的成组支持、signature score 与 day/marker 的一致性,以及组成变化只能支持趋势而不能直接推出命运结论。

容易误读的地方

第一,不要把聚类编号当成细胞类型。Leiden cluster 是计算结构,只有经过 marker、metadata 和源论文背景共同支持后,才适合写成生物学状态。

第二,不要只挑一个好看的 marker。单个 marker 很容易受掉落、表达噪音或相邻状态影响。更稳妥的做法,是把一组 marker 放到 dotplot 或 signature score 里一起看。

第三,不要忽略公开矩阵边界。不同论文提供的数据格式差异很大,有的是 10x matrix,有的是 processed CSV,有的是 FPKM tracking,有的是 CEF molecule counts。复现文章必须说明自己分析的是哪一层数据。

还能继续怎么做?

如果继续加深,适合补 pseudotime、按天数做 signature 趋势线、检查 Nanog/Pou5f1/Sox2 随时间下降的幅度,以及把 d0 多个重复分别画出来看批次差异。这样能更接近源论文关于 droplet barcoding 捕捉动态状态的叙事。

这些加深分析不是每篇公开笔记都必须做完,但它们能帮助判断一个公开数据是否值得继续投入。如果只是想快速了解论文和数据,当前结果图已经足够形成初步判断;如果要服务具体课题,就应该继续做细胞类型内比较、差异表达、trajectory、通路评分或跨数据集对照。

和源论文的关系

这篇复现的目标不是把源论文所有实验和模型完整重做一遍;本文在公开矩阵范围内检查主要结构是否能重新出现。对于方法学文章,重点是公开矩阵是否足以展示平台数据的细胞结构和 marker 证据;对于发育或组织图谱文章,重点是阶段、细胞状态和 signature 是否能支持源论文里的主要生物学叙事。

因此,本文更接近一份可公开阅读的复现笔记:它强调数据来源、矩阵边界、结果图可解释性和结论克制。用于课题推进时,还需要结合研究问题决定是否补充更深的 differential expression、trajectory、pathway score、细胞类型内比较或跨数据集对照。

更细的结果解读

Klein et al. 的 inDrops 数据适合检查连续表达变化。公开矩阵中可观察多能性和分化相关 program 随 day 改变的线索,但低维结构不等同于真实轨迹,d2/d4/d7 的单样本设计也限制了总体解释。

UMAP 按 day 着色时,最值得看的不是每一天是否完全分开;时间顺序是否大体沿着一条方向展开。如果 day 信息和无监督结构之间存在一致关系,说明公开矩阵保留了发育进程信号;如果 day 完全混杂,则需要重新检查 normalization、HVG 选择或数据本身是否适合讲分化。

连续 program 图可以帮助读者理解“倾向”而不是“类型”。Pou5f1、Nanog、Sox2 等多能性 marker 与 Fgf5、T/Brachyury、Eomes、Sox17 等分化相关 marker 应结合样本和时间一起读;不再为每个细胞挑一个最高分状态。

signature score 的意义在于把多能性和分化方向变成可比较的连续值。多能性 score 如果在早期 day 更高,分化相关 score 如果在后期或特定区域升高,就能形成一条可读的发育叙事。这种叙事对复现文章需要先确认,因为它让读者看到公开数据和原文主题之间的连接。

和源论文的对照

Klein et al. 的原文是 inDrops 方法和早期胚胎干细胞分化应用的代表。原文关注的不只是某个 marker;重点是单细胞技术如何捕获复杂分化过程中的细胞状态分布。本文复现的边界更窄:基于公开矩阵重建主要 UMAP、day/样本结构、留出 marker 和连续 signature score。

和源论文对照时,不能把本文当作完整发育生物学重分析。没有重新建库,没有重新从 reads 层面处理,也没有复刻原文所有模型。本文能确认的是:公开表达矩阵仍然保留了分化时间、状态变化和 marker 证据,足以作为一个发育单细胞复现案例。

这个边界对实际项目很有价值。很多发育或诱导分化项目最容易出现的问题,是把连续状态强行切成几个类型,然后过度解释 cluster 名字。Klein 这类数据提醒我们,复现时应该先问时间轴和 marker 梯度是否稳定,再决定是否需要 trajectory、RNA velocity 或 lineage score。

对后续项目的启发

如果把这套流程迁移到真实分化项目,建议先建立三个层级。第一层是 day/timepoint 和生物学重复结构。第二层是连续 program 与独立 marker 是否符合预期。第三层才是在重复充分后做样本层差异表达或 trajectory 稳健性分析。

对旧项目重新分析尤其如此。很多老数据可能只有 processed matrix 和简单 metadata,但只要 day、condition 或 treatment 信息还在,就可以重新整理成比较清楚的状态图谱。即使不能做非常复杂的模型,也能输出 UMAP、marker dotplot、signature score 和阶段组成图,用于文章补图、汇报或课题设计。

这篇复现还说明,单细胞分析并不总是追求更多标签。有些项目更有用的是讲清楚连续变化、过渡状态和边界条件。公开 blog 里把这点写明白,反而比堆很多 cluster 名称更像一份专业复现记录。

发布前复现检查清单

这类公开复现文章在发布前至少要过几道检查。第一,数据来源要能追溯,最好同时保留论文、DOI、GEO/SRA 或数据下载地址。第二,矩阵层级要写清楚,是 raw count、filtered matrix、processed expression,还是作者已经整理过的 supplementary table。不同层级决定了后续 QC、归一化和结论边界。

第三,metadata 不能含糊。样本、时间点、处理组、donor、组织来源和原文 cluster 如果能解析,就应该进入结果图;如果解析不了,也要在复现边界里说明。很多旧数据的主要问题不是算法;metadata 命名混乱。第四,marker 解释要成组出现。一个基因可以提示方向,但一组 marker 才能支撑细胞身份或状态。

第五,结果图顺序要服务叙事。QC 图回答数据能不能读,UMAP 回答结构是否存在,composition 回答样本或状态比例,dotplot 回答 marker 是否支持,signature score 回答生物过程是否有方向。只有这些图连起来,读者才能判断复现是否可信。

第六,结论要和分母、输入样本和矩阵层级一致。当前结果可展示探索性 program 趋势;样本重复不足时不做总体时间效应、硬状态比例或命运结论。

补充一点:分化类数据在解释时还要同时看时间点和状态 marker。如果两者一致,说明复现主线比较稳;如果两者不一致,应该优先检查 metadata、细胞周期和批次因素,而不是急着给 cluster 命名。

这类复现对实际课题有什么用?

公开单细胞数据经常被低估。老数据、经典论文和 GEO/SRA 里的 processed matrix 只要整理得当,就可以用于重新理解研究背景、复刻关键图、检查 marker 逻辑、补充汇报材料,或者为新的私有单细胞项目设计分析路线。

深度解读:这篇复现应该怎么读?

Klein 这篇复现要按 ESC 去 LIF 分化时间序列来读。本文复核的是:GSE65525 中 d0、d2、d4、d7 公开 count matrices 是否还能支持多能性下降、早期分化 marker 出现和若干胚层相关表达倾向,而不是把 UMAP 上的状态直接写成完整命运图谱。

1. 这篇复现回答了什么?

它回答的是“早期 inDrops 公开矩阵是否能重建 ESC 分化过程中的主要表达趋势”。本文整理得到 8,669 个细胞,保留 6 个输入矩阵,并将 d0 sample 2 的两份技术重复嵌套处理。day UMAP、Leiden、library UMAP、留出 marker、连续 score 和生物样本层汇总共同检查分化主线。

这个回答要和数据不平衡一起读。d0 细胞数量更多,因此“某个状态最多”不等于它在分化过程中最重要。更稳的结论是:公开矩阵中可以看到多能性和早期分化相关 marker/signature 的方向性变化。

2. raw / processed matrix 的边界在哪里?

本文使用的是 GEO RAW tar 中的 processed CSV count matrices,不是 FASTQ,也不覆盖 K562 对照和原文全部方法学评估。它可以支持表达矩阵层面的归一化、降维、marker 和 signature 复核;不能替代 barcode 方法学性能评估、完整 trajectory 模型或原文所有统计分析。

这里的边界还包括时间设计。d0 有 3 个输入样本,d2/d4/d7 各只有 1 个;本文也没有直接观测单个细胞命运。因此应该写“该公开矩阵中的探索性表达趋势”,不应该写成总体时间效应或确定命运转换。

3. 主要图应该怎么读?

主要图应按时间序列逻辑读。图 1 确认规模和 QC;图 2 看 day;图 3 看 Leiden;图 4 检查输入样本;图 5 看留出 marker;图 6 看连续 score;图 7 看样本层中位数和重复边界。

最重要的检查点是 day、marker 和 signature 是否互相一致。多能性 marker 下降、早期分化或胚层相关 marker 出现、signature score 与 UMAP 区域对应,这三者同时成立,才适合写成 ESC 分化状态复现。

4. 哪些地方不能过度解释?

第一,不能把最高 program score 当成最终细胞类型或命运。第二,不能把 d0 细胞数量优势误读成生物状态优势。第三,不能把 UMAP 连续结构直接写成真实发育路径。第四,d2/d4/d7 缺少重复,不能把单样本趋势写成群体规律。

本文能严肃支持的是:GSE65525 的 ESC 去 LIF 公开矩阵中,时间点、样本结构、留出 marker 和连续 score 呈现可探索的多能性/分化相关趋势。本文不能支持总体 day 效应、硬状态比例、完整命运图谱或单细胞追踪结论。

5. 如果继续深入,下一步做什么?

继续深入时,优先做按 day 的 signature 趋势线,尤其是 pluripotency、early differentiation、mesendoderm、neural ectoderm 和 cell cycle。第二步可以补 pseudotime 或 diffusion map,但要明确这是表达空间推断。d0 应分别检查 sample 1、sample 2 及其两份技术库;后续时间点若要做总体推断,还需要新增独立生物重复。

对真实分化项目来说,Klein 这类数据的启发是:先问时间点和 marker 梯度是否一致,再决定是否需要更复杂的 trajectory。分化类单细胞文章的专业性,往往体现在承认连续状态和采样边界,而不是给每个 cluster 起过度确定的名字。


分享这篇文章:
通过邮件分享

上一篇
Kang IFN-beta PBMC 深度复现:从 GEO 原始矩阵、作者 metadata 到 individual 层面的干扰素响应
下一篇
复现 Gierahn Seq-Well:Mtb 暴露巨噬细胞能读出哪些状态?