Trapnell 这组数据是经典分化时间序列复现的好例子。它只有公开 FPKM 矩阵和时间标签,但足以展示 T0/T24/T48/T72 的整体表达梯度。本文会把它写成一篇严肃的公开复现笔记,而不是把它包装成更复杂的全转录组 atlas。
方法修订(2026-07-19): 原“trajectory bin”由 PC1 按三等分位数切成 3 组,每组固定 124 个细胞。等量分箱是计算设定,不能证明分化方向。本文现统一称为“PC1 等频分箱”,把 PC1 写作与时间相关的表达梯度;正式 trajectory 仍需根节点、稳定性评估和重复单位支持。
这篇文章研究什么问题
这篇复现关心的是:公开的 FPKM 矩阵是否还能重新显示分化时间结构。对于肌母细胞分化这样的数据,最重要的不是某个 cluster 是否“漂亮”;时间点是否沿着表达梯度发生移动,整体表达是否能反映分化方向。
本文选择把重点放在时间结构、PCA 方向和高变基因变化上。原因很简单:这个矩阵虽然有 2 万多个基因,但没有方便的本地 symbol 映射,最稳妥的写法是诚实说明边界,把能确认的表达趋势讲清楚。
论文和公开数据来源
- 论文:Trapnell et al., Nature Biotechnology 2014
- DOI:10.1038/nbt.2859
- 公开数据:GSE52529_fpkm_matrix.txt.gz
- Boundary:公开 FPKM matrix + time labels
**复现边界:**本文使用的是公开 FPKM 矩阵和时间标签,不是原始 reads 级重比对结果,也没有在正文中强行补全缺失的 gene symbol 体系。它更适合展示时间趋势,而不是精细 marker 复核。
数据规模
- 分析细胞:372
- 分析基因:20,274
- 主要时间点:4
这组数据共有 372 个细胞、20274 个基因。时间点分布为 T0 96 个、T24 96 个、T48 96 个、T72 84 个。T0/T24/T48/T72 这一结构本身就已经足够支持一篇分化复现笔记,只要读图顺序正确,就能看清主线。
方法与分析流程
- 读取 GSE52529 的公开 FPKM 矩阵并整理成 cell x gene 的表达对象。
- 保留时间标签,构建 AnnData,并计算每个细胞的检测基因数和总 FPKM。
- 进行过滤、log1p、HVG、PCA、邻近图、UMAP 和 Leiden 聚类。
- 使用 PC1 和等频分箱检查时间点与主表达梯度的对应关系。
- 输出 UMAP、PC1 轴、时间组成、PCA 方差、HVG heatmap 和代表性基因趋势图。
这里需要特别说明:Trapnell 这篇工作的关键历史意义,是把单细胞表达数据和 pseudotime 思想连接起来,用于理解分化过程中细胞状态的连续变化。本文没有重跑 Monocle 原文模型,也没有把 PC1 轴直接命名为原文 pseudotime。本文采用更保守的做法:用公开 FPKM 矩阵中的主变化轴和时间标签相互对照,检查 T0/T24/T48/T72 是否仍然沿表达空间形成顺序结构。
这种写法看起来比“复刻 pseudotime”更克制,但更适合当前材料。因为本地矩阵以基因 ID 为主,没有可靠 gene symbol 映射,不适合强行围绕 MYOD1、MYOG、MYH3、CKM 等经典肌生成 marker 写机制故事。相反,时间点、PC1、HVG heatmap 和代表性高变基因趋势,是这个公开矩阵最稳的证据层。
关键结果
数据概览:372 个细胞、四个时间点、公开 FPKM 矩阵

这组数据是经典的分化时间序列复现案例。它的价值不靠规模,而在于能否从公开 FPKM 矩阵中重新读到分化时间、样本均衡性和整体表达结构。
组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。
UMAP 结构:时间点、聚类和 PC1 轴

这张图把时间标签和无监督结构并排展示。对分化数据来说,最重要的不是 cluster 编号本身;时间点是否沿着低维空间形成有方向的变化。
这类图的读法是先看结构是否和 metadata 对得上,再看 marker 是否能解释这些区域。UMAP/PCA 提供入口,结论还要回到基因和样本层面确认。
PC1 轴:分化方向的连续变化

因为这份矩阵更适合按表达方向而不是 marker 名字来解读,所以 PC1 轴是一个很实用的分化梯度代理。T0、T24、T48、T72 的分布如果沿轴移动,说明公开表达矩阵保留了主分化方向。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
时间与 PC1 等频分箱:只检查时间结构

图 4. PC1 被切成 3 个等频分箱,每组固定 124 个细胞。图中只检查 T0/T24/T48/T72 与 PC1 梯度的对应关系;相同分箱大小由 quantile 规则保证,不属于生物学结果,也不构成 trajectory。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
PCA 方差:前几个主成分是否足够解释大部分变化

分化时间序列文章里,PCA 方差图能帮我们判断主变化方向是否稳定。如果前几个 PC 已经能够概括大部分差异,那么公开矩阵至少保留了清楚的分化轴。
低维图只能说明表达空间的相似性。群体分开、阶段相邻或标签聚集,可以支持后续检查 marker 和组成,但不能单独写成谱系方向、空间位置或机制强弱。
HVG 热图:表达变化是否沿时间展开

HVG 热图应该让读者直观看到分化时间点的表达变化是否成块出现。对于老数据,这往往比复杂模型更适合做复现的第一层证据。
这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。
代表性 HVG:时间点上的表达趋势

这张图把部分高变基因的表达趋势按时间拆开,适合说明公开矩阵确实保留了动态变化,而不是一组完全静态的细胞混合物。
marker 和 score 要成组解释。单个基因高表达只能提供线索;只有 dotplot、heatmap、signature、metadata 和组成结果互相支持,才适合写成细胞身份或状态判断。
和源论文的关系
Trapnell et al. 的原文强调的是单细胞技术如何捕捉肌母细胞分化过程,并提出用细胞间表达相似性恢复连续命运变化的思路。本文复现的是公开矩阵里可以稳定重建的时间梯度和表达方向。因为当前矩阵没有方便的 symbol 映射,所以我没有把它写成一个 marker-heavy 的故事。
这是与当前材料相符的写法。老数据复现如果为了贴近原文而硬补不确定的 marker 结论,解释会失真。对于这类公开 FPKM 矩阵,时间结构是最稳的证据层。
和源论文相比,本文没有复现完整 Monocle ordering、branch point、调控因子筛选和后续验证。本文的目标更基础:确认公开 FPKM 表是否仍能看到从未分化状态到后续时间点的整体表达移动。这个目标虽然小,但非常适合公开复现,因为它不依赖额外假设,也不需要用不确定的基因映射去支撑过强机制结论。
深度解读:这篇复现应该怎么读?
这篇复现回答了什么?
它回答的是:公开 FPKM 矩阵里,T0 到 T72 的分化梯度是否还在。答案是肯定的。PC1 轴、UMAP 结构和 HVG 热图都能看出时间推进带来的表达变化。
它没有回答的是:某个基因在肌细胞分化中的精细功能机制。没有 symbol 体系和原始 reads 支持时,不应该强行写成更具体的机制文章。
raw / processed matrix 的边界在哪里?
这份表本身已经是 processed FPKM matrix。它适合看动态趋势,但不适合恢复完整比对、转录本层面信息或更细的 QC 细节。特别是对标记基因命名不完整时,最稳妥的做法是把它当作时间序列表达证据,而不是功能注释终稿。
FPKM 还有一个必须写清楚的边界:它不是 UMI count,也不是现代常见的 sparse count matrix。不同基因长度、表达量范围、归一化方式和低表达噪声都会影响解释。它可以很好地展示时间点之间的总体表达差异,但不适合直接套用现代 UMI 数据的 QC 指标,也不适合在没有额外模型的情况下做精细差异表达结论。
关键图应该怎么读?
先看数据概览,再看 UMAP 里的时间和 PC1 等频分箱;然后看 PC1 是否随时间变化;再看 HVG heatmap 和代表性基因趋势。多张图同向时,可以说明公开矩阵保留了时间相关表达结构。
这类文章的重点不是“我知道多少 marker”;“我有没有把公开数据能说明的东西讲到位”。对老的分化数据来说,这已经足够形成一篇可复用的公开复现笔记。
哪些地方不能过度解释?
不能把 PC1 轴等同于原文完整 pseudotime;不能把 PC1 等频分箱写成真实发育阶段;不能把高变基因热图里的每个基因都解释成调控因子;也不能在缺少 gene symbol 映射时强行做肌生成 marker 机制叙事。本文所有结论都限制在“公开矩阵能重新显示时间结构”这一层。
如果要继续深入,下一步应补充可靠的 Ensembl-to-symbol 映射,复核经典肌生成 marker,再运行的 pseudotime/trajectory 模型,并把得到的 ordering 与 T0/T24/T48/T72 时间标签对照。只有这样,才能从“时间结构复现”推进到“调控机制复现”。
这类复现对实际项目有什么用?
很多旧单细胞项目手里只有 processed matrix,没有完整 raw count,也没有现代 h5ad/Seurat 对象。Trapnell 这类数据说明,即使材料不完美,只要问题定义清楚,仍然可以复现出有价值的结构。对分化项目来说,最先应该问的不是 marker 是否足够多;时间点、处理组或状态标签是否沿表达空间呈现合理顺序。
这类复现还可以帮助研究者判断一个旧数据集值不值得继续深挖。如果时间结构清楚,就可以继续做 pseudotime、调控因子、动态基因模块和原文图复刻;如果时间结构本身混乱,就应该先回到数据质量、样本标签和矩阵来源,而不是直接堆复杂模型。
对真实科研项目来说,这种判断很实用。很多课题组积累了早年的表达矩阵、已经发表过的补充表,或者只有部分时间点标签的分化数据。重新整理时,不一定第一步就要追求完整轨迹模型。更合理的做法是先建立三层证据:第一,样本和时间标签能否对应;第二,降维空间里是否出现连续方向;第三,高变基因或模块是否沿时间出现成块变化。三层都成立,再继续做 pseudotime 和调控解释,文章会更稳。
对肌母细胞分化这类数据,另一个很常见的误区是把时间点之间的差异想成突然跳变。实际上,分化更像连续过渡。公开 FPKM 矩阵里如果看到 T0、T24、T48、T72 沿 PC1 或 UMAP 逐渐移动,这本身就已经是很有价值的结果。它说明数据保留了分化趋势,也说明我们可以在此基础上进一步安排更细的机制分析。
从读图角度看,T0 往往代表未分化或较早状态,T24 和 T48 是中间过渡,T72 则更接近晚期分化。本文没有把这些时间点写成绝对生物学阶段,因为 FPKM 矩阵本身不能提供那样严格的证据。但如果同一方向在 UMAP、PC1 和 HVG heatmap 里都出现,这就足以支持“表达状态随时间推进”的主结论。对很多旧数据,这已经是相当可靠的结果。
这也解释了为什么本文没有把重点放在单个 marker 上。分化数据里重要的,往往是趋势而不是某个静态名称。只要趋势清楚,就可以继续扩展到调控网络、时间模块、功能富集和原文图复现;如果趋势本身不稳,再多 marker 也只能制造噪声。公开复现的价值就在于先把趋势确认下来,再决定是否值得投入更深一层分析。
实际整理这类数据时,还应该保留每个时间点的细胞数和表达量概览。T0、T24、T48、T72 的细胞数相对均衡,才更适合讨论时间趋势;如果某个时间点细胞数过少,PC1 或 UMAP 上的移动就可能被抽样波动放大。本文把数据概览放在第一张图,就是为了先回答这个基础问题。
本文选择不强行补 marker,也是一种可复用原则。经典分化数据当然可以围绕 MYOD、MYOG、MYH、ACTA、CKM 等肌生成基因讲故事,但前提是 gene symbol 体系可靠、矩阵来源清楚、表达值可以解释。如果当前公开表不支持这一层,就应该先把时间结构讲清楚。严肃复现不是把所有可能的生物学名词写进去;关键在于把当前数据能支撑的结论写扎实。
发育连续性:PC1 轴和 pseudotime 不能混为一谈
Trapnell 这篇数据最适合用来说明“连续性证据”和“完整轨迹模型”的区别。PC1 轴能够显示 T0、T24、T48、T72 在主要表达方向上的移动,trajectory bin 能把这种移动分成低、中、高几个区间,HVG heatmap 能看到一批高变基因随时间成块变化。这些结果共同支持“公开矩阵保留了分化连续趋势”。
但 PC1 轴不是严格 pseudotime。Pseudotime 通常需要构建细胞间图结构、选择起点、定义轨迹拓扑,并检查 ordering 是否与时间、marker 和生物学知识一致。本文没有把 PC1 轴包装成完整 pseudotime,是因为公开矩阵和 gene symbol 边界不足以支撑更细的机制外推。这样的克制反而让结论更稳:可以说时间结构清楚,不能说完整肌生成轨迹已经重建。
如果要把这篇数据继续做成更深的发育分析,应先补三件事。第一,可靠完成 Ensembl ID 到 gene symbol 的映射,确认经典肌生成 marker 是否存在且表达合理。第二,在此基础上运行的 trajectory/pseudotime 方法,并把 ordering 与 T0/T24/T48/T72 对照。第三,把动态基因模块与原文结果图或肌生成文献逐项比较。只有这些证据补齐,才适合从“趋势复现”升级到“机制解释”。
这也是后续所有发育/分化文章应该遵守的原则:连续性不是靠一句“状态连续”就能成立,而要由时间标签、低维轴、marker 梯度、module score、trajectory bin 或基因趋势共同支撑。本文已有 PC1、trajectory bin、HVG heatmap 和时间趋势图,因此可以严肃地讲分化方向;但它仍然不越过公开 FPKM 矩阵能支持的边界。
小结
Trapnell 这组肌母细胞分化数据非常适合做严肃的时间序列复现。它不是靠很多 cluster 取胜;它靠清楚的分化时间结构取胜。本文把公开 FPKM 矩阵整理成 UMAP、PC1 轴、轨迹 bin、HVG heatmap 和时间趋势图,足以支撑公开 blog 和 Xiaohongshu 的双版本输出。