跳到正文
bioinfo.zle.ee
返回

复现 Deng et al. 小鼠早期胚胎单细胞数据:从 GSE45719 到阶段连续性和等位基因边界

发布于:

Deng et al. 的 GSE45719 是早期单细胞 RNA-seq 文献中的经典数据。原文聚焦 dynamic random monoallelic gene expression,公开补充文件则同时保留 RPKM、reads、CAST_hits 和 C57_hits。本文先限定可复现层级:使用 gene-level expression.txt.gz 重建 zygote 到 late blastocyst 的阶段表达结构,并把等位基因机制留在 raw-read、SNP-aware 分析范围内。

统计单位修订(2026-07-19): 文件名可以恢复部分 embryo ID。268 个主分析细胞中,260 个可归入 36 个 stage + embryo_id 单位:4-cell、8-cell、16-cell 和 early/mid/late blastocyst 分别恢复 4、7、4、3、3、2 个 embryo ID,early/mid/late 2-cell 分别恢复 3、5、5 个。4 个 zygote 及 early/mid 2-cell 各 2 个 0r 样本没有可恢复 embryo ID。图 4-7 在可恢复阶段先按胚胎聚合 score 或表达;无 ID 细胞以红色 X 单独保留为描述性点。样本量较小且部分阶段缺 ID,本文不做阶段显著性检验。

为什么这篇适合做专题级复现?

Deng et al. 2014 年 Science 文章最被记住的部分,是用 CAST/Ei 和 C57BL/6 杂交背景在单细胞层面研究等位基因表达。这个主题本身很有吸引力,但也很容易在公开复现时写过头:看到补充文件里有 CAST_hitsC57_hits,就直接把原文的 random monoallelic expression 结论照搬过来。这样做并不严谨。

本次复现的痛点正是这个边界。GEO 提供的 expression.txt.gz 文件包含每个样本的 gene symbol、RefSeq ID、RPKM、reads、CAST_hits 和 C57_hits。它们足以重建 stage expression matrix,足以看 zygote、2-cell、4-cell、8-cell、16-cell、blastocyst 的表达结构,也足以审计母源、ZGA、pluripotency、TE-like、primitive-endoderm-like marker 趋势。但如果要重新得出 allele-specific mechanism,需要 raw reads、SNP-aware alignment、杂交方向和基因层面的等位基因判定规则,这不等于简单合并 RPKM 表能完成的。

所以这篇文章不等于“避开原文关键”,要把复现问题拆清楚:公开表达矩阵能支持什么,原文 raw-level 机制需要什么,类似发育项目应该怎样在不夸大的前提下挖出可用图和可写结论。

论文和数据来源

论文、数据和公开矩阵信息如下。这里先把来源和矩阵层级交代清楚。

项目内容
论文Deng et al. Single-cell RNA-seq reveals dynamic, random monoallelic gene expression in mammalian cells
发表信息Science, 2014
DOI10.1126/science.1245316
PubMed24408435
公开数据GSE45719
公开输入GEO per-sample expression files

公开矩阵进入分析前,先确认数据层级和规模。

项目数值
GEO supplement expression files317
主分析胚胎单细胞268
gene union22,431
过滤后分析基因15,202
zygote 到 late blastocyst 阶段10
可恢复 stage + embryo_id 单位36(260 个细胞)
无可恢复 embryo ID 的细胞8

复现边界: 本文使用 GEO 补充文件中的 per-sample expression.txt.gz,以 RPKM 和 reads 字段构建 expression-level matrix。CAST_hitsC57_hits 只用于说明公开文件中存在等位基因计数字段,不用于重建 random monoallelic expression 或 X-inactivation 机制。后者需要 raw-read / SNP-aware pipeline。

样本筛选:先把胚胎主线和技术/对照样本分开

GSE45719 的补充包里共有 317 个表达文件,不等于全部都应该进入早期胚胎阶段轴。文件名中可以解析出 16-cell、8-cell、4-cell、early/mid/late 2-cell、early/mid/late blastocyst、zygote,也可以看到 adult liver RNA、fibroblast、C57 two-cell control、pooled/split 技术样本。

这一步如果不做,后续 UMAP 会把不同样本来源、技术拆分和非胚胎对照混在一起,文章看起来“细胞更多”,但发育解释反而不干净。主分析只保留 zygote、early/mid/late 2-cell、4-cell、8-cell、16-cell、early/mid/late blastocyst 的 268 个胚胎单细胞;adult liver、fibroblast、C57 two-cell control 和 pooled/split 技术样本只作为数据边界说明。

Deng GSE45719 样本阶段、detected genes 和排除样本类型。

图 1. 主分析保留 268 个胚胎单细胞,阶段覆盖 zygote、2-cell、4-cell、8-cell、16-cell 和 blastocyst。右侧显示没有进入主图的文件类型:非胚胎对照、C57 two-cell control 和技术 split/pooled 文件。这个步骤直接决定后续结论是否干净。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

组成和交叉表需要回到采样、分选和处理流程里解释。它能说明当前公开矩阵中哪些群体被观察到、哪些标签互相吻合,但不能直接外推成组织真实比例、临床差异或完整空间生态。

方法流程:用 expression matrix 复现阶段结构,而不等于重建 raw-level 机制

本文的处理顺序从数据层级开始:下载 GSE45719 补充包和 series metadata,核对 PubMed、DOI、GEO accession 和文件类型;解析每个 expression.txt.gz,按 gene symbol 合并重复记录,保留 RPKM、reads、CAST_hits、C57_hits 四类字段;从文件名提取 stage、样本类型和可恢复的 embryo ID,剔除 non-embryo control、strain control 与 technical split/pooled 文件;构建 gene × cell RPKM 矩阵,计算 detected genes、total reads 和等位基因 hit 总量;使用 log1p(RPKM)、表达过滤、高变基因、PCA 和 UMAP 重建阶段结构;marker、signature score 与代表基因在可恢复阶段先按胚胎求均值,再做阶段级描述。

这个流程的关键不等于追求复杂;保持结论和输入数据匹配。对于类似旧项目,如果手上只有 processed matrix,先把阶段轴、marker 和边界做扎实,通常比直接套用原文全部机制更负责任。

PCA/UMAP:阶段标签能否形成可解释结构?

主分析矩阵过滤后保留 15,202 个基因,用高变基因进行 PCA 和 UMAP。可以看到早期 2-cell、4-cell/8-cell、16-cell 以及 blastocyst 阶段在表达空间中有明显结构。

Deng GSE45719 PCA 和 UMAP 按发育阶段着色。

图 2. PCA 和 UMAP 都显示 stage-associated transcriptome structure。PCA 更适合读整体发育轴,UMAP 更适合看不同阶段在非线性空间中的分离。这里支持“表达矩阵保留了阶段结构”,但不能把 UMAP 距离解释为真实发育时间、细胞迁移或个体命运路径。

低维结构只回答表达空间是否可读。颜色或区域分开说明标签、阶段或状态和表达矩阵存在对应关系;它还不能单独证明谱系方向、空间位置、机制强弱或最终命运。

这张图解决了第一层问题:公开 expression table 不只能做文件统计,它可以复现胚胎发育阶段相关的整体表达结构。对于客户项目或旧数据重分析,这一步相当于判断“数据还有没有可整理成图的主轴”。

发育连续性:用 PC axis 和 stage centroid 看趋势

如果只看 UMAP,容易把发育状态理解成几个离散小岛。发育数据更应该结合 PC axis、stage centroid 和 marker trend 一起读。本次复现中 PC1 对 stage 有明显响应,各 stage 在 PCA 空间中的中位点也能连出大致的 zygote-to-blastocyst 路径。

Deng GSE45719 PC1 阶段轴、PCA stage centroid 和 allele-hit 层级。

图 3. 左图显示 PC1 随发育阶段变化,中图把各 stage 的 PCA centroid 连起来,右图显示 detected genes 与 CAST/C57 hit summary 的关系。右图的目的不等于做 allele-specific 结论;提示公开文件确实含有等位基因 hit summary;机制重建仍需要 raw-level pipeline。

这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

这个图很适合回答“发育连续性体现在哪里”:不等于一句“连续发育”;有表达轴、有 stage centroid、有后续 marker trend 支撑。

marker heatmap:stage identity 是否由 marker 支持?

阶段结构不能只靠降维。我们整理了 maternal/oocyte、ZGA/2-cell、pluripotency/ICM、trophectoderm 和 primitive endoderm 相关 marker,检查它们在 stage mean expression 中的相对变化。

Deng GSE45719 stage marker heatmap。

图 4. 可恢复 embryo ID 的阶段先计算每个胚胎的 marker 均值,再对胚胎均值汇总;zygote 因无 embryo ID,仅保留细胞均值作为描述。Zscan4 家族和 Dux 在 2-cell 附近达到高值,Pou5f1、Sox2、Nanog、Cdx2、Krt8、Gata6、Pdgfra 等呈现后续阶段变化。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

这一步也是文章可信度的关键。如果只有 UMAP,没有 marker panel,读者很难判断阶段轴到底是生物学结构还是技术差异。marker heatmap 把阶段标签和已知发育基因联系起来,能支撑更具体的解释。

signature score:用基因集减少单基因不稳定性

单细胞表达矩阵中,单个基因容易受表达稀疏和检测不稳定影响。为了避免只围绕一个 marker 写结论,我们计算了 maternal/oocyte、zygotic activation、pluripotency/ICM、trophectoderm、primitive endoderm 和 cell-cycle 等 signature score。

Deng GSE45719 signature scores across developmental stages。

图 5. 箱线图和黑点使用 embryo-mean score;红色 X 表示没有可恢复 embryo ID 的 zygote 或 0r 细胞。maternal/oocyte、ZGA/2-cell、pluripotency/ICM、trophectoderm 和 primitive-endoderm score 沿 stage 呈现不同方向。它们用于趋势审计,不承担 fate classifier 或机制证明。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

这类 score 在项目报告里很有用:它能把多个基因的信息压缩成可读图形,同时提醒读者不要把单基因波动写成过强结论。

代表基因趋势:哪些变化可以直接展示?

下一步把代表基因逐一画成趋势线。相比 heatmap,趋势图更适合讲“阶段变化不等于硬切标签;表达状态逐步改变”。

Deng GSE45719 representative gene trends。

图 6. 普通点表示每个可恢复 embryo ID 的平均表达,连线连接各阶段 embryo mean 的中位数;红色 X 表示无 embryo ID 细胞。Zscan4c/Zscan4d 在 2-cell 附近达到高值,Pou5f1、Sox2、Nanog、Cdx2、Gata6、Krt8、Pdgfra 在后续阶段呈现不同趋势。图中不使用细胞级 bootstrap,也不做阶段显著性推断。

这里要先看数据本身是否站得住。公开矩阵能保留多少 metadata、检测深度是否均衡、样本分组是否清楚,决定了后续结论能写到哪一层。

从阅读习惯看,这张图应该紧跟 marker heatmap 和 signature score,而不能把五六张图连续堆在一起。读者先看到总体阶段结构,再看到 marker,再看到每个基因的趋势,解释链才顺。

blastocyst lineage-like score:能做线索,不能做命运判定

在 blastocyst 阶段,我们进一步看 trophectoderm 和 primitive-endoderm-like score。它们能帮助理解 blastocyst 内部表达差异,但仍然是 expression-program clue。

Deng GSE45719 blastocyst lineage-like score clues。

图 7. 前两幅图保留 blastocyst 细胞在 UMAP 上的连续 score,第三幅图改为 embryo-mean TE-like 与 primitive-endoderm-like score。该图用于查看表达程序分布,不能替代 lineage tracing 或胚胎内独立身份验证。

这类图要按成组证据来读。单个基因或局部高表达只能提供线索,只有 marker panel、signature score、metadata 和组成信息互相支持时,才适合写成细胞身份、状态或谱系倾向。

这说明发育文章最容易过度解释的地方:marker score 能支持“某类表达程序更强”,但并不等于“这个细胞命运已经确定”。

CAST/C57 字段:为什么不能直接重写等位基因机制?

GSE45719 的每个 expression 文件中确实有 CAST_hitsC57_hits。这让它不同于普通 RPKM 表,也解释了为什么原文能围绕 monoallelic expression 展开。但公开复现时,看到这两列并不等于完成等位基因分析。

Deng GSE45719 CAST/C57 hit summary and allele-level boundary。

图 8. CAST 和 C57 hit totals 在公开文件中可见,但这些 totals 只是样本层级和基因层级 hit summary 的一部分。本次没有从 FASTQ 重新比对到 strain-aware reference,没有重新调用 SNP,没有重建 gene-level monoallelic 判定规则,因此不能把 random monoallelic expression 或 X-inactivation dynamics 当成本次复现结论。

组成图必须和采样设计一起读。它能说明当前公开矩阵里哪些群体被观察到、样本或组织标签是否均衡,但不能直接外推成真实组织比例或临床差异。

这个边界需要在文章中明确写出来。否则读者会误以为“有 CAST/C57 列”就等于“已完成 allele-aware reproduction”。科研 blog 的严肃性也体现在这里:越吸引人的机制,越要说明证据层级。

source-paper comparison:哪些与原文主线一致,哪些只是边界对照?

与原文相比,本次复现能支持三个表达层面的结果。第一,GSE45719 的公开文件确实保留了从 zygote 到 late blastocyst 的阶段表达结构。第二,2-cell 附近的 Zscan4/Dux/Tcstv 等相关 marker 和后续 blastocyst lineage-like marker 有清楚趋势。第三,公开文件中存在 CAST/C57 hit summary,说明原文的等位基因问题有数据基础。

但本次复现没有把这些 hit summary 进一步升级为机制结论。原文的 random monoallelic expression 和 paternal X chromosome inactivation spread 需要更强的 raw-read/SNP-aware 证据链。我们可以在文章中解释它们为什么是原文关键,也可以说明为什么本次 processed expression 复现不能直接重写这些结论。

Deng GSE45719 public data layer and conclusion audit。

图 9. GEO 文件层级、主分析矩阵规模和结论审计概览。对类似公开数据复现来说,先把数据层级分清楚,比直接追求“复现原文所有结论”更可靠。

这张图先用于核对输入层级。细胞数、基因检测量、样本标签和矩阵层级如果没有对齐,后面的降维、marker 和组成分析都只能算可视化,不能作为复现结论。

这里的重点是限制结论强度。公开矩阵能支持表达结构、marker 和 metadata 层面的复核;更强的机制、空间、功能或临床判断,需要 raw reads、原文模型、空间/病理信息或实验验证继续补证据。

深度解读:证据链和解释边界

Deng GSE45719 supported, exploratory and not-claimed conclusion summary。

图 10. 结论审计:本次支持 stage expression structure、marker trends 和 lineage-like expression clues;探索性结果包括 score 差异和 PC/UMAP 连续性;不支持 raw-read remapping 后的 random monoallelic expression、X-inactivation dynamics、胚胎活性或个体命运判定。

这张图把观察落到基因证据上。读的时候要看一组 marker 是否同向,而不是只挑某个显眼基因;如果证据只停留在 score 层面,结论也要保留探索性。

这里的重点是限制结论强度。公开矩阵能支持表达结构、marker 和 metadata 层面的复核;更强的机制、空间、功能或临床判断,需要 raw reads、原文模型、空间/病理信息或实验验证继续补证据。

对类似项目有什么启发?

这篇数据很适合提醒我们:经典论文复现不能把原文摘要改写一遍,也不能把全部结论原样搬到公开矩阵上。更需要保留的工作,是把输入层级、可复现图形、marker 证据和解释边界对齐。

如果一个旧的单细胞项目只剩 processed matrix,仍然可以做很多有用工作:重建阶段或细胞类型结构,整理 marker panel,做 signature score,检查是否存在连续发育轴,找出可用于汇报或文章补图的结果。但如果项目问题已经进入 allele-specific、isoform、variant、spatial niche、功能机制或临床质量层面,就必须回到更强的数据层或实验设计。

小结

Deng et al. GSE45719 的公开表达文件可以复现小鼠早期胚胎阶段结构:268 个主分析细胞形成 zygote 到 blastocyst 的表达轴,其中 260 个细胞可归入 36 个 stage + embryo_id 单位。Zscan4/Dux/Tcstv、Pou5f1/Sox2/Nanog、Cdx2/Krt8/Gata6/Pdgfra 等 marker 和胚胎级 signature 汇总共同支持阶段与 lineage-like program 的描述。

random monoallelic expression 和 X 染色体失活动态仍属于原文的 raw-level 机制主线,当前 processed RPKM 分析没有重建这部分。明确区分表达阶段复现与等位基因机制复现,能避免把补充文件中的 hit summary 误写成完整 allele-aware 结论。


分享这篇文章:
通过邮件分享

上一篇
复现 Pijuan-Sala et al. 小鼠原肠胚图谱:从 E-MTAB-6967 到中胚层-血液/内皮发生证据链
下一篇
复现 Yan et al. 人早期胚胎单细胞数据:从 GSE36552 到阶段结构和 processed RPKM 边界