跳到正文
bioinfo.zle.ee
返回

复现 Moignard 造血发育:42 基因 qRT-PCR 能支持什么?

发布于: · 更新于:

Moignard 等人在 2015 年研究小鼠胚胎早期造血调控网络,使用单细胞 qRT-PCR 测量一组预先选择的转录因子和谱系相关基因。Scanpy 的 moignard15 对象来自论文补充表,X 存放 normalized dCt。它不是 RNA 测序矩阵,也没有 UMI count、转录本总量或全转录组覆盖。

科学更正(2026-07-19) 早期页面曾把该对象笼统写成 targeted expression panel,沿用了 RNA 测序中的“检测基因数”“total expression”和 >0 判定,还把最高 program score 转成离散状态。相关离散状态和组成比例已撤回。源文件显示 normalized dCt 的未检出下限为 -14。本文现从补充 Excel 读取 3,934 个细胞和 42 个分析基因,以 >-14 统计 panel 内被检测靶标,以相对下限的累计信号描述 panel 可读性;程序分数采用基因标准化后的连续均值,不生成离散状态。

这份数据先看测量技术

单细胞 qRT-PCR 和转录组测序回答问题的方式不同。这里的 42 个基因由研究设计预先选定,数据能精细观察这些基因之间的组合,却看不到 panel 之外的代谢、信号通路、受体和细胞周期基因。任何分析都必须限定在被测靶标内。

补充表的 dCt_values.txt 工作表含 46 个基因列。Scanpy 按原实现移除 Eif2b1/Mrpl19/Polr2a/Ubc 四个 housekeeping genes,留下 42 个基因。矩阵中 -14 是未检出下限,其他值为 normalized dCt。本文不把负值当成异常,也不以零作为检测阈值。

论文和数据来源

本文没有全转录组矩阵,不能做 transcriptome-wide differential expression、通路富集或完整 marker discovery。原文的网络推断、状态转换模型和实验验证也没有在本文中重建。

数据规模和作者实验组

分析对象包括 3,934 个细胞和 42 个基因。作者 exp_groups 来自分选阶段和 GFP 状态:

公开对象没有 embryo、litter、独立实验批次或生物学重复 ID。实验组是发育和分选分层,不等于五个独立重复。后面的组间图只描述当前细胞集合。

dCt 数据怎样做可读性检查

使用 X>0 统计“检测基因数”,会把许多高于未检出下限、但 normalized dCt 仍为负的有效信号误判为未表达。本文使用两个与数据定义一致的指标:

第二个指标只用于描述 panel 相对未检出下限的总信号。它不是 RNA 分子总量,也不能与 UMI library size 对应。

Moignard qRT-PCR dataset overview

图 1. 作者实验组、panel 内高于 -14 下限的靶标数、Leiden 结构和相对下限的累计 panel signal。

图 1 检查每个细胞在有限 panel 中保留多少可读信号。若某些细胞大部分靶标都停在 -14,低维结构可能受测量下限影响;靶标覆盖较充分时,程序组合才有解释空间。这个 QC 只针对当前 qRT-PCR panel,不能替代测序深度或 reads 质量评估。

分析策略:先标准化基因,再计算连续程序

normalized dCt 的不同基因有各自分布范围。脚本在 PCA 和程序评分前按基因做中心化和标准化,使高方差基因不会仅凭量纲支配结果。UMAP 和 Leiden 由 42 个基因的标准化矩阵得到,原始 normalized dCt 保存在对象的 Xnormalized_dct layer 中。

程序集合依据 panel 实际存在的基因重新定义:

每个分数是对应基因 z-score 的均值。基因集合之间允许重叠,因为它们描述相互关联的发育程序。本文不要求每个细胞只能归入一个程序。

作者实验组与无监督结构

Moignard experimental groups and Leiden UMAP

图 2. 作者 exp_groups 和 Leiden 在同一 UMAP 上的分布。实验组来自外部 metadata,Leiden 来自 42 基因标准化矩阵。

作者实验组在低维空间中呈现结构差异,说明预选 panel 保留了与发育阶段和分选设计相关的表达信息。UMAP 的分离程度不等于发育时间、转化概率或命运分支。只有 42 个靶标时,未被测量的中间状态和调控通路不会出现在图中。

Leiden 提供数据驱动的局部结构,不能自动命名为 endothelial、hematopoietic 或 erythroid 状态。本文把 Leiden、作者实验组和连续程序并列展示,避免最高分规则替代原始设计。

单基因信号如何分布

Moignard normalized dCt marker genes on UMAP

图 3. Cdh5/Kdr/Pecam1Runx1/Gfi1/Itga2bGata1/Gfi1b/Sfpi1Tal1/Lmo2/Sox17 等 panel 基因在 UMAP 上的 normalized dCt 分布。

单基因图用于定位表达方向和测量下限。Cdh5/Kdr/Pecam1 提供内皮相关信息,Runx1/Gfi1/Itga2b 连接造血出现,Gata1/Gfi1b/Nfe2/HbbbH1 反映红系方向。一个基因的局部高值仍可能来自测量波动或有限 panel 的投影,解释时需要看同一程序中的其他基因是否同向。

连续程序比离散标签更合适

Moignard continuous program scores

图 4. 五类预设发育程序的连续分数。颜色表示相对程序强度,不提供细胞命运分类。

Early hematoendothelial、endothelial、hematopoietic emergence、erythroid 和 stem/progenitor 程序可以在同一细胞中共存。早期造血发育本来就涉及调控因子组合变化,互斥硬标签会丢掉这种连续性。早期页面曾将最高分仍不为正的 31.85% 细胞强制分配状态,该离散结果已撤回,也说明这套规则不适合当前对象。

连续分数也有边界。它们来自预先选择的有限基因,不能衡量 panel 外通路,也不等同于真实发育时间。分数高低只在当前数据、当前基因标准化方式和当前程序定义下比较。

DotPlot 展示的是同一 panel,不是独立验证

Moignard qRT-PCR panel by experimental group

图 5. Panel 基因按作者实验组汇总。颜色表示平均 normalized dCt,点大小表示高于 -14 下限的细胞比例。

图 5 与程序分数使用同一批有限基因,因此它能拆开分数内部的基因贡献,却不能充当独立验证。作者实验组来自外部设计,可用于检查信号是否与分选阶段相容。若要验证命运关系,需要额外基因、独立测量、扰动实验或 lineage tracing。

图中的检测比例也已改用 >-14。使用 >0 会系统性低估 normalized dCt 为负但已高于未检出下限的信号,尤其会扭曲不同基因和实验组之间的比较。

实验组程序中位数

Moignard program medians by experimental group

图 6. 五个作者实验组的连续 program 中位数。图中没有离散状态比例。

实验组中位数可概括当前细胞集合的表达方向。例如,某组 endothelial program 较高,只能说明该组被测 panel 中的内皮相关组合更强。由于没有独立 embryo 或实验批次 ID,不能从细胞中位数估计群体层效应,也不能报告组间显著性。

细胞层分布保留组内异质性

Moignard program distributions by experimental group

图 7. 每个实验组内五类 program 的细胞层分布。

中位数会压缩组内差异,图 7 补回单细胞分布。若同一实验组出现宽分布或多个峰,说明有限 panel 中仍有明显异质性。这个现象可以成为后续建模入口,但不能凭箱线图宣布新的亚群或发育分支。

与源论文的关系

源论文结合单细胞 qRT-PCR、计算模型和实验验证研究早期血液发育调控网络。本文只复查补充表中的 normalized dCt 表达层:作者实验组是否可读,预设基因组合是否形成连续方向,哪些解释受 42 基因 panel 和重复信息限制。

调控网络需要基因间关系、状态转换模型和额外证据。当前 UMAP、Leiden 和程序分数不能重建原文全部网络,也不能替代 lineage tracing。文章保留的结论是“panel 内可见哪些预设发育程序”,不扩展为完整命运树。

这类数据容易犯的错误

第一类错误是把 normalized dCt 当成 count。dCt 可以为负,-14 才是该表的未检出下限。以零做阈值、对 dCt 求传统 library size 或套用 UMI QC,都会改变数据含义。

第二类错误是把 42 基因 panel 写成全转录组图谱。未进入 panel 的基因和通路没有被测量,不能从“图上没看到”推断它们不存在。

第三类错误是把最高程序分数转成命运标签。多个程序共享调控因子,早期发育状态也会重叠。连续分数更能保留这部分信息。

第四类错误是忽略重复。细胞数达到 3,934,并不代表每个实验组有大量独立胚胎。缺少 embryo 和批次 ID 时,组间图只能描述当前细胞集合。

若要继续深入

后续分析需要先找回每个细胞对应的胚胎、实验批次和分选重复。重复结构明确后,才适合在样本层比较 program,评估不同阶段的稳定变化。

如果目标是调控网络,应回到原文模型所需的基因关系和先验约束,并使用扰动或独立数据验证关键边。若目标是连接现代图谱,可将这 42 个基因作为小型 reference panel,与全转录组胚胎数据做交叉映射;映射结果仍需报告覆盖率和不确定性。

结论边界

Moignard15 是 3,934 个细胞、42 个分析基因的单细胞 qRT-PCR normalized dCt 数据。本文以 -14 为未检出下限,计算 panel 可读性、UMAP、Leiden 和五类连续发育程序;离散状态和组成比例已撤回。

当前结果支持 panel 内的 early hematoendothelial、endothelial、hematopoietic emergence、erythroid 和 stem/progenitor 表达方向。全转录组通路、总体阶段效应、严格轨迹、调控网络和命运关系需要更完整的数据与独立证据。


分享这篇文章:
通过邮件分享

上一篇
复现 Trapnell et al. 肌母细胞分化单细胞数据:从公开 FPKM 矩阵到 T0/T24/T48/T72 时间结构
下一篇
复现Shekhar et al.视网膜双极细胞数据:ON/OFF连续程序与注释边界