科学更正(2026-07-19):早期页面曾生成离散身份,并发布门控纯度、主导身份比例、AS DC-like 276和身份组成;相关结论已撤回。本文现只展示FACS gate与set层面的连续program、观察细胞数和同矩阵分离marker一致性,不再生成离散身份。公开矩阵没有可靠donor字段。
Villani 数据的深度复现适合围绕一个具体问题展开:分选入口和转录表达方向之间能否形成可检查的关系。公开矩阵同时包含 discovery 与 deeper characterization 两个 set,列名中还有 FACS gate 和 plate。它提供了丰富的来源信息,也带来明显的采样偏差风险。本文使用一张 set 来源 UMAP 和四张证据图,讨论采样结构、gate 层程序、set 层程序、观察细胞数和第二套 marker 的同向程度。
论文、数据与复现边界
- 论文:Villani et al., Science, 2017
- 题名:Single-cell RNA-seq reveals new types of human blood dendritic cells, monocytes, and progenitors
- DOI:10.1126/science.aah4573
- PubMed:PMID 28428369
- 全文:PMC5775029
- 数据:NCBI GEO GSE94820
GEO 中可公开取得的是两个表达矩阵,原始 reads 位于受控访问范围。本文分析的是公开 processed expression 和列名编码的 metadata,矩阵层面可以支持表达方向、gate/set 对照和观察数量检查,不能重做 FASTQ 比对、read-level QC、受控样本信息或源论文全部验证实验。文件名中出现 raw.expMatrix 不改变它属于公开表达矩阵的事实。
数据结构与可用统计单位
合并对象包含 2,294 个细胞、19,156 个过滤后基因和 18 个无监督 cluster。公开列名可解析 discovery/deeper set、FACS gate 与 plate。本文没有找到可靠 donor 字段,所以 cell 只是观察单位,cluster、gate 和 set 都是汇总或来源层级,不能用来估计人群频率,也不能构成独立生物重复。
这里的深度不来自更多离散标签。它来自对采样结构的拆解:FACS gate 说明细胞从哪种实验入口进入矩阵,set 说明该细胞属于初始发现还是定向补充,连续 program 说明当前表达矩阵中哪类 marker 方向更集中,held-out panel 说明另一组同矩阵 marker 是否沿同一方向变化。四层信息在结果中保持分开。

图中颜色只记录细胞来自 discovery 还是 deeper characterization。deeper set 围绕特定分选入口补充取样,因此两种颜色的面积和局部分布会同时受到实验设计影响。它可以说明两套公开矩阵在同一表达空间中怎样相接,不能写成自然血液组成或独立队列复现。
这张图也为后面的 set 层热图提供位置背景。若某条程序在 deeper set 上移,需要同时检查它是否由定向富集的 gate 驱动;缺少 donor 字段时,set 间差异仍停留在当前矩阵的描述层。
连续 program 的定义
assignment program 包括 DC1_CLEC9A、CD1C DC、AS DC、pDC、classical monocyte、nonclassical monocyte 和 cytotoxic-like。相应 marker 组合来自当前矩阵中实际存在的基因,例如 CLEC9A/XCR1/CADM1、CD1C/FCER1A/CLEC10A、AXL/SIGLEC6/CD5、GZMB/TCF4/CLEC4C、CD14/FCN1/S100A8、FCGR3A/LST1/MS4A7 和 NKG7/GNLY/PRF1。
每个对象的分数使用同一公开矩阵内部的标准化表达。最高分与 top-two margin 只表示候选程序之间的相对分离,不具备跨数据集绝对阈值。当前没有外部 reference mapping、作者逐细胞最终标签或独立实验结果,因此不把任何高分转成身份。
FACS gate 的连续程序
FACS gate 层汇总使用每个 gate 内观察细胞的程序中位数。中位数保留了 gate 作为分选来源的意义,同时避免把一个高分细胞写成整个 gate 的结论。

图中可以看到若干与分选设计相容的方向:CD141 的 DC1_CLEC9A 程序较高,CD1C 的 CD1C DC 程序较高,AXLSIGLEC6 的 AS DC 程序较高,pDC gate 的 pDC 程序较高;Mono_classical、Mono_intermediate 与 Mono_nonclassical 则分别显示 classical 或 nonclassical monocyte 方向。AXLSIGLEC6 gate 的 AS DC 分数较高可以写成表达富集方向,不能把它转换成确定身份数量。
部分 gate 同时出现多个方向。例如 CD1C 相关 gate 还可能带有单核细胞或其他 DC 程序,AXLSIGLEC6 的不同子 gate 也并不完全相同。这样的重叠是分析对象的一部分,不应被规则抹平。深度报告应指出哪些 gate 适合继续做子集分析,哪些 gate 需要外部参考来定名。
观察细胞数怎样阅读
公开矩阵中各 gate 的观察数量直接受分选策略、set 设计和文件可用性影响。它们可以帮助核对列名解析与采样结构,但不能被写成血液中的自然频率。

汇总图列出 16 个可检查的 gate。AXLSIGLEC6 观察到 264 个细胞,CD123NEG_D7 为 217 个,pDC 为 190 个,CD141 为 189 个,CD1C 为 188 个;Mono_classical、Mono_intermediate 和 Mono_nonclassical 各为 116 个,其他 gate 的数量也随分选设计变化。数字描述这份公开矩阵里看到了多少对象,不能外推外周血中该群体的占比,也不能当作确定身份数量的分母。
数量图还承担数据审查作用。若同一个 gate 在列名解析、表达矩阵和汇总表之间数量不一致,应先检查缺失 metadata、重复列名和过滤规则,再进入生物解释。细胞数量本身不提供 donor 层重复;它只能回答“公开文件中保留了多少可观察记录”。
discovery 与 deeper 的差异
两个 set 的采样目标不同。discovery 用于初始探索,deeper characterization 围绕某些 gate 和候选群体进行定向补充。合并对象的总量可以用于统一表达空间,不能用于生成一份无偏的外周血组成表。

set 汇总显示 discovery 的 classical monocyte 方向较高,deeper 中 CD1C DC 与 nonclassical monocyte 方向的分数结构有所变化。这样的差异与两阶段设计相容,也可能受到定向取样影响。它可以作为后续分析的线索,不能直接写成两个 set 之间的总体生物差异。
set 也不是 batch 的同义词。它包含研究设计信息,plate 可能反映实验处理,gate 反映分选入口。若要把 set 差异解释为生物学,需要 donor、样本或患者层面的重复,以及同一采样方案下的平衡设计。当前公开矩阵没有这些条件,所以本文只报告中位数方向。
第二套 marker 的一致性
held-out panel 没有参与 assignment 分数生成,因此可以作为方向复核。它仍然取自同一个公开矩阵,属于 same-matrix separate-marker consistency。

第二套 marker 在 CD141、Mono_classical、Mono_intermediate、pDC 等 gate 中能看到与 assignment 方向相容的信号;在部分 CD1C、AXLSIGLEC6 子 gate 中,分数与 margin 会变弱或出现多个方向。结果适合用来识别稳定区域与边界区域,不适合把所有 gate 重新命名。
同矩阵一致性不等于独立验证。两个 panel 虽然不共享用于计算的基因,但共享同一批细胞、同一表达层、同一过滤和技术背景。独立证据应来自外部参考、作者标签、蛋白或流式结果、另一批样本或功能实验。当前没有这些资料,因此最强的公开结论只能停留在程序方向与 gate 关系。
旧组成叙事为什么要撤回
若要统计 gate 内某种确定身份的比例,需要可靠的逐细胞判定、绝对阈值和独立参照。当前分析没有这些条件,也没有把 gate 内对象分成确定的 marker-derived 类别,因此不计算身份数量比例。
discovery 与 deeper 的身份组成还会受到定向补采样影响。即使两个 set 的细胞数相近,观察到的数量也不代表血液自然丰度。任何“某类细胞有多少”“某个 gate 纯度多少”的公开表述,都越过了当前矩阵和设计能够支持的层级。
与源论文主线的对照
源论文通过分选策略、转录组结构和后续实验建立血液 DC/monocyte 的细分类框架。当前公开图可以支持:多套 DC/monocyte marker program 在不同 gate 中呈现方向差异;discovery 与 deeper 的采样目的会改变 program 分布;同一矩阵中的第二套 marker 能对部分方向提供一致性检查。
当前图不能支持完整 DC1-DC6 逐细胞 taxonomy,也不能替代原文的实验验证。AS DC 在本文中指 AXL/SIGLEC6 相关连续 program 与 gate 对照,不能延伸成功能结论。FACS gate 仍保留为实验来源,set 仍保留为采样阶段,cluster 仍保留为无监督结构。
项目级复用方式
这套证据链适合流式分选单细胞项目。报告可以先给出每个 gate 的观察数量,再展示程序中位数和 held-out 一致性,随后标记哪些 gate 存在混合方向。这样研究者能看到实验入口与转录信号的对应程度,也能明确哪些问题需要回到蛋白层、外部参考或更多样本。
若继续深入,可在 AXLSIGLEC6、CD1C、pDC 和 monocyte gate 内分别做子集表达趋势,比较 assignment 与 held-out panel 的相关性;也可在 discovery 与 deeper 内分开构建邻居图,观察某个方向是否依赖定向采样。新的分析仍需公开 matrix 层级、基因面板、统计单位和未赋值规则。
矩阵与标签边界
本文的连续分数不是跨数据集概率,gate 中位数不是群体频率,set 差异不是 donor 差异,plate 也不自动等于 batch 校正单位。每个量都只能在其生成层级中解释。公开 matrix 可以展示表达结构,但无法补齐 donor、受控 reads 和原文实验验证。
读者若将这套结果用于私有样本,应重新建立 QC、样本和 donor 层级,不能直接套用分数阈值。marker 需要根据物种、组织、平台和研究问题重新确认;同矩阵一致性只能作为内部审查的一部分,不能替代独立验证。
结论
Villani GSE94820 的 2,294 个公开细胞可以支持一条清晰的证据链:FACS gate 提供分选来源,连续 program 展示表达方向,观察细胞数核对公开采样结构,discovery/deeper 汇总揭示定向设计的影响,第二套 marker 提供同矩阵一致性检查。
当前证据不输出确定身份数量、身份组成或外周血自然频率。它也不把高分对象命名为确定细胞类型。对免疫细分数据,保留来源层级和未赋值状态,能让后续实验验证、外部映射和 donor 级分析有明确的接入口。