科学更正(2026-07-19):早期页面曾把9个Leiden cluster的最高免疫marker分数写成B、T、NK、monocyte等离散身份,再把1,704个细胞映射成组成比例;相关身份和比例结论已撤回。本文现保留9个无监督cluster、1,704个进入分析并映射到cluster程序摘要的细胞,以及6只可识别小鼠;三类数字含义不同。全部细胞均保持未赋值状态。monocyte程序未被稳定恢复,正文不再声称存在确定monocyte群。
Tabula Muris覆盖多个小鼠器官和测序策略。本文只处理GSE109774中的脾脏SmartSeq2/FACS附件。这个子集的难点不在下载一个现成对象,而在于把1,718个单细胞CSV按基因对齐,重建cell、mouse和sex字段,再判断公开文件能够支持多细的免疫解释。
把cluster最高marker分数转换成细胞身份,会让每个cluster都在winner-take-all规则下得到一个名字,低证据区域也会被计算进组成比例。B、T和NK程序在这批数据中相对清楚,髓系程序则弱得多。本文保留连续程序和小鼠级摘要,不发布离散身份比例。
论文和数据来源
- 论文:Tabula Muris Consortium, Nature, 2018
- 题名:Single-cell transcriptomics of 20 mouse organs creates a Tabula Muris
- DOI:10.1038/s41586-018-0590-4
- PubMed:PMID 30283141
- 公开数据:NCBI GEO GSE109774
- 脾脏附件:GSE109774_Spleen.tar.gz
附件包含1,718个单细胞CSV。每个文件记录一个细胞的feature count,需要按gene名称对齐后拼接。基础QC保留1,704个细胞和13,678个过滤后基因。文件名可解析6只小鼠及sex信息,雄性来源细胞1,080个,雌性来源细胞624个。
三个分母必须分开
| 层级 | 数量 | 能回答的问题 |
|---|---|---|
| 无监督Leiden cluster | 9 | 表达空间中有多少个计算区域 |
| mapped cells | 1,704 | 有多少QC后细胞被映射到cluster级连续程序摘要 |
| mouse | 6 | 生物来源层面的最小比较单位 |
9个cluster不是9种细胞类型。1,704个mapped cells表示细胞进入了cluster程序分析,不表示1,704个细胞获得了可靠身份。6只小鼠才是组成或样本差异的生物单位。文章若把这三个数字写在同一层,就会把计算分区、观察数量和实验重复混为一谈。
CSV拼接和metadata重建
每个CSV理论上含相同feature集合,复现时仍需按gene名称对齐,不能只依赖行号。文件名中的well、mouse ID和sex要在拼接前解析并保存。空文件、低覆盖细胞或基因顺序异常都会影响后续聚类。
SmartSeq2/FACS数据也不能机械套用10x的UMI三件套流程。当前数据以每细胞CSV提供counts,QC应结合总count、检测基因数、离群值和marker结构。本文没有使用官方全量对象,也没有把脾脏子集扩展成全器官atlas。
图1:cluster最高程序分数只作诊断

图1以9个cluster为单位展示最高连续程序分数和top-two差值。部分cluster的B、T或NK相关程序较突出,也有cluster的最高分接近0、候选程序难以区分。内部z-score没有跨数据集校准,不能用一个固定阈值把cluster命名成稳定免疫身份。
这一诊断解释了为何全部1,704个细胞仍然是unassigned。细胞继承cluster的程序摘要,只用于看信号强弱;它们没有获得B cell、T cell或monocyte标签。早期页面由最高分导出的计数和比例不再使用。
图2:嵌入显示程序强度,不显示细胞类型

图2将cluster级最高连续分数映射到1,704个细胞。高分区域提示某些cluster有较集中的免疫marker信号,低分区域提示当前面板覆盖不足或多个程序都弱。颜色只有强度,没有离散身份。
这张图可以帮助定位需要后续注释的区域。例如高分cluster可优先与官方metadata对照,低分cluster则应保留未分配并检查marker缺失。它不能用颜色面积计算脾脏中各类免疫细胞比例。
图3:B、T、NK较一致,monocyte没有稳定恢复

两组marker程序的Spearman相关分别为:T cells约0.80,B cells约0.64,NK cells约0.57;Macrophages约0.25,Monocytes约0.21,Neutrophils约0.20。Erythroid没有足够可用细胞计算相关。
B、T和NK方向具有较清楚的同向结构,可作为broad continuous program描述。髓系几个方向的相关都偏低,特别是monocyte没有形成稳定恢复结果。本文因此只写“存在弱髓系相关信号或待核对cluster”,不声称已经恢复monocyte细胞群,更不报告monocyte数量或比例。
第二marker面板仍来自同一矩阵,只能检查一致性。官方Tabula Muris逐细胞metadata、外部免疫参考映射或独立实验才可提供更强注释依据。
图4:小鼠级摘要与细胞数差异

图4按6只小鼠汇总连续程序中位数。B cell程序在B000971、B001750及部分MAA编号小鼠中有不同水平,其余程序的中位数普遍偏低。热图说明细胞层高分区域在小鼠中并不等价,也提醒我们不要从1,704个细胞直接做性别或总体差异推断。
当前只有少量小鼠,sex与mouse ID也可能关联。1,080个雄性来源细胞和624个雌性来源细胞是采样数量,不是1,080个与624个独立重复。本文不做细胞级性别显著性,也不把某个程序的颜色差异解释为性别效应。
broad程序和官方taxonomy的距离
Tabula Muris官方资源包含更完整的细胞类型注释。本文使用单组织GEO附件,当前程序只覆盖B、T、NK、monocyte、macrophage、neutrophil和erythroid等宽泛方向。它们不等同于官方cell ontology标签。
B cell程序可由Ms4a1、Cd79a、Cd79b、Cd19等方向支持;T cell程序关注Cd3d、Cd3e、Trac;NK程序关注Nkg7、Ncr1、Klrb1c等。monocyte、macrophage和neutrophil之间共享多种髓系marker,低丰度和SmartSeq2检测差异会进一步削弱分离。当前相关系数不足以给髓系cluster稳定命名。
为什么不能写“B/T/NK/monocyte均已恢复”
这个句子会把四个程序写成同等证据。结果显示B、T、NK的一致性明显高于monocyte。若把monocyte与前三者并列,会掩盖约0.21的弱相关,也会让读者误以为有官方标签或外部参考支持。
更准确的公开结论是:B、T和NK相关连续程序在脾脏子集中可读;髓系程序存在候选信号,但monocyte尚未稳定恢复。该边界影响后续图表选择,旧monocyte计数、组成和crosswalk不再引用。
与原论文的对应范围
原论文建立跨20个器官的小鼠单细胞图谱。本文只复现脾脏SmartSeq2/FACS附件的数据整理和broad program结构。它没有执行跨器官整合,也没有逐细胞对齐官方taxonomy。
当前结果可证明1,718个CSV能够重新拼接,1,704个细胞可进入分析,6只小鼠的来源可以恢复,B/T/NK相关程序在表达空间中可见。它不能证明全Tabula Muris已被复刻,也不能给出脾脏真实细胞比例、精细B/T亚型或稳定髓系注释。
后续恢复离散注释的路径
优先步骤是下载官方metadata,以cell ID逐项对齐1,704个细胞,核对缺失和重复。随后可比较官方标签与连续程序,报告一致、冲突和无法映射的细胞。B、T和myeloid子集应分别重聚类,避免一个宽泛marker面板承担所有免疫亚型。
若要比较mouse或sex,需要先确认每组独立小鼠数和技术嵌套关系,再以mouse为单位建立模型。若要描述组织丰度,还要考虑FACS选择、SmartSeq2捕获和QC造成的组成偏差。
旧硬标签流程的问题链
旧流程先在9个cluster中选最高程序,再把cluster名称映射到1,704个细胞,随后按mouse和sex计算比例。这个过程会把cluster边界当身份边界,把弱髓系分数写成monocyte,并让细胞数替代6只小鼠。
本文保留9个cluster作为计算分区,1,704个细胞作为mapped cells,6只小鼠作为生物来源。三个层级分别展示,不互相替代。所有身份保持未分配,直到官方metadata或外部参考提供更强证据。
四张图怎样共同限制结论
图1检查cluster层候选程序能否分开,图2把程序强度放回单细胞表达空间,图3检验另一套marker是否沿同一方向变化,图4回到6只小鼠汇总。任何一张图都不能单独完成注释:高分需要第二套marker支持,同矩阵一致性仍需官方metadata核对,细胞层结构也必须回到mouse层才能讨论样本差异。
这条证据链还解释了为什么保留unassigned。低分cluster、候选方向接近的cluster以及髓系marker冲突区域都保留原状,后续新增官方标签时可以重新核对。若现在把它们填成完整身份,未来只能看到一个整齐的计数表,却无法追溯错误发生在哪一层。
结论边界
| 判断 | 当前证据 | 写作边界 |
|---|---|---|
| 1,718个CSV可重新拼接 | QC后保留1,704个细胞 | 支持 |
| B、T、NK连续程序可读 | 第二marker一致性中等至较高 | 支持描述 |
| monocyte群稳定恢复 | 一致性约0.21 | 不支持 |
| 9个cluster代表9种细胞类型 | 无官方标签对齐 | 不支持 |
| 1,704个mapped cells均有身份 | 全部identity为unassigned | 不支持 |
| 性别或小鼠总体差异 | 仅6只小鼠且设计有限 | 不支持总体推断 |
小结
本文从1,718个脾脏单细胞CSV开始,基础QC后保留1,704个细胞和13,678个基因,得到9个无监督cluster,并恢复6只小鼠的来源字段。cluster最高分不被写成细胞身份,1,704个mapped cells全部保持探索性和未分配。
B、T和NK相关连续程序具有较清楚的一致性,monocyte、macrophage和neutrophil方向较弱,其中monocyte没有稳定恢复。文章现在明确区分cluster数、mapped cells和mouse数,也不再从细胞计数推导性别、组成或组织丰度结论。