科学审计更正(2026-07-19):早期页面曾把rod、ON、OFF和cone相关marker的最高分写成离散细胞身份,并报告各类计数与前缀组成。这些结果已经撤回。本文现将6,000个抽样细胞全部保持为未赋值状态。top score与top-two margin只用于观察程序分离。另一组marker只做同矩阵一致性检查。Bipolar1至Bipolar6只是文件前缀,不能当作6只动物或6个独立样本。
Shekhar et al.的GSE81904是视网膜双极细胞分类研究中的经典公开数据。经典不等于可以用更简单的规则重新命名。原论文的精细亚型来自大规模转录组结构、marker组合以及既有视网膜分类知识;当前复现使用公开UMI矩阵的均衡抽样,能够检查几条主要表达程序,却不足以重建完整亚型树。
本文把问题限定为“当前marker面板能读到哪些连续方向”。rod相关、ON相关、OFF相关和cone相关程序可以同时出现在相邻细胞中。没有作者逐细胞标签、外部参考映射和可靠生物重复时,最高分不能转成最终注释。
论文、数据和抽样边界
- 论文:Shekhar et al., Cell, 2016
- DOI:10.1016/j.cell.2016.07.054
- 公开数据:NCBI GEO GSE81904
- 输入层:公开BipolarUMICounts表
- 分析细胞:6,000
- 过滤后基因:14,625
- 抽样方式:Bipolar1至Bipolar6各抽取1,000个细胞
- 无监督Leiden cluster:15
原始公开矩阵约有4.5万个细胞列。本次均衡抽样降低计算规模,也主动改变了各前缀在分析对象中的比例。因此正文不能从6,000个细胞推回全数据集的亚型比例。Bipolar1至Bipolar6来自文件命名,现有字段没有证明它们对应动物、独立样本或实验重复。
公开UMI表比RPKM等连续矩阵更接近count层,但它仍不是FASTQ。比对、barcode处理、UMI去重、doublet判断和原文分类模型不能从当前文件完整恢复。

图:公开矩阵规模、Bipolar1至Bipolar6前缀及本次均衡抽样的关系。6,000个分析细胞来自人为设定的等量抽样,图中的前缀数量不能解释为动物数、样本数或真实亚型丰度。
这张概览把计算分母与生物分母分开。均衡抽样有助于避免某个文件前缀主导嵌入结构,但也抹去了原始列数差异。后文只讨论marker程序和无监督cluster,不从抽样后的前缀比例推断视网膜中的细胞组成。
marker程序不等于精细双极细胞taxonomy
双极细胞的ON/OFF功能分类与rod/cone输入关系不能简化成四个完全互斥的类别。rod bipolar属于ON通路,许多ON通路基因会同时出现在rod bipolar和ON cone bipolar中。当前marker程序只提供表达轴,不能直接复刻原文全部BC subtype。
这里需要单独说明TRPM1。TRPM1参与ON双极细胞的光信号转导,rod bipolar和ON cone bipolar都可表达相关通路。**TRPM1不用于区分rod与ON。**它只能支持ON通路程序;区分rod bipolar与ON cone bipolar需要更完整的marker组合、作者标签和其他证据。若把TRPM1同时作为rod与ON竞争规则中的决定性marker,分类会出现循环和重叠。
OFF程序也有明显限制。最新第二marker面板的一致性为负,说明当前OFF marker拆分在这批抽样数据中没有形成稳定同向结果。文章因此不报告OFF细胞数,也不把某个cluster直接命名为OFF bipolar subtype。
图1:最高分与margin只显示分离程度

图1左侧是6,000个细胞最高连续程序分数的分布,右侧是最高分与top-two差值。数据集中有一批细胞的最高分较低,也有大量细胞的两个候选程序接近。这个结构符合双极细胞marker重叠和表达稀疏的情况。
分数来自当前数据集内部标准化,没有外部概率校准。margin大只说明当前四个程序中某一方向相对突出,不能证明它对应原文中的确定亚型。本文不设定内部z-score阈值生成身份,6,000个细胞统一保留为未分配。
图2:嵌入只展示最强程序分数

图2在低维空间中显示最高连续分数。若干局部区域出现高分,说明预设marker在这些区域更集中;大面积中低分区域说明程序信号较弱或存在重叠。图中没有rod、ON、OFF、cone的分类颜色,也没有画出细胞类型边界。
这种表示保留了“当前面板有多确定”的信息。早期页面的硬标签曾让每个点看起来都已经命名,并据此计算前缀组成;相关图和组成结果已撤回。图中不提供这类计数入口,只显示程序强度。
图3:分开marker面板暴露OFF程序问题

两组marker分数之间的Spearman相关显示:rod program约0.55,ON program约0.52,cone program约0.25,OFF program约-0.12。rod和ON达到中等一致性,cone偏弱,OFF没有获得同向支持。
这个结果不应被写成四个身份中的两个“验证成功”。两组marker都来自同一个UMI矩阵,也都依赖预设基因知识。它们只能说明程序内部是否一致。OFF的负相关要求降低结论强度,后续需要重新核对marker定义、物种基因符号、抽样覆盖和作者亚型标签。
TRPM1也不能拿来解决rod与ON的分离问题。它对两者共享的ON通路有信息,缺少区分性。一个基因具有生物学相关性,不代表它适合作为两个近邻类别的判别特征。
图4:没有生物重复时,只汇总无监督cluster

当前metadata无法确认动物或独立样本,图4只按15个Leiden cluster汇总连续程序。cluster 7和11的OFF分数较高,cluster 0与2的rod/ON方向相对上移,cluster 4、5、12、13呈现不同程度的cone或ON信号。它们是表达区域摘要,不是亚型命名结果。
Leiden cluster由同一表达矩阵产生,不能作为生物重复。图4也不能用于总体显著性检验。它的用途是发现哪些无监督区域值得引入作者标签或外部参考进一步核对。
为什么前缀组成已经撤回
Bipolar1至Bipolar6各抽取1,000个细胞,这个均衡是人为抽样结果。前缀又没有被验证为动物或样本。按前缀统计rod、ON、OFF或cone比例,会同时混入抽样设计和未知文件含义,无法形成生物组成结论。
即使未来确认前缀对应不同实验批次,也需要先知道每个动物、样本和批次的嵌套关系。细胞数不能替代动物数。本文只保留前缀作为数据来源字段,不再把它带入组成和统计段落。
进一步复刻原文亚型时,还应核对每个细胞与作者BC subtype的对应关系,并分别报告可映射、冲突和无法映射的比例。rod bipolar、ON cone bipolar和OFF cone bipolar需要在子集内使用成组marker审校,不能依赖单个通路基因。缺少动物层metadata时,任何亚型丰度差异仍只能停留在公开矩阵描述。
与原论文的对应范围
原论文建立了更精细的视网膜双极细胞分类框架。本文的rod、ON、OFF和cone program是保守的表达轴,用于检查公开矩阵是否仍保存相关信号。它们没有逐一对应原文亚型,也没有恢复形态、电生理或解剖位置证据。
rod和ON程序达到中等marker一致性,说明相关表达轴可读;这不等于二者已经被清楚分开。cone程序一致性较弱,OFF程序还出现负相关。公开写作必须保留这些差异,不能只展示最高分嵌入后宣称主要亚型已恢复。
进一步复刻亚型需要的证据
第一步是引入原文或官方逐细胞subtype metadata,并核对cell ID能否可靠映射。第二步是使用完整矩阵,避免均衡抽样改变亚型覆盖。第三步是为相近类别选择具有区分力的marker,明确区分“通路相关基因”和“分类判别基因”。第四步是报告无法映射、冲突和低置信细胞。
若要比较动物或实验条件,还必须获得可靠sample ID。没有生物重复时,可以描述cluster内程序,不能做群体推断。若要讨论ON/OFF功能,也需要把转录程序与已知生理或形态证据连接起来。
从项目设计看,下一步应先把公开矩阵中的cell ID与原论文亚型表逐一对齐,确认哪些细胞能够恢复作者标签,哪些发生冲突,哪些缺少记录。完成映射后,再分别检查rod bipolar、ON cone bipolar和OFF cone bipolar的成组marker。任何低置信映射都应保留未分配状态,不能为了得到完整比例而强行归类。
动物、视网膜和建库批次的层级也需要单独恢复。均衡抽样虽然便于计算,却改变了各文件前缀的原始权重;即使某个程序在抽样对象中更常见,也不能据此推断组织丰度。只有获得可识别的生物重复,才适合比较亚型组成、程序中位数或条件差异,并在动物层报告效应量和不确定区间。
硬标签流程的科学风险
最高分会强迫所有细胞进入四选一,即使四个程序都低。TRPM1等共享通路基因又会加重rod与ON的重叠。随后使用参与构建程序的marker画图,只能证明规则按预期运算。再按未知前缀计算比例,最终数字会显得精确,来源却不可靠。
新流程保留top score和margin作为诊断,公开第二marker面板的一致性强弱,并把所有身份留为未分配。OFF程序的负相关被写进正文,没有通过命名技巧掩盖。
结论审计
| 判断 | 当前证据 | 写作边界 |
|---|---|---|
| rod与ON相关连续程序可读 | 两组marker中等一致性 | 支持程序描述 |
| cone相关程序存在 | 一致性较弱 | 仅探索性 |
| OFF程序稳定恢复 | 第二marker面板负相关 | 不支持 |
| TRPM1区分rod与ON | 两者共享ON通路 | 不使用 |
| 6个前缀代表6个生物重复 | 缺少可靠metadata | 不支持 |
| 原文精细subtype已复刻 | 无作者逐细胞标签 | 不支持 |
小结
GSE81904的6,000个抽样细胞保留了rod、ON、OFF和cone相关表达方向,但当前marker面板无法把这些方向安全地转换成离散身份。所有细胞均为探索性、未分配记录。rod和ON的第二marker一致性中等,cone偏弱,OFF为负;TRPM1只支持ON通路,不承担rod与ON的区分。
由于Bipolar1至Bipolar6只是文件前缀,本文不再报告前缀组成或亚型比例。后续要恢复原文taxonomy,需要完整矩阵、作者标签、区分性marker和可靠生物重复。