科学更正(2026-07-19): 早期页面曾使用五组 marker score,并把每个细胞分给得分最高的一组。这套做法混用了神经元和胶质相关细胞,也把缺少正向 marker 支持的细胞强制赋予了功能标签。相关五类数量及其图表已撤回。本文现从公开矩阵的分母、神经元筛选、原论文 11 类和现代 DRG 分类对照展开分析,并明确保留现有材料无法确定的部分。
Usoskin 等人在 2015 年发表的 DRG 单细胞研究,长期被用来解释疼痛、瘙痒、温度、机械感觉和本体感觉相关神经元的分子异质性。十多年后再读这篇论文,困难已经发生变化:公开矩阵还能计算,经典 marker 也大多找得到,但原文的 NF、NP、PEP、TH 命名与今天常见的 marker-based taxonomy 并不完全重合。若直接把现代名称套回旧数据,容易制造一份看似精细、证据却不稳的注释表。
这类复现的起点不在 UMAP 参数。需要先确认三个问题:公开表中的一个孔位代表什么,哪些孔位有足够证据进入感觉神经元分析,原论文和现代图谱的标签能否逐一对应。只要这三步含糊,后面的亚型比例、marker 热图和功能叙述都会失去可靠分母。
本文重新分析 GSE59739 的公开 DataTable,并对照以下文献:
- Usoskin et al., 2015, Nature Neuroscience:10.1038/nn.3881
- Sharma et al., 2020, Nature:10.1038/s41586-019-1900-1
- Nguyen et al., 2021, eLife:10.7554/eLife.71752
- Bhuiyan et al., 2024, Science Advances:10.1126/sciadv.adj9173
- Yu et al., 2024, Nature Neuroscience:10.1038/s41593-024-01794-1
先把 799、622 和 591 分开
GSE59739 的公开 DataTable 在表达矩阵前保留了四行 metadata,其中 Content 标记了孔位内容。筛选 Content=cell 后得到 799 个孔位。Usoskin 原论文用于感觉神经元分类的数量是 622。两者差了 177 个,说明“公开表中标记为 cell”与“作者最终纳入分类的神经元”属于两套筛选口径。
本文没有把 799 直接当成 799 个感觉神经元。我们先计算泛神经元基因组,包括 Snap25、Syt1、Tubb3、Rbfox3、Elavl3/4、Prph、Scn9a/10a、Isl1 和 Pou4f1;同时计算 Sox10、Mpz、Plp1、S100b、Mbp、Scn7a 等非神经元或胶质相关信号。随后在这两个分数构成的空间中拟合三分量混合模型。按最大 posterior 直接取分量时,591 个孔位进入 neuron-like,63 个进入 glial-like,145 个进入 low-information;这个口径没有 unassigned 类别。

图 1。左图分别列出公开 DataTable 的 799 个 cell wells、原论文报告的 622 个神经元和本文 GMM 归入 neuron-like 分量的 591 个孔位;右图展示泛神经元与胶质相关 marker 分数。三个数字来自不同口径,不能互相替代。
591 与 622 相差 31 个。这个差值不能通过调阈值“补齐”。原论文的 622 来自作者掌握的完整实验记录、质量控制和分类流程;公开 DataTable 只保留有限 metadata,本文也没有作者最终细胞清单。145 个 low-information 孔位中可能包含表达信息较弱的神经元,也可能含有其他质量不足的孔位。把其中 31 个挑出来,只会让总数接近论文,不会增加身份依据。
图 1 因此承担的是分母审计。它不提供最终细胞类型,只说明后续哪些细胞可作为较可信的神经元候选,哪些细胞需要留在不确定区。对旧的 plate-based 单细胞数据,这一步尤其重要:一个孔位被记录为 cell,只能说明孔里有细胞材料,不能自动推出该孔位满足神经元亚型分析的要求。
公开表属于 processed expression,能做什么
本文使用的是 GEO 提供的 processed normalized expression table,没有从 FASTQ 重新比对,也没有原始 UMI count。分析可以支持表达模式复查、marker 共现、无监督结构和历史分类对照;它不适合照搬 droplet scRNA-seq 的常规 QC 模板。
例如,线粒体比例阈值、Scrublet 双细胞评分和基于原始 UMI 的 library-size 建模都依赖相应输入。对已经处理过的表达表机械套用这些步骤,会给结果增加一层虚假的“标准化感”。本文保留公开表中 Content、Sex 等有限 metadata,使用泛神经元与胶质 marker 分数做区室审计,并把所有低维结构视作探索性结果。
同样,当前材料无法完整复刻作者当年的聚类模型。本文引用原论文补充表中的 11 类数量,明确标记为作者报告结果;本文重新计算的无监督 cluster 只用于检查公开矩阵还保留了哪些表达轴,不会冒充原文标签。
先分离神经元、胶质相关和低信息孔位
如果把 799 个孔位一起放进感觉神经元亚型竞争,Sox10、Mpz、Plp1 高表达的胶质相关细胞也会被迫得到某个神经元名称。早期页面曾把 Schwann/glial-like 列为五个“功能状态”之一,随后又与 nociceptor、pruriceptor 等神经元标签并列比较。细胞区室和神经元亚型属于两个层级,前者应先完成。

图 2。左侧显示 neuron-like、glial-like 与 low-information 三个区室;右侧显示混合模型对所属分量的置信度。该图用于筛选分析对象,不用于命名感觉神经元亚型。
图 2 中,glial-like 细胞形成相对集中的区域,说明胶质相关表达信号能够被单独识别。low-information 孔位分布更散,其中一部分靠近 neuron-like 区域。我们没有把这些边缘孔位全部删除,也没有将其纳入后续亚型解释;它们保存在全细胞对象中供检查。这样做会减少可用于神经元分析的细胞数,却能避免用一个不确定孔位制造确定标签。
这套分量划分仍有局限。混合模型依赖预先选定的泛神经元和胶质 marker,并且会为每个孔位选择一个分量;表达较弱的真实神经元可能落入 low-information,受损细胞也可能改变 marker 分数。591 个孔位只作为后续 marker 分析的操作性子集,无法代替作者 QC,也不能视为新的 DRG 参考分类器。
为检查这个操作性分区对置信阈值是否敏感,我们把最大 GMM posterior 低于阈值的孔位改记为 unassigned。阈值从 0.5 提高到 0.9 时,unassigned 从 3 个增加到 119 个;在 0.8 阈值下,得到 553 个 neuron-like、53 个 glial-like、115 个 low-information 和 78 个 unassigned。这个结果说明 591 不是稳定不变的生物学数量,只是无拒绝规则下的分量计数。

图 8。不同最大 posterior 阈值下三个操作性分量和 unassigned 的孔位数。阈值分析用于公开不确定性,不把任一阈值对应数量解释为经验证的感觉神经元身份。阈值越严格,进入后续 marker 分析的细胞越少,结论也应同步收窄。
GMM 的 591 个 neuron-like 分量细胞保留了怎样的结构
在 591 个 neuron-like 细胞中,我们重新选择高变基因,计算 PCA、邻近图、UMAP 和 Leiden 聚类,共得到 7 个无监督 cluster。此处的 cluster 编号只表示表达相似性,不附带功能名称。

图 3。591 个 neuron-like 细胞按 Leiden cluster 和 Sex 展示。cluster 用于组织 marker 证据;Sex 图用于检查主要结构是否被单一性别完全驱动。
这张图可以读出两点。公开 processed 矩阵仍保留较清楚的神经元内部结构,说明它有条件支持历史 marker 轴的复查。UMAP 的空间距离没有给出 NF、NP、PEP 或现代亚型名称,7 个 cluster 也没有被直接改写成感觉功能类别。低维嵌入会受到高变基因选择、邻居数、随机种子和数据处理方式影响;同一 cluster 内可能混有多个分子分支,彼此相邻的 cluster 也可能具有不同功能。后续命名必须回到成组 marker、作者分类、外部参考和映射置信度。
Sex 着色没有显示某一个大 cluster 完全由单一性别构成,但这不等于已经完成性别差异分析。GSE59739 的样本规模、实验设计和公开 metadata 都不足以在本文中建立稳健的 sex-specific subtype 结论。保留这张图只为检查明显混杂,不用于额外扩展故事。
用原文 marker 轴检查 7 个 cluster
下一步把原论文相关 marker 按生物学分支组织到 dotplot 中。这里采用的是“先看成组表达,再决定能否描述”的顺序。Nefh/Ntrk2/Ntrk3/Pvalb/Spp1 用于观察历史 NF 和有髓机械感受/本体感觉相关轴;Th/Fam19a4/Gfra2 对应 TH cLTMR 方向;Mrgprd/Lpar3/Tmem233 对应 NP1;Mrgpra3/Crip1/Trpv1 用于检查 NP2 相关信号;Nppb/Sst/Il31ra 指向 NP3/瘙痒相关分子群;Tac1/Calca/Adcyap1/Ntrk1 覆盖 PEP 相关伤害感受轴,Trpm8 单独提示冷感受方向。

图 4。dotplot 按 7 个无监督 cluster 汇总历史分类相关 marker。点大小表示表达细胞比例,颜色表示标准化后的平均表达。cluster 编号没有直接转换成正式亚型名。读图时需要同时检查同一分支的多个marker,并留意旧平台表达稀疏造成的未检出现象。
cluster 0 的 Mrgprd 程序最突出,同时可见部分 Mrgpra3-related 和 Sst-pruriceptor 相关信号。它支持一个以非肽能伤害感受轴为主的群体,但内部仍可能混合 NP1、NP2、NP3 相关细胞。仅凭当前分辨率把整个 cluster 命名为 Mrgprd nociceptor,会压掉其中较小的瘙痒相关分支。
cluster 2 以 Ntrk2/Ntrk3、Nefh 等有髓感觉神经元相关表达为主,cluster 5 的 Pvalb/Runx3/Etv1/Ntrk3 程序更强。两者共同说明历史 NF 大分支仍能在公开矩阵里看到,同时也解释了为什么早期页面把 mechanoreceptor 和 proprioceptor 合成一类会丢失信息:Pvalb 本体感觉神经元与 Ntrk2/Ntrk3 A-fiber LTMR 在现代分类中属于需要分开的方向。
cluster 1、3 和 4 都带有不同程度的 Th/Fam19a4/Gfra2 程序,提示 TH cLTMR 相关分支在当前无监督参数下被分散到多个 cluster。cluster 4 同时出现较高的 Trpm8 程序和部分 Sst 相关信号,说明单个 cluster 仍可能容纳多个细分亚型,或受到旧平台表达稀疏与聚类分辨率的影响。
cluster 6 的 Tac1/Calca 伤害感受程序最强,同时有 Trpm8 和 Mrgpra3-related 信号。它大致落在历史 PEP 相关方向,但 PEP1、PEP2 及现代 Calca、Trpm8 等细分群之间不能在缺少作者标签或可靠 reference mapping 的情况下直接画等号。
这段解读刻意停留在 marker 轴。dotplot 能够说明哪些基因成组出现、哪些群体值得进一步拆分;它不能给出电生理响应、皮肤支配区域、轴突投射或行为功能。Nppb/Sst/Il31ra 支持瘙痒相关分子身份,功能性 pruriceptor 仍需刺激实验和既有功能文献共同支撑。
连续 marker program 用于定位线索,不生成强制标签
为了减少单基因表达稀疏造成的误判,我们又计算了八组连续 marker program:Pvalb proprioceptor、Ntrk2/Ntrk3 LTMR、Th cLTMR、Mrgprd nociceptor、Mrgpra3-related、Sst pruriceptor、Tac1/Calca nociceptor 和 Trpm8 thermoreceptor。每组分数来自多个 marker 的标准化平均表达。

图 5。八组 marker program 在 neuron-like UMAP 上的连续分布。颜色用于显示表达倾向,没有执行 winner-takes-all 赋值,也没有输出各现代亚型的细胞数。
program 图比单个 feature plot 稳定,也减少了强制分类。它显示 Mrgprd、Pvalb、Tac1/Calca 等程序占据不同区域,同时保留过渡和重叠。重叠可能来自真实共表达、细胞状态、旧平台检测限制、双细胞或程序设计不够特异,不能统一解释成“连续谱”。现代 DRG 图谱已经支持多个离散的转录组亚型,表达程序之间仍可共享部分基因,这两件事可以同时成立。
本文没有为 591 个细胞逐个分配现代亚型。可靠的 label transfer 需要明确的参考对象、同物种和组织层级匹配、可复核的特征空间,以及每个预测标签的置信度。当前工作只有文献中的 marker 和名称对照,没有获得可直接用于映射的标准 reference object。此时输出一张完整现代标签表,会让版面更丰富,却无法回答标签是否可靠。
回到 Usoskin 2015:原论文报告的是 11 类
Usoskin 原文将 622 个神经元组织为 NF1-NF5、NP1-NP3、PEP1-PEP2 和 TH,共 11 类。根据补充表,数量分别为:NF1 31、NF2 48、NF3 12、NF4 22、NF5 26;NP1 125、NP2 32、NP3 12;PEP1 64、PEP2 17;TH 233,总计 622。

图 6。根据原论文补充表整理的 11 类数量。该图复述作者结果,不代表本文对 591 个 neuron-like 细胞重新赋予了这些标签。
这组数量也提醒我们,2015 年的命名体系有明确历史语境。NF 指 neurofilament-rich 分支,其中包含多种有髓低阈值机械感受和本体感觉相关神经元;NP 指 non-peptidergic 分支;PEP 指 peptidergic 分支;TH 群以 Th 等 marker 为特征。它们帮助早期研究把 DRG 从少数大类推进到单细胞分子分类,对后续工作影响很大。
读者留言所说“亚型太古老”,指出的是命名更新问题。今天的 DRG 注释通常会结合更多细胞、更高检测深度、跨研究整合和功能证据,将原来的大分支继续拆细。旧分类仍可作为文献史和数据来源的参照,但不宜直接作为 2026 年项目的终点标签。
从历史 11 类到现代 taxonomy,哪些关系较稳
历史命名与现代命名之间只能做保守对照,不能把整组标签批量替换。下表总结当前文献下较可辩护的方向:
| 历史分组 | 代表 marker | 现代分类中的大致方向 | 需要保留的边界 |
|---|---|---|---|
| NF1-NF5 | Nefh、Ntrk2、Ntrk3、Pvalb、Spp1 | Pvalb proprioceptor、Ntrk2/Ntrk3 A-fiber LTMR、部分 Calca Aδ HTMR | 五个 NF 类没有统一的一对一现代名称 |
| NP1 | Mrgprd、Lpar3、Tmem233 | Mrgprd nociceptor | 属于相对稳定的分子对应关系,跨研究仍要核对 marker panel |
| NP2 | Mrgpra3、Calca | Mrgpra3-related 瘙痒感受/伤害感受方向,常需结合 Trpv1 等共表达 marker 复核 | Mrgprb4 指向另一支 cLTMR 相关分子方向,不能据此把 Mrgpra3 群体归入 cLTMR |
| NP3 | Nppb、Sst、Il31ra | Sst pruriceptor | 分子身份支持瘙痒相关方向,功能名称仍需实验依据 |
| PEP1-PEP2 | Tac1、Calca、Ntrk1、Trpm8 | 多个 Calca nociceptor 和 Trpm8 thermoreceptor 亚型 | 现代图谱在历史 PEP 分支内解析出更多亚型 |
| TH | Th、Fam19a4 | Th cLTMR | 分子分类、支配靶点和生理性质需要平行核对 |
Bhuiyan 等在 2024 年整合多套小鼠 DRG 单细胞数据,提出协调后的分子命名框架,区分 proprioceptor、A-fiber LTMR、C-LTMR、nociceptor、pruriceptor 和 thermoreceptor 等多个亚型。这个框架也提醒我们,Mrgpra3 相关瘙痒感受方向需要结合共表达 marker 继续细分;Mrgprb4 所代表的 cLTMR 相关分支应单独处理,两者不能因为同属历史 NP/小直径感觉神经元语境就合成一个现代亚型。
现代人 DRG 研究又增加了物种边界。Nguyen 等和 Yu 等的工作显示,人类感觉神经元在保留部分大分支的同时,具体 marker 组合、亚型丰度和功能对应并不等同于小鼠。Bhuiyan 等协调六个物种后提出的 18 个共享分子类,以及 Yu 等通过人 DRG 单胞体深度 RNA 测序报告的 16 个感觉神经元类型,都不能直接套在这 591 个小鼠孔位上。跨物种映射需要同源基因、参考数据、预测置信度和功能文献共同参与。
因此,本文对现代 taxonomy 的使用方式是检查 marker program 和命名边界。我们可以说公开矩阵仍看到 Pvalb、Ntrk2/Ntrk3、Th、Mrgprd、Sst、Tac1/Calca、Trpm8 等方向;现有证据还不足以报告每个现代亚型的精确数量。
五组最高分分类为什么会产生误导
早期页面曾设置五组 signature,然后用每个细胞的最高分决定标签。这个步骤没有设置最低分、第一名与第二名的差值、神经元预筛选或 unassigned 类别。只要某个分数比另外四个略高,即使五个分数全部不高于零,细胞仍会得到一个名称。
核对早期页面所用对象后,799 个细胞中有 163 个细胞的五组最高分仍不高于零,却被强制分类。早期页面给出的 170 个 pruriceptor-like 细胞中,有 153 个细胞五组分数全部不高于零。这个数量无法支持“170 个瘙痒感受相关细胞”的公开结论。

图 7。早期页面标注的 170 个 pruriceptor-like 细胞中,153 个细胞的五组 signature 均无正向得分。该图说明相关数量为何撤回。
旧 panel 还有两个结构性问题。其一,mechanoreceptor/proprioceptor 组混合了 Pvalb 本体感觉、Ntrk2/Ntrk3 A-fiber LTMR 和 Th C-LTMR 等不同方向。其二,pruriceptor panel 把 Nppb、Il31ra、Mrgpra3 和 Mrgprb4 放在同一组,混合了 Mrgpra3 瘙痒感受相关方向、Sst/Nppb 相关群体和 Mrgprb4 cLTMR 相关分支。
另外,早期页面曾先用 marker score 生成标签,再用同一批 marker 的 dotplot 证明标签合理,形成了证据循环。dotplot 在这种设计里只能复述评分规则,无法提供独立验证。本文现将无监督 cluster、历史 marker 轴、连续 program、作者 11 类计数和现代文献对照分开,读者可以看到每一步各自支持什么。
公开矩阵能回答到哪里
当前结果支持以下判断:
- GSE59739 的公开 processed 表仍保留清楚的感觉神经元表达结构,适合做历史分类和 marker 轴复查。
- 799 个
Content=cell孔位不能全部视为作者最终分类的神经元;本文的三分量 GMM 将其中 591 个归入 neuron-like 分量,这只是操作性分析子集。 - 原论文 622 个神经元和 11 类数量可以从补充材料确认,但公开表缺少足够信息,无法把本文这 591 个细胞可靠恢复成作者逐细胞标签。
- Pvalb、Ntrk2/Ntrk3、Th、Mrgprd、Sst/Nppb、Tac1/Calca、Trpm8 等分子方向在公开矩阵中仍可观察。
- UMAP、dotplot 和 marker program 支持分子表达线索,不能代替电生理、刺激响应、投射靶点和行为实验。
以下结论没有被当前分析支持:旧五类的任何细胞数量;把 mechanoreceptor 与 proprioceptor 合成一个现代亚型;把全部 Mrgpra3 相关细胞都解释为 pruriceptor;把 591 个孔位强制映射到跨物种协调的 18 类或 Yu 等报告的人 DRG 16 类;根据表达矩阵推断具体疼痛、瘙痒或机械刺激功能。
若继续深挖,下一步需要哪些材料
要恢复作者逐细胞标签,需要从原始补充材料、处理脚本或可追溯的 cell ID 对照中找到 622 个神经元的最终清单,以及 NF1-NF5、NP1-NP3、PEP1-PEP2、TH 的逐细胞归属。有了这层信息,才能直接比较原文分类在本文 UMAP 和现代 marker panel 中的表现。
若目标转向现代 reference mapping,还要选定与小鼠 DRG、年龄、解剖部位和测序层级相匹配的参考对象,完成共同基因处理、标签迁移、置信度评估和 marker 复核。低置信度细胞应保留为 unassigned 或 broad class,不应为了生成完整饼图而强行分配。
涉及瘙痒、疼痛、温度或机械刺激时,还要把转录组亚型与刺激响应、电生理、皮肤支配区域、示踪或行为学研究放在一起。分子 marker 给出候选身份,功能实验决定名称能写到多具体。
对于自己的 DRG 项目,较稳妥的交付顺序通常是:先完成神经元与非神经元区室审计,再给出 broad molecular branch,随后做 reference mapping 和置信度分层,功能名称则与实验设计对齐。每一级都应保留所用 marker、参考来源和无法判断的细胞。这样得到的注释表可能不会覆盖 100% 细胞,却更适合进入论文方法、补充表和后续实验设计。
小结
Usoskin 2015 仍是理解 DRG 单细胞分类史的重要数据集。它记录了感觉神经元从少数功能大类走向分子亚型的关键阶段,也提供了 NF、NP、PEP、TH 这套后来被不断细化的框架。今天复现这组数据,需要同时尊重原论文的 11 类结果和现代 taxonomy 的更新,不能用一套粗 signature 覆盖两者。
早期页面发布的五类数量已撤回。本文用三分量 GMM 将 799 个公开孔位划为 591 个 neuron-like、63 个 glial-like 和 145 个 low-information,随后在 neuron-like 分量中展示 7 个无监督 cluster、历史 marker 轴和现代 marker program,并把原论文 622 个神经元的 11 类计数单独列出。现有公开矩阵支持感觉神经元分子异质性和若干稳定 marker 方向;现代精细亚型、跨物种名称和功能归属仍需要可靠参考与独立实验依据。