单细胞转录组数据质控实战:如何用Seurat精准过滤低质量细胞(附完整代码)
单细胞转录组测序技术正在重塑我们对复杂组织的认知方式。想象一下,您手中握着一份来自肿瘤微环境的单细胞数据,每个数据点都代表着一个独特的细胞故事。但在这份珍贵的样本中,可能混杂着凋亡细胞、双细胞(doublets)以及低质量捕获的细胞。如何从数万个细胞中精准识别并剔除这些"噪音",将直接影响后续分析的可靠性。
1. 质控指标的科学解读
单细胞数据质控的核心在于理解三大关键指标的内在含义及其相互关系。这些指标不是孤立的数字,而是反映细胞状态的生物信号。
1.1 基因检出数(nFeature_RNA)
每个细胞检测到的基因数量是衡量数据质量的首要指标。理想情况下,健康细胞的基因检出数应该处于合理范围内:
# 查看基因检出数分布
summary(pbmc@meta.data$nFeature_RNA)
- 过低值(<200):可能来自破裂细胞的游离RNA或死亡细胞
- 过高值(>5000):往往提示双细胞污染
- 典型范围:200-5000(需根据实验体系调整)
1.2 分子计数(nCount_RNA)
每个细胞检测到的总UMI数反映文库大小,与细胞活性直接相关:
| 细胞状态 | nCount_RNA特征 | 生物学意义 |
|---|---|---|
| 健康细胞 | 中位数±2MAD | 正常转录活性 |
| 低质量细胞 | <500 | RNA降解或捕获失败 |

&spm=1001.2101.3001.5002&articleId=155126729&d=1&t=3&u=712ba8edad0049dcb7ebbf5e647aebb3)
155

被折叠的 条评论
为什么被折叠?



