ChIP-seq(1): 学习笔记 --ChIP信号富集

这篇博客介绍了如何使用MACS2进行ChIP-seq的下游分析,包括如何获取富集区、理解MACS2的基本参数以及分析结果的文件类型和内容。内容涵盖实验组和对照组的输入、输出文件格式,特别是narrowPeak、xls、summits.bed和bdg文件的用途。

ChIP/RNA-seq数据分析前面的流程都一样,都需要安装一些软件下载基因组和注释文件(非必须,如果有index文件,可省略),做序列对比,。

这个博文主要是针对下游ChIP-seq的分析流程。上一个博客其实已经准备了一点chipseeker(Rstudio上)。后期可能还会有新的RNA-seq学习笔记。之前针对RNA-seq,也做了一次,但是用的是tophat和cufflinks系列,据说比较慢,后期会根据实际情况决定学不学新的方法,学的话继续补充。

可以参考这个RNA-seq分析合集

用MACS2获取Chip-seq富集区
代码参考:ChIP-seq分析流程

conda activate Python  # MASC2一定要在python2环境下使用。
macs2 callpeak -c IgGold.bam -t suz12.bam -q 0.05 -f BAM -g mm -n suz12 &
macs2 callpeak -c IgGold.bam -t cbx7.bam -q 0.05 -f BAM -g mm -n cbx7 &
macs2 callpeak -c IgGold.bam -t ring1B.bam -q 0.05 -f BAM -g mm -n ring1B &
macs2 callpeak -c IgGold.bam -t RYBP.bam -q 0.05 -f BAM -g mm -n RYBP &

在这里插入图片描述
每一条代码执行完都可以得到了类如下面的四个文件:在这里插入图片描述

但是RYBP无peak数据(RYBP_model.r可以用),需要我们手动下载peaks数据

wget ftp://ftp.ncbi.nlm.nih.gov/geo/series/GSE42nnn/GSE42466/suppl/GSE42466_RYBP_peaks_5.txt.gz
gzip -d GSE42466_RYBP_peaks_5.txt.gz
mv GSE42466_RYBP_peaks_5.txt RYBP_summits.bed

MACS2的简要介绍
MACS2分析流程示意图

基本的相关参数: 输入文件参数:
-t:实验组,IP的数据文件
c: 对照组
f:指定输入文件的格式,默认是自动检测输入数据是什么格式,支持bam,sam,bed等
g:有效基因组大小,由于基因组序列的重复性,基因组实际可以mapping的大小小于原始的基因组。这个参数要根据实际物种计算基因组的有效大小。软件里也给出了几个默认的
-g 值:hs – 2.7e9表示人类的基因组有效大小(UCSC human hg18 assembly).

hs: 2.7e9
mm: 1.87e9
ce: 9e7
dm: 1.2e8

输出文件参数

–outdir:输出结果的存储路径

–n:输出文件名的前缀

-B/–bdg:输出bedgraph格式的文件,输出文件以NAME+’_treat_pileup.bdg’ for treatment data, NAME+’_control_lambda.bdg’ for local lambda values from
control显示。

还可以使用Shift 模型参数,比如ATAC-seq关心的是在哪切断,断点才是peak的中心,所以使用shift模型,–shift -75或-100

对人细胞系ATAC-seq 数据call peak的参数设置如下:

macs2 callpeak -t H1hesc.final.bam -n sample --shift -100 --extsize 200 --nomodel -B --SPMR -g hs --outdir Macs2_out 2> sample.macs2.log

每个比较都会得到四个文件,如下

1) NAMEpeaks.xls:
以表格形式存放peak信息,虽然后缀是xls,但其实能用文本编辑器打开,和bed格式类似,但是以1为基,而bed文件是以0为基.也就是说xls的坐标都要减一才是bed文件的坐标

2) NAMEpeaks.narrowPeak ,与NAMEpeaks.broadPeak 类似。后面4列表示为, integer score for
display, fold-change,-log10pvalue,-log10qvalue,relative summit
position to peak start。内容和NAMEpeaks.xls基本一致,适合用于导入R进行分析。

3)NAMEsummits.bed:记录每个peak的peak
summits,也就是记录极值点的位置。MACS建议用该文件寻找结合位点的motif。

4) NAME_model.r,能通过NAME_model.r作图,得到是基于你提供数据的peak模型

总结:

xls文件:文件包含信息还是比较多的,和narrowPeak唯一不同的是peak的起始位置需要减1才是bed格式的文件,另外还包含fold_enrichment 和narrowPeak的fold change 对应,-log10pvalue,-log10qvalue,peak长度,peak 峰值位置等。

narrowPeak文件,和xls文件信息类似

summits.bed文件,包含峰的位置信息和-log10pvalue

bdg文件,bdg文件适合导入UCSC或IGV进行谱图可视化,或者转换为bigwig格式再进行可视化。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值