ChIP/RNA-seq数据分析前面的流程都一样,都需要安装一些软件,下载基因组和注释文件(非必须,如果有index文件,可省略),做序列对比,。
这个博文主要是针对下游ChIP-seq的分析流程。上一个博客其实已经准备了一点chipseeker(Rstudio上)。后期可能还会有新的RNA-seq学习笔记。之前针对RNA-seq,也做了一次,但是用的是tophat和cufflinks系列,据说比较慢,后期会根据实际情况决定学不学新的方法,学的话继续补充。
可以参考这个RNA-seq分析合集。
用MACS2获取Chip-seq富集区
代码参考:ChIP-seq分析流程
conda activate Python # MASC2一定要在python2环境下使用。
macs2 callpeak -c IgGold.bam -t suz12.bam -q 0.05 -f BAM -g mm -n suz12 &
macs2 callpeak -c IgGold.bam -t cbx7.bam -q 0.05 -f BAM -g mm -n cbx7 &
macs2 callpeak -c IgGold.bam -t ring1B.bam -q 0.05 -f BAM -g mm -n ring1B &
macs2 callpeak -c IgGold.bam -t RYBP.bam -q 0.05 -f BAM -g mm -n RYBP &

每一条代码执行完都可以得到了类如下面的四个文件:
但是RYBP无peak数据(RYBP_model.r可以用),需要我们手动下载peaks数据
wget ftp://ftp.ncbi.nlm.nih.gov/geo/series/GSE42nnn/GSE42466/suppl/GSE42466_RYBP_peaks_5.txt.gz
gzip -d GSE42466_RYBP_peaks_5.txt.gz
mv GSE42466_RYBP_peaks_5.txt RYBP_summits.bed
基本的相关参数: 输入文件参数:
-t:实验组,IP的数据文件
c: 对照组
f:指定输入文件的格式,默认是自动检测输入数据是什么格式,支持bam,sam,bed等
g:有效基因组大小,由于基因组序列的重复性,基因组实际可以mapping的大小小于原始的基因组。这个参数要根据实际物种计算基因组的有效大小。软件里也给出了几个默认的
-g 值:hs – 2.7e9表示人类的基因组有效大小(UCSC human hg18 assembly).hs: 2.7e9
mm: 1.87e9
ce: 9e7
dm: 1.2e8输出文件参数
–outdir:输出结果的存储路径
–n:输出文件名的前缀
-B/–bdg:输出bedgraph格式的文件,输出文件以NAME+’_treat_pileup.bdg’ for treatment data, NAME+’_control_lambda.bdg’ for local lambda values from
control显示。
还可以使用Shift 模型参数,比如ATAC-seq关心的是在哪切断,断点才是peak的中心,所以使用shift模型,–shift -75或-100
对人细胞系ATAC-seq 数据call peak的参数设置如下:
macs2 callpeak -t H1hesc.final.bam -n sample --shift -100 --extsize 200 --nomodel -B --SPMR -g hs --outdir Macs2_out 2> sample.macs2.log
每个比较都会得到四个文件,如下
1) NAMEpeaks.xls:
以表格形式存放peak信息,虽然后缀是xls,但其实能用文本编辑器打开,和bed格式类似,但是以1为基,而bed文件是以0为基.也就是说xls的坐标都要减一才是bed文件的坐标2) NAMEpeaks.narrowPeak ,与NAMEpeaks.broadPeak 类似。后面4列表示为, integer score for
display, fold-change,-log10pvalue,-log10qvalue,relative summit
position to peak start。内容和NAMEpeaks.xls基本一致,适合用于导入R进行分析。3)NAMEsummits.bed:记录每个peak的peak
summits,也就是记录极值点的位置。MACS建议用该文件寻找结合位点的motif。4) NAME_model.r,能通过NAME_model.r作图,得到是基于你提供数据的peak模型
总结:
xls文件:文件包含信息还是比较多的,和narrowPeak唯一不同的是peak的起始位置需要减1才是bed格式的文件,另外还包含fold_enrichment 和narrowPeak的fold change 对应,-log10pvalue,-log10qvalue,peak长度,peak 峰值位置等。
narrowPeak文件,和xls文件信息类似
summits.bed文件,包含峰的位置信息和-log10pvalue
bdg文件,bdg文件适合导入UCSC或IGV进行谱图可视化,或者转换为bigwig格式再进行可视化。
这篇博客介绍了如何使用MACS2进行ChIP-seq的下游分析,包括如何获取富集区、理解MACS2的基本参数以及分析结果的文件类型和内容。内容涵盖实验组和对照组的输入、输出文件格式,特别是narrowPeak、xls、summits.bed和bdg文件的用途。

: 学习笔记 --ChIP信号富集&spm=1001.2101.3001.5002&articleId=105993149&d=1&t=3&u=afda59161f114df0a91e34cbac9ac0af)

被折叠的 条评论
为什么被折叠?



