单细胞转录组学习笔记-4-获取Github代码包以及准备工作

转载来自：刘小泽链接：https://www.jianshu.com/p/e659a2f164f7
刘小泽写于19.6.14-15-第二单元第二、三讲：获取Github代码包以及准备工作

笔记目的：根据生信技能树的单细胞转录组课程探索smart-seq2技术相关的分析技术
课程链接在：https://www.bilibili.com/video/BV1dt411Y7nn?p=5
全网第一个单细胞课程（基础课程），答疑档在：https://docs.qq.com/doc/DT2NwV0Fab3JBRUx0
课程目录和配套习题：https://mp.weixin.qq.com/s/fE2yPbVvD0R5I8qnNh4F1w

github代码在：https://github.com/jmzeng1314/scRNA_smart_seq2/archive/master.zip
考虑到很多学生在中国大陆，可能访问获取GitHub代码比较困难，所以我也提供微云链接供代码下载：https://share.weiyun.com/5e4OZHE （务必下载，配套视频课程学习）

首先进入RNA-seq目录，从step0-step9是对常规转录组的一个回顾

准备工作之R包

从step0开始，代码注释蛮详细的，我会挑选重要的部分写到这里，其他可以自行看代码学习，下面就是主要利用Rstudio进行操作了

一个好习惯，做新项目时记得清空之前的变量，使用rm(list = ls())
有的R包比较大，经常需要加载其他的动态库dynamically loaded libraries (DLLs)，例如：
```
> length(loadedNamespaces()) 
[1] 34
> library(Seurat) #加载一个seurat包会出现接近60个依赖的动态库
> length(loadedNamespaces())
[1] 96
```
如果不设置，就会因为加载数量超限制而报错(https://developer.r-project.org/Blog/public/2018/03/23/maximum-number-of-dlls/)

在R3.3版本中，只能有100个固定的动态库限制，到了3.4版本以后，就能够使用Sys.setenv(R_MAX_NUM_DLLS=xxx)进行设置，而这个数字根据个人情况设定
在新建数据框时会自动将字符串的列当做是因子型向量，但是我们常常还需要对字符进行修改，因此需要先将这个设置取消：options(stringsAsFactors = F)
因为Bioconductor下载方法的变动，要学会使用BiocManager::install这个命令，例如：BiocManager::install(c( 'scran'),ask = F,update = F)，新加的两个选项表示：不要问我要不要下载，直接下！还有不要问我要不要更新，不更新！【除非不升级就报错】
下载包存在网络的限制，毕竟R语言是国外开发，因此可以通过options()$repos看看常规CRAN安装R包的使用镜像(一般情况下是rstudio公司的)，但是这里我们可以自行设置：比如设置成清华源：options("repos" = c(CRAN="https://mirrors.tuna.tsinghua.edu.cn/CRAN/"))，另外Bioconductor也有自己的镜像设置：修改一下options即可，options(BioC_mirror="https://mirrors.ustc.edu.cn/bioc/")
```
# 总结一下，可以先用if判断再进行设置
if(length(getOption("CRAN"))==0) options(CRAN="https://mirrors.tuna.tsinghua.edu.cn/CRAN/")

if(!require("BiocManager")) install.packages("BiocManager",update = F,ask = F)

if(length(getOption("BioC_mirror"))==0) options(BioC_mirror="https://mirrors.ustc.edu.cn/bioc/")
```

如何使用if判断语句进行包的安装：

if (!requireNamespace("BiocManager", quietly = TRUE)) 
  install.packages("BiocManager")

最后，就是安装所有必备的R包(包括CRAN和Bioconductor)

# 快速安装cran包
cran_pkgs <- c("ggfortify","FactoMineR","factoextra")
for (pkg in cran_pkgs){
  if (! require(pkg,character.only=T) ) {
    install.packages(pkg,ask = F,update = F)
    require(pkg,character.only=T) 
    }
}
# Bioconductor包
library(BiocManager)
bioc_pkgs <- c("scran","TxDb.Mmusculus.UCSC.mm10.knownGene","org.Mm.eg.db","genefu","org.Hs.eg.db","TxDb.Hsapiens.UCSC.hg38.knownGene")
for (pkg in bioc_pkgs){
  if (! require(pkg,character.only=T) ) {
    BiocManager::install(pkg,ask = F,update = F)
    require(pkg,character.only=T) 
    }
 }

目的：利用R包重复文章的基因数量图、聚类图、基因在聚类图中的热图、每个基因表达量在不同cluster的小提琴图

准备工作之表达矩阵

image

看到文章中有两个表达矩阵，其中第一个是原始表达矩阵(均为整数），第二个是rpkm是表达量归一化后的值(包含了小数)，因此也能说明为何第二个文件比第一个要大。

RPKM这个指标可以这样理解：R表示reads，K表示基因长度，M表示文库大小，它实际上做的事情也就是去掉基因长度和测序文库的差异对reads比对数量的影响

操作表达矩阵

读取

# 保留头信息，并设置分隔符为制表符tab
a=read.table('../GSE111229_Mammary_Tumor_fibroblasts_768samples_rawCounts.txt.gz',header = T ,sep = '\t')

# 读进来以后，简单查看一下
a[1:6,1:4]

过滤

可以看到很多基因对应的表达量都是0

image

下面会用到循环，但是为了方便理解，先拿其中一行为例：

x=a[1,] #比如将第一行提取出来赋值给x
# 将x中的值与1作比较(利用了R语言的循环补齐，也就是说，它会将768个值一个一个去和1做比较，然后返回逻辑值TRUE或者FALSE)
x>1
# 然后利用table()函数检查x中有多少是TRUE，多少是FALSE
table(x>1)
# FALSE  TRUE 
#   766     2 
# 可以看到第一行这个基因在768个细胞中只有两个细胞有表达，我们认为：这两个细胞也不好分组，cluster聚类也没有什么意义，因此可以去掉
# 但是这个细胞量设置成多少合适呢？总不能不能一股脑全设成2吧
floor(ncol(a)/50) # 用总列数除以50然后向下取整，结果就是15
# 也就是说，只要一行中至少要在15个样本中有表达量
# 上面知道了 x>1 返回逻辑值0和1，0为FALSE，1为TRUE。现在我们要找一行中总共有多少TRUE，就用sum计算一下(因为会忽略掉0的影响)
sum(x>1) > floor(ncol(a)/50)
# 当然第一行会返回FALSE，也就表明我们要去掉这一行内容
a[sum(x>1) > floor(ncol(a)/50),]# 就把不符合要求的第一行去掉了

上面，我们对一行的筛选与过滤有了认识，那么一个表达矩阵有2万多行，怎样实现循环操作呢？

# 专业的事情交给专业的工具去处理=》apply
# 要使用apply函数先要明白三个问题：对谁进行操作？对行还是列进行操作？操作什么？
apply(a, 1, function(x) {sum(x>1) > floor(ncol(a)/50)})
# 1：对a这个矩阵进行操作
# 2：对行(也就是1表示)进行操作[补充：如果对列操作，用2表示]
# 3：操作什么？复杂的操作先写上 function(x){}，这是一个标准格式，然后大括号中是要进行操作的函数，于是我们就可以将我们之前写的那一行粘到这里，最后仍然是逻辑值

最后，有多少行就会返回多少个apply判断的逻辑值，显示FALSE的就是要过滤掉的，于是再用行筛选完成整个操作，并赋值给一个新变量：

dat=a[apply(a,1, function(x) sum(x>1) > floor(ncol(a)/50)),] 
#或者dat = a[apply(a, 1, function(x) {sum(x >1)>15}),]
dim(dat)
# 12198   768 最终就保留了12198个基因

其实原文保留的更少，原文只有10835个基因

作者：刘小泽
链接：https://www.jianshu.com/p/e659a2f164f7
来源：简书
著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 202,802评论 5赞 476
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,109评论 2赞 379
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 149,683评论 0赞 335
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,458评论 1赞 273
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,452评论 5赞 364
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,505评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,901评论 3赞 395
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,550评论 0赞 256
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,763评论 1赞 296
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,556评论 2赞 319
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,629评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,330评论 4赞 318
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,898评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,897评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,140评论 1赞 259
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 42,807评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,339评论 2赞 342

单细胞转录组学习笔记-4-获取Github代码包以及准备工作

准备工作之R包

准备工作之表达矩阵

操作表达矩阵

读取

过滤

推荐阅读更多精彩内容