R语言列筛选的方法--select

原创

育种数据分析之放飞自我 2022-02-16 17:11:59 ©著作权

文章标签 r语言开发语言数据环境变量 文章分类 代码人生

©著作权归作者所有：来自51CTO博客作者育种数据分析之放飞自我的原创作品，请联系作者获取转载授权，否则将追究法律责任

大家好，我是飞哥呀。

我们知道，R语言学习，80%的时间都是在清洗数据，而选择合适的数据进行分析和处理也至关重要，如何选择合适的列进行分析，你知道几种方法？

如何优雅高效的选择合适的列，让我们一起来看一下吧。

目录标题

1. 数据描述
2. 使用R语言默认的方法：列选择
3. tidyverse的rename函数
4. tidyverse的select函数
5. select函数注意事项

5.1 绝对引用函数
5.2 放到环境变量中

6. 提取h开头的列
7. 提取因子和数字的列

1. 数据描述

数据来源是我编写的R包learnasreml中的fm数据集。

r$> library(learnasreml)

r$> data(fm)

r$> head(fm)

R语言列筛选的方法--select_数据

我们的目的：

提取fm的TreeID，Rep，dj，dm，h3，并重命名为：ID, F1, y1 , y2, y3

2. 使用R语言默认的方法：列选择

这一种，当然是简单粗暴的方法，想要哪一列，就把相关的列号提取出来，形成一个向量，进行操作即可。比如

r$> d1 = fm[,c(1,3,6,7,11)]

r$> head(d1)
  TreeID Rep    dj    dm  h3
1  80001   1 0.334 0.405 239
2  80002   1 0.348 0.393 242
3  80004   1 0.354 0.429 180
4  80005   1 0.335 0.408 301
5  80008   1 0.322 0.372 271
6  80026   1 0.359 0.450 258

r$> names(d1) = c("ID","F1","y1","y2","y3")

r$> head(d1)

结果：

R语言列筛选的方法--select_数据_02

缺点：

这种方法，需要找到性状所在的列号，然后还要重命名，比较麻烦。

而且，后面如果想要根据列的特征进行提取时（比如以h开头的列，比如属性为数字或者因子的列等等），就不能实现了。

这就要用到tidyverse的函数了，select，rename，都是一等一的良将。

3. tidyverse的rename函数

代码：

a2 = fm %>% rename(ID=TreeID, F1 = Rep, y1 = dj, y2 = dm, y3 = h3)

R语言列筛选的方法--select_r语言_03

这里，rename只是单独的修改名称，并没有提取出来。

还要使用select进一步的提取：

R语言列筛选的方法--select_数据_04

4. tidyverse的select函数

如果使用select函数，一行代码就可以搞定：

a1 = fm %>% select(ID=TreeID, F1 = Rep, y1 = dj, y2 = dm, y3 = h3)

R语言列筛选的方法--select_开发语言_05

5. select函数注意事项

常见的坑：

注意，MASS包中也有select函数，而且优先级更高，如果你载入了MASS包，select就不能使用了。

R语言列筛选的方法--select_开发语言_06

哪怕你再次载入tidyverse包，也不行：

R语言列筛选的方法--select_环境变量_07

载入dplyr包，也不行：

R语言列筛选的方法--select_r语言_08

MASS就是这么豪横。

像这种情况，解决办法有两种：

5.1 绝对引用函数

即使用select时，要用dplyr::select

a3 = a2 %>% dplyr::select(ID,F1,y1,y2,y3)

R语言列筛选的方法--select_数据_09

这样也比较麻烦。

5.2 放到环境变量中

推荐的方法：

r$> select = dplyr::select

r$> a3 = a2 %>% select(ID,F1,y1,y2,y3)

R语言列筛选的方法--select_数据_10

推荐在载入包时，将下面代码放在开头，就可以肆无忌惮的应用select了，毕竟，环境变量的优先级是第一位的。

library(tidyverse)
select = dplyr::select

6. 提取h开头的列

这里，用starts_with，会匹配开头为h的列。

其它还有contains，匹配包含的字符，还有end_with，匹配结尾的字符。

应有尽有，无所不有。

re1 = fm %>% select(starts_with("h"))

R语言列筛选的方法--select_开发语言_11

7. 提取因子和数字的列

匹配数字的列：

re2 = fm %>% select_if(is.numeric)

R语言列筛选的方法--select_数据_12

匹配为因子的列：

re3 = fm %>% select_if(is.factor)

R语言列筛选的方法--select_环境变量_13

同志们，你学会了吗？

关注我，不迷路。

欢迎关注我的公众号：育种数据分析之放飞自我。主要分享R语言，Python，育种数据分析，生物统计，数量遗传学，混合线性模型，GWAS和GS相关的知识。

上一篇：win11电脑上如何设置微信双开（打开两个微信）

下一篇：如何查找某个物种的基因组大小

提问和评论都可以，用心的回复会被更多人看到评论

发布评论

相关文章

官方博客	全部文章	热门标签	班级博客
了解我们	网站地图	意见反馈

鸿蒙开发者社区	51CTO学堂
51CTO	软考资讯