R - 将估算的缺失值返回到数据框中
R - Getting Imputed Missing Values back into dataframe
我正在使用 aregImpute 来估算 R 数据帧 (bn_df) 上的缺失值。
代码是这样的:
library(Hmisc)
impute_arg <- aregImpute(~ TI_Perc + AS_Perc +
CD_Perc + CA_Perc + FP_Perc,
data = bn_df, n.impute = 5)
它工作正常。
问题在后面。将值放回原始数据框中。
我能做到,只是方式不是很优雅。我基本上必须 copy/paste 所有列的以下行:
bn_df$CD_Perc[impute_arg$na$CD_Perc] <- impute_arg$imputed$CD_Perc[,1]
bn_df$FP_Perc[impute_arg$na$FP_Perc] <- impute_arg$imputed$FP_Perc[,1]
...
这行得通。但是必须有一种更有效的方法来完成此操作,而无需对所有列使用 copy/paste。
有什么想法吗?
您可以使用函数impute.transcan
。由于您没有提供数据,我从 aregImpute
的文档中复制了一个示例。
# The data
x1 <- factor(sample(c('a','b','c'),1000,TRUE))
x2 <- (x1=='b') + 3*(x1=='c') + rnorm(1000,0,2)
x3 <- rnorm(1000)
y <- x2 + 1*(x1=='c') + .2*x3 + rnorm(1000,0,2)
orig.x1 <- x1[1:250]
orig.x2 <- x2[251:350]
# Insert NAs
x1[1:250] <- NA
x2[251:350] <- NA
# Create a data frame
d <- data.frame(x1,x2,x3,y)
# Find value of nk that yields best validating imputation models
# tlinear=FALSE means to not force the target variable to be linear
# Use imputation
f <- aregImpute(~y + x1 + x2 + x3, nk=c(0,3:5), tlinear=FALSE,
data=d, B=10) # normally B=75
# Get the imputed values
imputed <-impute.transcan(f, data=d, imputation=1, list.out=TRUE, pr=FALSE, check=FALSE)
# convert the list to the database
imputed.data <- as.data.frame(do.call(cbind,imputed))
# arrange the columns accordingly
imputed.data <- imputed.data[, colnames(d), drop = FALSE]
我正在使用 aregImpute 来估算 R 数据帧 (bn_df) 上的缺失值。
代码是这样的:
library(Hmisc)
impute_arg <- aregImpute(~ TI_Perc + AS_Perc +
CD_Perc + CA_Perc + FP_Perc,
data = bn_df, n.impute = 5)
它工作正常。
问题在后面。将值放回原始数据框中。
我能做到,只是方式不是很优雅。我基本上必须 copy/paste 所有列的以下行:
bn_df$CD_Perc[impute_arg$na$CD_Perc] <- impute_arg$imputed$CD_Perc[,1]
bn_df$FP_Perc[impute_arg$na$FP_Perc] <- impute_arg$imputed$FP_Perc[,1]
...
这行得通。但是必须有一种更有效的方法来完成此操作,而无需对所有列使用 copy/paste。
有什么想法吗?
您可以使用函数impute.transcan
。由于您没有提供数据,我从 aregImpute
的文档中复制了一个示例。
# The data
x1 <- factor(sample(c('a','b','c'),1000,TRUE))
x2 <- (x1=='b') + 3*(x1=='c') + rnorm(1000,0,2)
x3 <- rnorm(1000)
y <- x2 + 1*(x1=='c') + .2*x3 + rnorm(1000,0,2)
orig.x1 <- x1[1:250]
orig.x2 <- x2[251:350]
# Insert NAs
x1[1:250] <- NA
x2[251:350] <- NA
# Create a data frame
d <- data.frame(x1,x2,x3,y)
# Find value of nk that yields best validating imputation models
# tlinear=FALSE means to not force the target variable to be linear
# Use imputation
f <- aregImpute(~y + x1 + x2 + x3, nk=c(0,3:5), tlinear=FALSE,
data=d, B=10) # normally B=75
# Get the imputed values
imputed <-impute.transcan(f, data=d, imputation=1, list.out=TRUE, pr=FALSE, check=FALSE)
# convert the list to the database
imputed.data <- as.data.frame(do.call(cbind,imputed))
# arrange the columns accordingly
imputed.data <- imputed.data[, colnames(d), drop = FALSE]