주택중위가치를 예측하는 분석 전체 코드
library(dplyr)
library(ggplot2)
library(randomForest) # 랜덤포레스트는 회귀에서도 library(randomForest)
df <- read.csv("https://raw.githubusercontent.com/ageron/handson-ml/master/datasets/housing/housing.csv",stringsAsFactors=TRUE)
summary(df)
# 데이터 전처리
df <- df %>% filter(!(is.na(total_bedrooms)))
df <- df %>% select(-ocean_proximity)
# 랜덤포레스트 회귀
model <- randomForest(median_house_value~.,data=df)
predict(model,data=df[10,],type="response") # ★ predict함수 type="reponse" 지정
# 모델평가
MSE <- mean((df$median_house_value-predict(model))^2)
MSE
모델 예측
MSE 를 통한 모델 성능평가
- 랜덤포레스트 회귀를 위해 사용하는 라이브러리 : library(randomForest)
- 랜덤포레스트 회귀를 위해 사용하는 함수 : randomForest()
- predict( ) 함수를 이용한 예측 시 type = "response" 지정
- MSE 를 통한 모델 성능평가 : mean((x-predict(model))^2)