library(dplyr)
library(ggplot2)
df <- read.csv("https://raw.githubusercontent.com/ageron/handson-ml/master/datasets/housing/housing.csv",stringsAsFactors=TRUE)
summary(df)
str(df) # ocean_proximity 는 숫자형이 아니기 때문에 행변환을 하거나 분석에서 제외한다.
# 데이터 전처리
# 결측치 및 범주형 변수 제거
df <- df %>% filter(!is.na(total_bedrooms))
df <- df %>% select(-ocean_proximity)
# 변수들간의 상관관계 분석
cor(df,method="pearson") # ★ method = "pearson" 지정 # median_income 을 제외하면 대부분의 변수가 종속변수와 상관성이 낮다. 전체컬럼을 독립변수로 사용하여 분석 수행
# 다중선형회귀분석
model <- lm(median_house_value ~., df)
summary(model)
# 기존 데이터셋의 10 번째 데이터에 대한 예측결과 보기
predict(model,df[10,],interval="none")
결측값 존재범주형 변수 : ocean_proximity
변수간 상관계수
모델 적합 결과 및 점추정 예측값
다중선형회귀분석을 위해 사용한 함수 : lm()
결측데이터, 범주형 데이터 분석에서 제외
filter( ) 함수를 사용하여 결측치 데이터를 분석에서 제외한다.
select( ) 함수를 사용하여 범주형 데이터를 분석에서 제외한다.
cor( ) 함수를 사용하여 변수들간의 상관관계를 분석한다. 이 때 method = "pearson" 으로 지정