본문 바로가기

자격증/빅데이터 분석기사

다중선형회귀분석 in R

 

주택중위가치를 예측하는 분석 전체 코드

library(dplyr)
library(ggplot2)

df <- read.csv("https://raw.githubusercontent.com/ageron/handson-ml/master/datasets/housing/housing.csv",stringsAsFactors=TRUE)
summary(df)
str(df)   # ocean_proximity 는 숫자형이 아니기 때문에 행변환을 하거나 분석에서 제외한다.

# 데이터 전처리
# 결측치 및 범주형 변수 제거
df <- df %>% filter(!is.na(total_bedrooms))
df <- df %>% select(-ocean_proximity)

# 변수들간의 상관관계 분석
cor(df,method="pearson")    # ★ method = "pearson" 지정  # median_income 을 제외하면 대부분의 변수가 종속변수와 상관성이 낮다. 전체컬럼을 독립변수로 사용하여 분석 수행

# 다중선형회귀분석
model <- lm(median_house_value ~., df)
summary(model)

# 기존 데이터셋의 10 번째 데이터에 대한 예측결과 보기
predict(model,df[10,],interval="none")

 

결측값 존재
범주형 변수 : ocean_proximity

 

변수간 상관계수

 

모델 적합 결과 및 점추정 예측값

 

 

  • 다중선형회귀분석을 위해 사용한 함수 : lm()
  • 결측데이터, 범주형 데이터 분석에서 제외
  • filter( ) 함수를 사용하여 결측치 데이터를 분석에서 제외한다.
  • select( ) 함수를 사용하여 범주형 데이터를 분석에서 제외한다.
  • cor( ) 함수를 사용하여 변수들간의 상관관계를 분석한다. 이 때 method = "pearson" 으로 지정

 

 

'자격증 > 빅데이터 분석기사' 카테고리의 다른 글

랜덤포레스트 in R  (0) 2022.11.26
의사결정나무 in R  (0) 2022.11.26
단순선형회귀분석 in R  (0) 2022.11.26
랜덤포레스트 in R  (0) 2022.11.26
로지스틱회귀(분류) in R  (0) 2022.11.25