
장바구니 구매항목별 관련성이 있는지 알아보는 연관분석 전체 코드
library(dplyr)
library(ggplot2)
# install.packages("arules")
library(arules)
# ★ csv 파일을 트랜잭션 형태로 읽어온다.
tr <- read.transactions("sample_data/retail_dataset.csv",format="basket",sep=",")
## 트랜잭션 형태의 데이터를 보기 위한 inspect() 함수 사용
inspect(tr)
# 데이터 전처리
tr <- tr[-1] # 1 행의 컬럼명은 삭제
inspect(tr[1:5])
summary(tr) # summary() 함수를 사용한 트랜잭션의 특징 확인
# 장바구니 구매 연관분석
rules <- apriori(tr, parameter = list(support=0.3, confidence=0.5)) # support : 최소지지도 , confidence : 최소 신뢰도
rules
# 도출된 규칙 출력
inspect(sort(rules, by=c("confidence"),decreasing=T)) # 생성된 규칙을 내림차순으로 출력 # 신뢰도가 높으면 구매품목 간 연관성이 높음
연관분석 알고리즘을 적용하기 위해서는 데이터가 트랜잭션 형태로 구성되어야 한다.
→ read.transaction( )

apriori ( data, parameter = list(support = , confidence = )
→ support : 최소 지지도
→ confidense : 최소 신뢰도

→ list 를 구매했을 때 ths 도 같이 구매한다는 규칙이며,
각 규칙의 지지도 (support) , 신뢰도 (confidence), 향상도 (lift) 를 보여준다.
→ 신뢰도가 높다는 것은 구매 품목들간의 연관성이 높음을 의미한다.

'자격증 > 빅데이터 분석기사' 카테고리의 다른 글
| [분류] 2. 분류 모델 구현해보기 in R (랜덤포레스트,SVM) (0) | 2022.12.02 |
|---|---|
| [분류] 1. 분류 모델 구현해보기 in R (랜덤포레스트,SVM) (1) | 2022.12.02 |
| K-means in R (0) | 2022.11.26 |
| 랜덤포레스트 in R (0) | 2022.11.26 |
| 의사결정나무 in R (0) | 2022.11.26 |