R-Blogger블로그·해설한국어2026-06-21
R에서 PCA: 주성분 분석 단계별 (prcomp + ggplot2)
R에서 PCA: 주성분 분석 단계별 안내 (prcomp + ggplot2)R에서 PCA를 수행하려면 기본 제공 함수 prcomp()를 사용합니다.1) Kaiser 기준Kaiser 기준은 고유값(표준편차의 제곱)이 1을 초과하는 성분을 유지하라는 규칙입니다.예시 데이터셋:PC1 – 고유값 2.480 – 예PC2 – 고유값 0.990 – 아니오(1에 근접)PC3 – 고유값 0.357 – 아니오PC4 – 고유값 0.173 – 아니오이 사례는 Kaiser 규칙만으로는 충분하지 않다는 것을 보여줍니다. PC2의 고유값이 0.990으로 거의 1에 가깝지만, 전체 분산의 약 ¼을 설명하고 ‘도시화’라는 명확한 의미를 갖습니다. 대부분의 실무 연구자는 Kaiser 규칙의 “아니오”에도 불구하고 PC2를 유지합니다.2) 누적 분산 임계값누적 설명 분산 비율(pve)을 활용하고, 일반적으로 80–90% 수준의 누적 분산 임계값을 설정합니다. 위 단계 4에서는 세 가지 기준을 동일 데이터에 적용한 결과를 보여주며, 서로 상충되는 경우도 확인할 수 있습니다.3) 범주형 변수에 PCA 적용표준 PCA는 연속형 수치형 변수만을 필요로 합니다. 범주형 데이터를 다루려면 FactoMineR::MCA()를 이용한 다중 대응 분석(MCA)을 사용합니다. MCA는 범주 빈도 표에 동일한 차원 축소 논리를 적용합니다.4) R에서 PCA 수행 시 흔히 발생하는 실수scale = TRUE 옵션을 생략하면 규모가 큰 변수가 첫 번째 성분을 과도하게 지배합니다.결측값이나 이상치를 사전에 확인하지 않으면 공분산 행렬이 왜곡됩니다.스크리 플롯의 엘보우를 오해하거나 로딩값의 부호를 무시하면 성분 해석이 잘못됩니다.5) 실제 적용 사례PCA는 이미지 압축, 얼굴 인식 특징 추출, 생물정보학의 유전자 발현 분석, 마케팅 분야의 고객 세분화, 그리고 군집화나 회귀 분석 전에 다중공선성을 제거하는 전처리 단계 등에서 널리 활용됩니다.PCA, 요인 분석, 혹은 기타 다변량 기법을 논문이나 학위 논문에서 사용하고 결과에 대한 검토가 필요하면 아래 연락처로 문의해 주시기 바랍니다.
원문 URL
전체 글은 원문 페이지에서 이어서 읽을 수 있습니다.
- 작성자
- Unknown
- 출처
- R-Blogger
- 플랫폼
- R-Blogger
- 분류
- 블로그·해설
- 언어
- 한국어
- 발행일
- 2026-06-21