본문 바로가기

전체 글

(161)
범주형 데이터 검정 (Categorical Data) 범주형 자료분석 개요분석 대상 변수가 이산형 변수(질적 자료)일 때, 각 집단 간의 비율 차이나 연관성을 분석하는 기법이다.이때 분할표 (Contingency Table)는 범주형 변수의 빈도를 교차하여 요약한 표로, 카이제곱 검정 및 일반화 선형모형 해석의 기반이 된다.차원 (Dimensionality): 분할표 구성에 관여한 변수의 수수준 (Level): 범주형 변수가 가지는 범주의 수 변수 형태에 따른 통계 분석 기법독립변수와 종속변수의 자료 속성에 따라 적합한 분석 방법이 달라진다.독립변수종속변수주요 분석 방법예제범주형범주형빈도분석, 카이제곱 검정, 로그선형모형지역별 선호 정당연속형범주형로지스틱 회귀분석소득에 따른 결혼 선호도범주형연속형t-검정 (2그룹), 분산분석(ANOVA) (3그룹 이상)지역..
적합도 검정 (Goodness of fit Test) 적합도 검정은 앞서 확립한 [가설 검정 (Hypothesis Testing)] 내에 위치한다. 단, T-test나 ANOVA가 '연속형 데이터(평균 전투력, 키, 무게 등)'를 다룬다면, 카이제곱 적합도 검정은 '범주형 데이터(A등급, B등급, 합격/불합격, 혈액형 등)'를 다루는 특수 교전 프로토콜이다.학술적으로는, 수집된 데이터의 분포가 특정한 이론적 분포함수(가정된 확률)에 얼마나 잘 맞는지를 검정하는 과정이다. 카이제곱 검정범주형(명목형) 데이터의 적합도를 검정할 때 사용한다.범주별 데이터가 나올 것으로 기대되는 빈도(기댓값)와 실제 관측된 빈도(관측값)의 차이를 비교하여 계산한다. 콜모고로프-스미르노프(K-S) 검정연속형 데이터의 적합도를 검정할 때 주로 사용한다.관측된 데이터의 누적 분포 함수..
회귀(Regression) 평가 장비 세트 지도학습 - 회귀 모델 평가 지표실제값과 예측값의 차이를 측정하는 오차(Error) 지표들이므로 값이 작을수록 좋다.아래 수식에서 y_i는 실제값, \hat{y}_i는 예측값, \bar{y}는 실제값의 평균, n은 데이터의 개수이다. 1 | 오차 제곱 (MSE)오차를 제곱하므로 이상치(Outlier) 발생 시 수치가 기하급수적으로 커져 민감하게 반응한다. 2 | 오차 절댓값 (MAE)제곱을 하지 않아 이상치의 영향력이 상대적으로 적으며, 직관적인 오차 크기 파악이 용이하다. 3 | RMSE (=MSE의 루트)MSE가 제곱으로 인해 스케일이 왜곡되는 현상을 원래 데이터 단위로 보정해 준다. 4 | 결정계수 (R^2)모델이 실제 데이터의 분산을 설명하는 비율. 전체 변동성 중 모델이 설명하는 변동성의 크기를..
[Phase 3] 확률론과 표본분포 [3] 확률과 기초 연산 법칙표본을 통해 모집단을 추론하는 과정에는 필연적으로 불확실성(오차)이 수반된다. 이러한 불확실성을 통제하고 표본의 통계량이 얼마나 타당한지 수학적으로 모델링하기 위해서는 확률의 개념이 필수적이다. 본격적인 확률분포를 다루기에 앞서, 그 기초가 되는 확률의 기본 공리와 연산 법칙을 먼저 정의한다. 표본공간의 확률:발생 가능한 모든 결과의 집합인 표본공간(S) 내에서 어떤 사건이든 반드시 하나는 발생하므로, 전체 확률은 항상 1이다. 사건의 확률 합:특정 사건이 발생할 확률은 그 사건에 포함된 모든 근원사건(더 이상 쪼갤 수 없는 개별 결과)들의 발생 확률을 합한 것과 같다. 확률의 기본 정리:두 사건 중 적어도 하나가 일어날 확률인 덧셈정리( P(A∪B) ), 반대되는 결과가 나..
[Phase 1] 조사 방법론 표본추출 및 오차앞서 기술통계를 통해 수집된 데이터를 요약하는 방법을 살펴보았다.이제는 모집단으로부터 데이터를 올바르게 수집하는 방법(표본추출)과 그 과정에서 필연적으로 발생하는 한계(오차)를 알아볼 차례이다.조사 방식의 선택모집단의 특성을 파악하기 위한 조사 방식은 크게 전수조사와 표본조사로 나뉜다.전수조사:관심 대상인 모집단 전체를 조사하는 방식으로 비용과 인력이 과도하게 소요된다.표본조사:이에 대한 대안으로 모집단을 대표할 수 있는 일부 표본만 추출하여 조사하는 방식이다. 비용 절감과 신속성 측면에서 유리하며, 조사 규모가 작아 엄격한 관리가 가능하므로 비표본오차를 줄여 전수조사보다 오히려 더 심도 있고 정확한 결과를 도출할 수도 있다.표본조사의 필연적 한계와 통제전수조사 대신 표본조사를 선택함으로..
데이터 분석 기획 및 방법론 분석 기획의 특징과 주제 유형분석 기획은 무엇을(What) 달성하기 위해 어떤 방식(How)으로 수행할 것인가에 대한 일련의 계획을 수립하는 과정이다. 분석 주제와 방법에 대한 인지 여부에 따라 4가지 유형으로 분류된다.목표 시점에 따른 접근 방식:단기적 접근 (Quick-Win): 당면한 과제를 빠르게 해결하여 분석의 가치를 조기에 증명.중장기적 접근 (Master Plan): 전사적이고 장기적인 관점에서 분석 문화를 내재화.혼합 방식: 실무에서 가장 권장되는 방식으로, 중장기 마스터 플랜을 수립하되 초기에는 Quick-Win 과제로 이해관계자의 동의를 얻어냄.데이터 분석 기획 및 방법론 절차데이터 분석 프로젝트를 체계적으로 수행하기 위해서는 표준화된 방법론이 필요하다.데이터 분석 기획 기본 절차도메인..
데이터 변환(Transformation) & 결측값 대치법(Imputation) [1] 데이터 변환의 4가지 기법 차이데이터 정제 과정 중, 데이터를 분석 가능한 형태로 가공하는 전처리 단계의 주요 기법들이다.[2] 결측값 대치법 간의 차이 비교결측치를 임의로 대체할 경우 데이터의 편향(Bias)이 발생하여 결과의 신뢰성이 저하될 수 있으므로, 데이터의 특성에 기반한 적절한 대치법 선택이 필수적이다.1 | 단순 대치법 (Simple Imputation) 내 세부 기법 비교결측치를 완전 무작위 결측(MCAR) 또는 무작위 결측(MAR)으로 간주하고 처리하는 방식이다.2 | 다중 대치법 (Multiple Imputation)의 차별점단순 대치법이 지닌 통계적 효율성 및 일치성 하락 문제를 근본적으로 보완하기 위해 만들어진 방법이다.단일 값으로 대치하는 단순 대치와 달리, 복수 개(n개)..
인코딩 기법 비교 인코딩 기법 3가지 요약 기법별 심화 분석 및 실전 통찰1 | 레이블 인코딩 (Label Encoding)의 크기 오인 문제변환 예시: 옷 사이즈 데이터를 S →0, M →1, L →2로 변환. 레이블 인코딩은 할당된 정수에 대소 관계가 생기게 된다. 따라서 옷 사이즈(S, M, L)나 성적(A, B, C)처럼 애초에 순서형(Ordinal) 데이터일 경우에는 사용해도 무방하다. 그러나 '사과(0), 바나나(1), 딸기(2)'처럼 순서나 크기에 아무런 의미가 없는 명목형(Nominal) 데이터에 이를 적용하면, 알고리즘이 "딸기가 사과보다 3배 더 크거나 중요하다"라고 잘못 학습하게 되는 심각한 오류를 초래한다. 이때 도입하는 것이 바로 원-핫 인코딩이다.2 | 원-핫 인코딩 (One-Hot Encodin..