전체 글 (158) 썸네일형 리스트형 [Phase 3] 확률론과 표본분포 [3] 확률과 기초 연산 법칙표본을 통해 모집단을 추론하는 과정에는 필연적으로 불확실성(오차)이 수반된다. 이러한 불확실성을 통제하고 표본의 통계량이 얼마나 타당한지 수학적으로 모델링하기 위해서는 확률의 개념이 필수적이다. 본격적인 확률분포를 다루기에 앞서, 그 기초가 되는 확률의 기본 공리와 연산 법칙을 먼저 정의한다. 표본공간의 확률:발생 가능한 모든 결과의 집합인 표본공간(S) 내에서 어떤 사건이든 반드시 하나는 발생하므로, 전체 확률은 항상 1이다. 사건의 확률 합:특정 사건이 발생할 확률은 그 사건에 포함된 모든 근원사건(더 이상 쪼갤 수 없는 개별 결과)들의 발생 확률을 합한 것과 같다. 확률의 기본 정리:두 사건 중 적어도 하나가 일어날 확률인 덧셈정리( P(A∪B) ), 반대되는 결과가 나.. [Phase 1] 조사 방법론 표본추출 및 오차앞서 기술통계를 통해 수집된 데이터를 요약하는 방법을 살펴보았다.이제는 모집단으로부터 데이터를 올바르게 수집하는 방법(표본추출)과 그 과정에서 필연적으로 발생하는 한계(오차)를 알아볼 차례이다.조사 방식의 선택모집단의 특성을 파악하기 위한 조사 방식은 크게 전수조사와 표본조사로 나뉜다.전수조사:관심 대상인 모집단 전체를 조사하는 방식으로 비용과 인력이 과도하게 소요된다.표본조사:이에 대한 대안으로 모집단을 대표할 수 있는 일부 표본만 추출하여 조사하는 방식이다. 비용 절감과 신속성 측면에서 유리하며, 조사 규모가 작아 엄격한 관리가 가능하므로 비표본오차를 줄여 전수조사보다 오히려 더 심도 있고 정확한 결과를 도출할 수도 있다.표본조사의 필연적 한계와 통제전수조사 대신 표본조사를 선택함으로.. 데이터 분석 기획 및 방법론 분석 기획의 특징과 주제 유형분석 기획은 무엇을(What) 달성하기 위해 어떤 방식(How)으로 수행할 것인가에 대한 일련의 계획을 수립하는 과정이다. 분석 주제와 방법에 대한 인지 여부에 따라 4가지 유형으로 분류된다.목표 시점에 따른 접근 방식:단기적 접근 (Quick-Win): 당면한 과제를 빠르게 해결하여 분석의 가치를 조기에 증명.중장기적 접근 (Master Plan): 전사적이고 장기적인 관점에서 분석 문화를 내재화.혼합 방식: 실무에서 가장 권장되는 방식으로, 중장기 마스터 플랜을 수립하되 초기에는 Quick-Win 과제로 이해관계자의 동의를 얻어냄.데이터 분석 기획 및 방법론 절차데이터 분석 프로젝트를 체계적으로 수행하기 위해서는 표준화된 방법론이 필요하다.데이터 분석 기획 기본 절차도메인.. 데이터 변환(Transformation) & 결측값 대치법(Imputation) [1] 데이터 변환의 4가지 기법 차이데이터 정제 과정 중, 데이터를 분석 가능한 형태로 가공하는 전처리 단계의 주요 기법들이다.[2] 결측값 대치법 간의 차이 비교결측치를 임의로 대체할 경우 데이터의 편향(Bias)이 발생하여 결과의 신뢰성이 저하될 수 있으므로, 데이터의 특성에 기반한 적절한 대치법 선택이 필수적이다.1 | 단순 대치법 (Simple Imputation) 내 세부 기법 비교결측치를 완전 무작위 결측(MCAR) 또는 무작위 결측(MAR)으로 간주하고 처리하는 방식이다.2 | 다중 대치법 (Multiple Imputation)의 차별점단순 대치법이 지닌 통계적 효율성 및 일치성 하락 문제를 근본적으로 보완하기 위해 만들어진 방법이다.단일 값으로 대치하는 단순 대치와 달리, 복수 개(n개).. 인코딩 기법 비교 인코딩 기법 3가지 요약 기법별 심화 분석 및 실전 통찰1 | 레이블 인코딩 (Label Encoding)의 크기 오인 문제변환 예시: 옷 사이즈 데이터를 S →0, M →1, L →2로 변환. 레이블 인코딩은 할당된 정수에 대소 관계가 생기게 된다. 따라서 옷 사이즈(S, M, L)나 성적(A, B, C)처럼 애초에 순서형(Ordinal) 데이터일 경우에는 사용해도 무방하다. 그러나 '사과(0), 바나나(1), 딸기(2)'처럼 순서나 크기에 아무런 의미가 없는 명목형(Nominal) 데이터에 이를 적용하면, 알고리즘이 "딸기가 사과보다 3배 더 크거나 중요하다"라고 잘못 학습하게 되는 심각한 오류를 초래한다. 이때 도입하는 것이 바로 원-핫 인코딩이다.2 | 원-핫 인코딩 (One-Hot Encodin.. 불균형 데이터(Imbalanced Data) 처리 기법 불균형 데이터의 치명적 문제점데이터의 비율이 99:1(정상:불량)로 극단적인 경우(Highly-imbalanced Data), 분석 모델이 학습 없이 무조건 모든 데이터를 '정상'이라고만 예측해도 정확도(Accuracy)는 99%로 매우 높게 측정된다.겉보기에는 모형의 성능이 뛰어나 보이지만, 정작 우리가 찾아내야 할 핵심인 소수 클래스(불량, 희귀병)를 맞출 확률인 재현율(Recall-rate)은 '0'으로 급격히 떨어지는 현상이 발생한다. 따라서 불균형 데이터 환경에서는 모형의 성능을 단순히 '정확도'로 판별해서는 안 되며, 정밀도(Precision)와 재현율(Recall)을 함께 고려해야 한다. 불균형 데이터의 처리 방법이러한 불균형을 해소하여 소수 클래스에 대한 모델의 탐지 능력을 끌어올리기 위해.. 변수 변환(Variable Transformation) 기법 변수 변환의 개념과 목적 기존의 변수 공간에서는 관찰하기 어렵거나 분석하기 까다로운 데이터를, 수학적 함수를 적용하여 영역을 달리함으로써 해석을 용이하게 하고 취급을 단순화하는 데이터 전처리(Preprocessing) 과정이다.범주형 변환: 연속형 변수를 있는 그대로 사용하기보다, 특정 구간으로 나누어 범주형(Categorical)으로 변환할 때 분석 결과의 명료성과 정확성이 높아지는 경우가 있다.스케일링(Scaling)을 위한 정규화 기법 비교변수들 간의 측정 단위(Scale)가 심하게 차이 날 때, 이를 동일한 범위나 분포로 맞추어 상대적 특성을 반영하는 기법이다.분포 형태에 따른 정규분포화 변환 기법수집된 데이터가 한쪽으로 치우친 비대칭 분포를 이룰 때, 이를 통계적 가정이 통하는 정규분포 형태로 .. 분석 변수 처리 [1] 차원 축소(Dimensionality Reduction)분석 목적에 맞추어 변수(데이터의 종류)의 수를 줄이는 과정이다.차원 축소가 필요한 4가지 이유[2] 요인 분석 (Factor Analysis)다수의 변수들 간에 존재하는 상관관계를 분석하여, 이를 설명할 수 있는 공통 차원(요인)으로 축약하는 통계 분석 과정이다. 독립변수와 종속변수의 구분이 없으며 주로 기술 통계를 활용한다.요인 분석의 주요 목적 [3] 주성분 분석(PCA)과 스케일링(Scaling)의 중요성PCA는 서로 연관성이 있는 고차원 데이터를 선형 연관성이 없는 저차원(주성분)으로 직교 변환하는 기법이다. 사전적 분포 가정이 필요하지 않는다. 본래 변수들의 선형 결합을 통해 새로운 변수를 만들며, 데이터의 분산이 가장 큰 방향을 .. 이전 1 2 3 4 ··· 20 다음