전체 글 (146) 썸네일형 리스트형 교차검증과 잔차의 3가지 가정 [1] 교차검증 (Cross-Validation)모델이 고정된 훈련/테스트 데이터에 과대적합(Overfitting)되는 것을 방지하고, 한정된 데이터를 최대한 알뜰하게 평가에 활용하기 위함이다. 모든 데이터를 평가에 활용할 수 있으나, 반복 횟수 증가로 인해 모델 훈련 및 검증에 소요되는 계산 시간이 길어진다. 1 | 홀드아웃 기법 (Holdout Method)개념: 데이터를 훈련용(Train)과 테스트용(Test), 또는 검증용(Val)을 포함하여 단 한 번만 분할하는 가장 단순한 방식이다. 활용: 확보된 데이터의 양이 충분히 많을 때 주로 사용한다.단점: 데이터셋이 작을 경우 쪼개는 비율이나 방식에 따라 성능 추정의 편차가 커지며, 동일 테스트 데이터를 반복 사용하면 객관성이 저하될 수 있다. 2 |.. 평가 지표 ★ [1] 지도학습 - 분류 모델 평가 지표더보기 용어의 어원과 강조점의 차이혼동 행렬 (Confusion Matrix)분류 모델이 서로 다른 클래스를 어떻게 혼동(Confuse)하고 있는지를 보여준다는 데 방점이 있다. 특정 클래스 A를 B로 잘못 판단하는 편향성을 확인하는 시각을 제공한다. 현재 인공지능, 머신러닝, 딥러닝 분야의 학술 논문 및 글로벌 스탠다드 교재에서 가장 보편적으로 사용되는 직역 명칭이다.오차 행렬 (Error Matrix)모델의 예측 결과에서 발생하는 오류(Error)의 유형(False Positive, False Negative)과 발생 빈도를 정량적으로 나타낸다는 점을 강조한 의역 표현이다. 전통적인 통계학 분석, 데이터 마이닝 초창기 문서, 또는 원격 탐사(Remote Sens.. 군집 분석 군집분석의 핵심 척도 (거리 계산)1 | 유클리드 거리 (Euclidean Distance): 두 점 사이를 잇는 최단 직선거리이다. 피타고라스 정리를 활용하며, L2 거리로 불린다.2 | 맨해튼 거리 (Manhattan Distance): 바둑판 모양의 블록을 따라가듯 가로지르지 않는 최단 거리를 측정한다. 택시 거리, 혹은 L1 거리로 불린다.3 | 마할라노비스 거리 (Mahalanobis Distance): 단순한 물리적 거리가 아니라, 각 변수의 표준화(스케일 통일)와 변수 간의 상관성(공분산)을 모두 고려하여 거리를 측정하는 기법이다. ※ 여기서 사용된 거리 측정 방식(L1, L2)은 기계학습 모델의 과적합을 방지하는 가중치 규제 방식과 수학적으로 동일하다. 자세한 원리는 [벌점화 회귀(릿지·라.. 연관성 분석 연관성 분석의 본질예측해야 할 명확한 정답(목표 변수)이 없는 상태에서, 데이터 간의 동시 발생 패턴이나 규칙을 탐색하는 기법이라고 하며 장바구니 분석이 그 기법들 중 하나이다. 장바구니 분석 (Market Basket Analysis)이란 고객의 거래 내역(트랜잭션) 데이터를 바탕으로 "A 상품을 구매한 고객이 B 상품도 함께 구매하는가?"를 분석한다. 콘텐츠 기반 추천 시스템, 교차 판매(Cross-selling), 매장 레이아웃 재배치, 타겟 프로모션 기획 등에 활용된다. 연관규칙 평가 3대 핵심 지표조건절(A)과 결과절(B) 사이의 규칙(A → B)이 얼마나 유의미한지 평가하는 세 가지 기준이다.지지도 (Support): 전체 거래 중에서 A와 B가 동시에 포함된 거래의 비율이며, 규칙이 얼마나 .. 서포트벡터머신(Support Vector Machine, SVM) SVM의 본질과 학습 목표정답이 있는 데이터를 활용하여 분류(Classification)와 회귀(Regression)를 모두 수행할 수 있는 지도학습 알고리즘이다. 기존 머신러닝 분류기가 '학습 데이터의 오류율 최소화'에 집중한다면, SVM은 미지의 새로운 데이터에 대한 오분류를 낮추기 위해(일반화 능력 극대화) 클래스 간의 간격인 여백(마진, Margin)을 최대화하는 것을 핵심 목표로 삼는다. 초평면 (Hyperplane)두 클래스 데이터를 가장 멀리 떨어뜨려 놓는 최적의 분류 경계선이다.2차원 데이터에서는 직선, 3차원에서는 평면의 형태를 띈다. 서포트 벡터 (Support Vector)각 클래스에 속한 데이터 중에서 초평면과 가장 가까이 위치한 최전선 데이터 포인트들이다.SVM 모델은 오직 이 서.. [인공신경망 5편] 비지도학습과 생성형 모델의 기초 서론지금까지 살펴본 CNN이나 RNN 계열 모델들이 주로 정답(Label)이 주어진 상태에서 분류와 예측을 수행하는 지도학습이었다면, 오토인코더(Auto-encoder)와 GAN은 정답 없이 데이터 자체의 특징과 구조를 파악하거나 새로운 데이터를 생성해 내는 비지도학습(Unsupervised Learning) 기반의 대표적인 아키텍처다. 오토인코더 (Auto-encoder)데이터 압축과 차원 축소 다차원 데이터를 저차원으로 압축했다가 다시 본래의 고차원 데이터로 복원하는 과정을 통해, 데이터의 핵심 특징(Feature)을 찾아내는 비지도학습 모델이다. 하나의 신경망을 두 개 붙여놓은 대칭 형태를 띤다. (입력 계층과 출력 계층의 차원이 동일하다.) 출력값이 원래의 입력값과 최대한 동일해지도록 가중치를 학.. [인공신경망 4편] 시계열 및 자연어 처리 모델의 진화 서론이미지 분류에 CNN이 있다면, 음성 인식이나 텍스트(자연어), 주가 예측과 같이 시간의 흐름(순서)이 존재하는 시퀀스 데이터를 처리하기 위해서는 이전의 정보를 기억하고 활용할 수 있는 특수한 신경망 아키텍처가 필요하다. 이러한 시계열 데이터 처리 모델은 '과거의 정보를 어떻게 잃어버리지 않고 유지할 것인가'를 중심으로 진화해 왔다. RNN (Recurrent Neural Network)데이터가 들어오는 순서대로 내부에 방향성 그래프를 형성하여 시퀀스 데이터를 처리하는 가장 기본적인 순환 신경망이다. 일반 신경망이나 CNN과 달리, 은닉층(중간층)이 순환 구조로 되어 있어 이전 시점의 출력값이 현재 시점의 입력에 다시 영향을 미친다. 이 과정에서 시점마다 같은 가중치를 공유한다. 가중치 업데이트를 위.. [인공신경망 3편] CNN의 이미지 특징 추출 메커니즘 서론이미지나 시각 데이터를 처리할 때 기존의 완전연결 신경망(Fully Connected Network)은 데이터의 형상(공간적 특징)을 잃어버린다는 치명적인 단점이 있다. 이를 극복하기 위해 사람의 시신경 구조를 모방하여, 이미지의 2차원 공간 형상을 유지한 채 특징을 추출하고 패턴을 이해하도록 설계된 아키텍처가 바로 CNN(합성곱 신경망)이다.CNN의 전체 처리 과정은 크게 '특징을 추출하는 과정(합성곱/풀링)'과 '클래스를 분류하는 과정(평탄화/완전연결)'으로 나뉜다. 합성곱 계층(Convolution Layer)의 핵심 요소입력된 이미지 데이터 위를 순회하며 특징을 추출하여 특징지도(Feature Map)를 생성하는 단계다.1 | 필터(Filter) / 커널(Kernel):이미지의 특징을 찾기 위.. 이전 1 2 3 4 ··· 19 다음