# ADSP 핵심 복습 노트

## 1. 지금 우선 복습할 개념

### 1. 회귀분석 해석
- `R^2` = 종속변수의 총변동 중 모형이 설명하는 비율
- `Adjusted R^2` = 독립변수 수를 고려해 보정한 설명력
- 회귀계수의 `p-value`가 작다 = 해당 변수가 유의할 가능성이 큼
- 유의성은 `인과관계`를 뜻하지 않음
- `잔차` = 실제값 - 예측값
- `OLS` = 잔차제곱합을 최소화하는 방법

### 2. 분류 / 회귀 / 군집 구분
- `선형회귀` = 연속형 값 예측
- `로지스틱 회귀` = 범주형 결과의 확률 예측
- `군집분석` = 정답 라벨 없이 비슷한 것끼리 묶음
- `의사결정나무` = 분류와 회귀 모두 가능

### 3. 분류 성능평가
- `Accuracy` = 전체 중 맞춘 비율
- `Precision` = 양성 예측 중 실제 양성 비율
- `Recall` = 실제 양성 중 찾아낸 비율
- `FN` = 실제 양성인데 음성으로 예측한 경우
- `ROC Curve` = `TPR`와 `FPR` 관계 그래프
- `AUC` = 분류 판별 성능

### 4. 연관분석
- `Support` = 전체 거래 중 함께 나온 비율
- `Confidence` = X가 나왔을 때 Y도 나온 비율
- `Lift` = 독립 대비 얼마나 더 함께 나오는가
- `Apriori` 핵심 = 빈발하지 않은 집합의 상위집합도 빈발하지 않음

### 5. 가설검정
- `p-value < alpha` 이면 귀무가설 기각
- `alpha` = 제1종 오류 허용 수준
- `제1종 오류` = 참인 귀무가설 기각
- `제2종 오류` = 거짓인 귀무가설을 기각하지 못함
- `t-test` = 두 집단 평균 비교
- `ANOVA` = 세 집단 이상 평균 비교
- `카이제곱 검정` = 범주형 변수 간 독립성/연관성 검정

## 2. ADSP에서 자주 나오는 핵심 개념

### 데이터 이해 / 기획
- `Top-Down` = 현업 문제와 목표에서 과제 도출
- `Bottom-Up` = 데이터에서 패턴을 찾고 과제 도출
- `CRISP-DM` = 업무 이해 -> 데이터 이해 -> 데이터 준비 -> 모델링 -> 평가 -> 전개
- `KDD` = 선택 -> 전처리 -> 변환 -> 데이터마이닝 -> 해석/평가
- `분석 기획` = 목적, 범위, 자원, 우선순위 설정

### 데이터 저장 구조
- `DW` = 주제지향적, 통합적, 시계열적, 비휘발적
- `DM` = 특정 부서/주제 중심 저장소
- 운영계 데이터 = 실시간 거래 처리 중심
- 분석계 데이터 = 조회, 집계, 의사결정 중심

### 데이터 거버넌스 / 품질
- `데이터 거버넌스` = 표준, 품질, 보안, 관리 체계
- 데이터 품질 = 정확성, 일관성, 완전성 등 확보

### 빅데이터
- `3V` = Volume, Velocity, Variety

## 3. 통계 기초

### 대표값
- `평균` = 합 / 개수, 이상치에 약함
- `중앙값` = 정렬했을 때 가운데 값
- `최빈값` = 가장 자주 나오는 값

### 산포도
- `분산` = 평균으로부터 퍼진 정도
- `표준편차` = 분산의 제곱근
- `IQR` = 3사분위수 - 1사분위수

### 분포
- `정규분포` = 좌우 대칭, 평균 = 중앙값 = 최빈값

### 상관
- `상관계수` = 두 변수 간 선형 관계의 강도와 방향
- 범위는 `-1 ~ 1`
- 상관관계가 있어도 인과관계는 아님

## 4. 전처리와 모델링

### 전처리
- 결측값 처리: 원인, 비율, 중요도를 보고 제거/대체 결정
- 이상치 처리: 무조건 삭제하지 말고 원인과 목적 먼저 확인
- 스케일링: 변수 간 척도 차이 조정
- `정규화/표준화` = 거리 기반 모델, 경사하강법 모델에서 중요

### 변수 선택
- 불필요한 변수 제거
- 해석력 개선
- 예측력 개선
- 과적합 완화
- 다중공선성 완화

### 다중공선성
- 독립변수들끼리 강한 상관관계가 존재하는 현상

### 과적합 / 과소적합
- `과적합` = 훈련 데이터에는 잘 맞지만 일반화 성능 저하
- `과소적합` = 모델이 너무 단순해서 패턴을 못 배움

### 검증
- 일반화 성능은 훈련 데이터만 보고 판단하지 않음
- `테스트 데이터`나 `교차검증`으로 확인
- `교차검증` = 데이터를 나눠 여러 번 학습/검증

## 5. 의사결정나무 / 군집 / 차원축소

### 의사결정나무
- 해석이 비교적 쉬움
- 분류와 회귀 모두 가능
- 좋은 분할 = 불순도 감소
- `엔트로피`가 크다 = 클래스가 많이 섞여 있다
- `가지치기` = 과적합 완화, 일반화 성능 향상

### 군집분석
- 비지도학습
- 비슷한 객체끼리 묶음
- `k-means` = 사전에 정한 `k`개의 군집 중심 사용

### 차원축소
- 변수 수를 줄여 효율 향상
- 잡음 감소
- 시각화 도움
- `PCA` = 분산을 최대한 설명하는 새로운 축 찾기

## 6. 시험 직전 암기 포인트

### 반드시 바로 떠올라야 하는 짝
- `Support / Confidence / Lift`
- `Precision / Recall / Accuracy`
- `Type I Error / Type II Error`
- `Top-Down / Bottom-Up`
- `CRISP-DM / KDD`
- `선형회귀 / 로지스틱 회귀`
- `운영계 / 분석계`
- `DW / DM`

### 자주 틀리기 쉬운 함정
- 유의성은 인과관계가 아님
- 상관관계는 인과관계가 아님
- `R^2`는 설명력이지 유의확률이 아님
- `Recall`은 실제 양성 기준
- `Precision`은 예측 양성 기준
- `FN`은 놓친 경우
- `FP`는 잘못 경보한 경우

## 7. 추천 복습 순서
1. 회귀분석 해석, 로지스틱 회귀, 의사결정나무
2. 분류 성능평가, 혼동행렬, ROC, AUC
3. 연관분석과 Apriori
4. 가설검정, p-value, 제1종/제2종 오류
5. CRISP-DM, KDD, DW, DM, 거버넌스
6. 통계 기초 대표값/산포도/상관/정규분포

## 8. 마지막 팁
- ADSP는 계산 자체보다 `개념 구분`과 `출력 해석` 문제가 많다
- 비슷한 용어를 한 세트로 묶어 암기하면 효율이 좋다
- 오답노트는 길게 쓰지 말고 `왜 틀렸는지 한 줄`만 남기는 게 좋다
