이 글의 핵심
통계 문제는 모집단과 표본, 변수 척도, 분석 목적을 먼저 확인해야 합니다.
가설검정은 유의수준과 유의확률의 비교 뒤에 결론을 내려야 합니다.
분류 모델 평가는 정확도 하나가 아니라 오류 비용과 클래스 불균형을 함께 봐야 합니다.
평균보다 먼저 데이터의 모양을 확인하기
평균은 모든 값을 반영하지만 극단값의 영향을 크게 받습니다. 소득이나 거래금액처럼 한쪽으로 긴 분포에서는 중앙값과 사분위수를 함께 보아야 대표값을 잘못 해석하지 않습니다.
분산과 표준편차는 값이 중심에서 얼마나 퍼져 있는지를 나타냅니다. 단위가 다른 두 변수의 상대적 산포를 비교할 때는 단순 표준편차 대신 평균을 고려한 변동계수 같은 지표가 필요한지도 확인합니다.
가설검정 문제를 푸는 고정 순서
먼저 차이가 없거나 효과가 없다는 귀무가설과 확인하려는 대립가설을 적습니다. 그다음 검정통계량과 유의확률을 구하고, 유의확률이 유의수준보다 작으면 귀무가설을 기각합니다.
귀무가설을 기각하지 못했다고 해서 귀무가설이 참으로 증명된 것은 아닙니다. 현재 표본만으로 차이를 확인할 충분한 근거가 없다는 뜻입니다. 이 문장 차이가 선택지에서 자주 함정으로 사용됩니다.
1. 귀무가설과 대립가설 설정
2. 유의수준 확인
3. 유의확률과 유의수준 비교
4. 기각 또는 기각하지 못함으로 결론
5. 업무 문장으로 해석회귀와 분류를 출력값으로 구분하기
회귀는 연속적인 수치를 예측하고 분류는 정해진 범주를 예측합니다. 선형회귀의 계수는 다른 조건이 같을 때 독립변수가 한 단위 변할 때 종속변수의 평균적인 변화량으로 해석합니다.
분류에서는 혼동행렬을 먼저 그리세요. 실제 양성을 놓치면 큰 문제가 되는 질병 탐지나 이상거래 탐지에서는 재현율이 중요하고, 양성으로 판단한 결과의 신뢰성이 중요하면 정밀도를 더 주의 깊게 봅니다.
| 지표 | 계산 관점 | 중요한 상황 |
|---|---|---|
| 정확도 | 전체 중 맞힌 비율 | 클래스 비율이 비교적 균형일 때 |
| 정밀도 | 양성 예측 중 실제 양성 | 거짓 양성 비용이 클 때 |
| 재현율 | 실제 양성 중 찾아낸 비율 | 거짓 음성 비용이 클 때 |
| F1 | 정밀도와 재현율의 조화평균 | 두 오류를 함께 관리할 때 |
군집과 연관분석에서 정답을 찾는 단서
군집은 미리 정해진 정답 없이 유사한 대상을 묶는 비지도학습입니다. 거리 기준과 변수의 척도에 민감하므로 표준화가 필요한 상황을 구분하고 군집 수를 정하는 방법의 목적을 이해해야 합니다.
연관분석은 함께 발생하는 항목의 규칙을 찾습니다. 지지도는 규칙 자체의 빈도, 신뢰도는 조건이 발생했을 때 결과가 함께 발생한 비율, 향상도는 우연한 동시 발생과 비교한 연관의 강도로 해석합니다.
알고리즘 이름을 외우기 전에 지도학습인지, 목표 변수가 있는지, 출력이 수치·범주·군집·규칙 중 무엇인지부터 표시하세요.
자주 묻는 질문
상관관계가 높으면 인과관계도 있다고 볼 수 있나요?
아닙니다. 상관은 함께 변하는 정도를 나타낼 뿐 원인과 결과를 증명하지 않습니다. 숨은 변수나 우연한 관계의 가능성을 별도로 검토해야 합니다.
정확도가 높은 모델이 항상 좋은 모델인가요?
클래스가 불균형하면 다수 클래스만 예측해도 정확도가 높아질 수 있습니다. 업무상 중요한 오류가 무엇인지 정하고 정밀도, 재현율, F1, ROC 계열 지표를 함께 확인해야 합니다.
시험 과목과 합격 기준은 KDATA 데이터분석 준전문가 공식 안내를 기준으로 확인했습니다. 가풀은 시험 주관기관의 공식 서비스가 아니며, 일정과 규정은 접수 전 공식 공고를 다시 확인해야 합니다.