ADsP
3과목
11
업데이트 2026.08.11

ADsP 통계와 데이터 마이닝 핵심: 결과를 읽는 순서

기술통계, 가설검정, 회귀, 분류와 군집에서 무엇을 먼저 확인해야 하는지 ADsP 문제 풀이 관점으로 연결해 정리합니다.

작성·검수 가풀 · 최종 검수 2026.08.11 · 공식 자료 확인 2026.08.11

이 글의 핵심

통계 문제는 모집단과 표본, 변수 척도, 분석 목적을 먼저 확인해야 합니다.

가설검정은 유의수준과 유의확률의 비교 뒤에 결론을 내려야 합니다.

분류 모델 평가는 정확도 하나가 아니라 오류 비용과 클래스 불균형을 함께 봐야 합니다.

평균보다 먼저 데이터의 모양을 확인하기

평균은 모든 값을 반영하지만 극단값의 영향을 크게 받습니다. 소득이나 거래금액처럼 한쪽으로 긴 분포에서는 중앙값과 사분위수를 함께 보아야 대표값을 잘못 해석하지 않습니다.

분산과 표준편차는 값이 중심에서 얼마나 퍼져 있는지를 나타냅니다. 단위가 다른 두 변수의 상대적 산포를 비교할 때는 단순 표준편차 대신 평균을 고려한 변동계수 같은 지표가 필요한지도 확인합니다.

가설검정 문제를 푸는 고정 순서

먼저 차이가 없거나 효과가 없다는 귀무가설과 확인하려는 대립가설을 적습니다. 그다음 검정통계량과 유의확률을 구하고, 유의확률이 유의수준보다 작으면 귀무가설을 기각합니다.

귀무가설을 기각하지 못했다고 해서 귀무가설이 참으로 증명된 것은 아닙니다. 현재 표본만으로 차이를 확인할 충분한 근거가 없다는 뜻입니다. 이 문장 차이가 선택지에서 자주 함정으로 사용됩니다.

가설검정 판단 메모
1. 귀무가설과 대립가설 설정
2. 유의수준 확인
3. 유의확률과 유의수준 비교
4. 기각 또는 기각하지 못함으로 결론
5. 업무 문장으로 해석

회귀와 분류를 출력값으로 구분하기

회귀는 연속적인 수치를 예측하고 분류는 정해진 범주를 예측합니다. 선형회귀의 계수는 다른 조건이 같을 때 독립변수가 한 단위 변할 때 종속변수의 평균적인 변화량으로 해석합니다.

분류에서는 혼동행렬을 먼저 그리세요. 실제 양성을 놓치면 큰 문제가 되는 질병 탐지나 이상거래 탐지에서는 재현율이 중요하고, 양성으로 판단한 결과의 신뢰성이 중요하면 정밀도를 더 주의 깊게 봅니다.

지표계산 관점중요한 상황
정확도전체 중 맞힌 비율클래스 비율이 비교적 균형일 때
정밀도양성 예측 중 실제 양성거짓 양성 비용이 클 때
재현율실제 양성 중 찾아낸 비율거짓 음성 비용이 클 때
F1정밀도와 재현율의 조화평균두 오류를 함께 관리할 때

군집과 연관분석에서 정답을 찾는 단서

군집은 미리 정해진 정답 없이 유사한 대상을 묶는 비지도학습입니다. 거리 기준과 변수의 척도에 민감하므로 표준화가 필요한 상황을 구분하고 군집 수를 정하는 방법의 목적을 이해해야 합니다.

연관분석은 함께 발생하는 항목의 규칙을 찾습니다. 지지도는 규칙 자체의 빈도, 신뢰도는 조건이 발생했을 때 결과가 함께 발생한 비율, 향상도는 우연한 동시 발생과 비교한 연관의 강도로 해석합니다.

알고리즘 이름을 외우기 전에 지도학습인지, 목표 변수가 있는지, 출력이 수치·범주·군집·규칙 중 무엇인지부터 표시하세요.

자체 제작 사례: 정확도만 높은 분류 모델을 다시 평가하기

전체 100건 중 정상 95건, 이상 5건인 데이터에서 모든 건을 정상으로 예측한 모델을 가정합니다.

  1. 정확도는 95%지만 이상 사례를 한 건도 찾지 못했다는 사실을 혼동행렬에 표시합니다.
  2. 이상 탐지가 목적이라면 재현율과 정밀도를 함께 확인해야 함을 정리합니다.
  3. 업무에서 놓친 이상과 잘못 경보한 정상 중 어느 비용이 큰지에 따라 평가 지표를 선택합니다.

평가 지표는 숫자가 큰 것을 고르는 문제가 아니라 분석 목적과 오류 비용에 맞춰 해석해야 합니다.

흔한 오답 사고 바로잡기

p값이 작으면 귀무가설이 거짓일 확률이 그만큼 작다는 뜻으로 해석한다.

왜 틀리는가: p값은 귀무가설이 참이라는 조건 아래 현재와 같거나 더 극단적인 자료가 관측될 가능성에 관한 값입니다.

올바른 확인법: 유의수준과 비교해 판단하되 효과 크기, 표본 수, 분석 가정을 함께 확인합니다.

복습 체크리스트

분석 목적과 목표 변수를 먼저 정의

통계량의 입력과 해석을 말로 설명

혼동행렬에서 오류 종류 직접 계산

모델 성능과 과적합 여부를 분리해 점검


자주 묻는 질문

상관관계가 높으면 인과관계도 있다고 볼 수 있나요?

아닙니다. 상관은 함께 변하는 정도를 나타낼 뿐 원인과 결과를 증명하지 않습니다. 숨은 변수나 우연한 관계의 가능성을 별도로 검토해야 합니다.

정확도가 높은 모델이 항상 좋은 모델인가요?

클래스가 불균형하면 다수 클래스만 예측해도 정확도가 높아질 수 있습니다. 업무상 중요한 오류가 무엇인지 정하고 정밀도, 재현율, F1, ROC 계열 지표를 함께 확인해야 합니다.

검수 기준과 공식 자료

이 글은 가풀이 직접 작성·검수했으며 실제 기출문제나 복원문제를 옮기지 않았습니다. 시험 일정과 세부 규정은 변경될 수 있으므로 접수 전 아래 공식 공고를 다시 확인하세요.

공식 자료 확인일 2026.08.11 · 가풀 편집 원칙 보기
시험 안내

ADsP 시험 구성과 합격 기준: 3과목 학습 우선순위 잡기

읽기
학습법

ADsP 3주 공부 계획: 개념·통계·모의고사를 배치하는 방법

읽기
시험 안내

SQLD 시험 구성과 합격 기준: 준비 전에 알아야 할 핵심

읽기