이 글의 핵심
연속값 예측, 범주 분류, 비지도 군집처럼 목표변수와 목적을 먼저 구분합니다.
학습·검증·테스트 데이터의 역할을 나누고 테스트 데이터는 최종 평가에만 사용합니다.
정확도 하나가 아니라 오류 비용과 클래스 불균형을 반영해 지표를 선택합니다.
분석 목적에 맞는 모형 선택
연속형 값을 예측하면 회귀, 정해진 범주를 예측하면 분류, 정답 없이 유사한 관측치를 묶으면 군집을 우선 검토합니다. 문제의 출력 형태와 활용 목적이 모형 이름보다 먼저입니다.
성능뿐 아니라 설명 가능성, 추론 시간, 데이터 크기와 운영 환경도 후보 모형을 비교하는 기준에 포함합니다.
데이터 분할과 교차검증
학습 데이터는 모수를 추정하고 검증 데이터는 후보와 하이퍼파라미터를 선택하는 데 사용합니다. 테스트 데이터는 이 선택에 관여하지 않은 상태로 최종 일반화 성능을 확인해야 합니다.
교차검증은 여러 폴드에서 평가해 한 번의 분할에 따른 우연성을 줄이지만 전처리까지 각 학습 폴드 안에서 수행해야 데이터 누수를 피할 수 있습니다.
분류 평가지표 구분
정밀도는 양성으로 예측한 대상 중 실제 양성의 비율이고, 재현율은 실제 양성 중 찾아낸 비율입니다. 잘못된 경보 비용이 크면 정밀도, 놓친 양성 비용이 크면 재현율을 중요하게 봅니다.
ROC-AUC는 여러 임계값에서 순위 구분 능력을 요약하지만 실제 운영 임계값과 오류 비용을 대신 결정해 주지는 않습니다.
과대적합과 운영 모니터링
학습 성능은 높지만 검증 성능이 낮으면 과대적합을 의심하고 규제, 가지치기, 변수 축소, 데이터 확대 등을 검토합니다. 학습과 검증 곡선을 함께 보면 데이터 부족과 복잡도 문제를 구분하는 데 도움이 됩니다.
배포 후에는 입력 데이터 분포, 성능 지표, 오류 유형을 정기적으로 감시하고 기준을 벗어나면 원인 분석과 재학습 또는 리모델링 절차를 시작합니다.
자체 제작 사례: 사기 탐지에서 재현율과 정밀도 비교하기
사기 거래가 드물고 탐지 누락과 잘못된 경보가 서로 다른 비용을 만드는 분류 모형을 가정합니다.
- 혼동행렬에서 실제 사기, 정상 거래와 모형의 양성·음성 예측을 각각 배치합니다.
- 놓친 사기 비용이 큰 경우 재현율을, 조사 인력 낭비가 큰 경우 정밀도를 우선 지표로 비교합니다.
- 운영 가능한 임계값에서 두 지표와 처리량을 함께 확인한 뒤 최종 모형을 선택합니다.
평가지표는 수학식만 외우는 항목이 아니라 어떤 오류를 더 줄여야 하는지 업무 비용과 연결해 선택하는 기준입니다.
흔한 오답 사고 바로잡기
교차검증 평균이 높으면 같은 데이터로 전처리와 튜닝을 반복해도 일반화 성능이 보장된다고 생각한다.
왜 틀리는가: 전체 데이터에서 먼저 전처리하거나 평가 결과를 보며 반복 선택하면 검증 폴드의 정보가 학습 과정에 새어 성능이 낙관적으로 보일 수 있습니다.
올바른 확인법: 각 폴드 안에서 전처리와 학습을 수행하고 모형 선택에 쓰지 않은 테스트 세트로 마지막 성능을 한 번 더 확인합니다.
복습 체크리스트
목표변수 형태로 회귀·분류·군집 구분
학습·검증·테스트 데이터 역할 분리
혼동행렬에서 오류 비용과 지표 연결
배포 후 데이터 변화와 성능 하락 감시 기준 정의
자주 묻는 질문
정확도가 가장 높은 모형을 항상 선택하면 되나요?
클래스 불균형이나 오류 비용이 있으면 정확도가 높아도 중요한 양성을 놓칠 수 있습니다. 목적에 맞는 지표와 운영 제약을 함께 비교해야 합니다.
교차검증을 하면 테스트 데이터가 필요 없나요?
교차검증도 모형 선택에 사용되므로 최종 선택 과정과 독립된 테스트 데이터가 있어야 일반화 성능을 더 공정하게 확인할 수 있습니다.
검수 기준과 공식 자료
이 글은 가풀이 직접 작성·검수했으며 실제 기출문제나 복원문제를 옮기지 않았습니다. 시험 일정과 세부 규정은 변경될 수 있으므로 접수 전 아래 공식 공고를 다시 확인하세요.
- 빅데이터분석기사 자격시험 공식 안내 — 한국데이터산업진흥원 데이터자격시험