데이터/분석기초

통계학 기초 핵심 개념 정리 — 마케터를 위한 실무 가이드

모집단과 샘플, 상관관계 vs 인과관계, 기초 통계량, 확률, 베이지안 추론, 정규분포까지. 마케팅 실무에서 바로 쓸 수 있는 통계 개념 정리.

20분 읽기Shane (심재완)
통계학 기초 핵심 개념 정리 — 마케터를 위한 실무 가이드
마케터를 위한 통계학 기초 개념 정리

1. 통계학이란?

"통계적 사고란 세상을 감정이 아닌 데이터로 바라보되, 상관관계를 인과관계로 착각하지 않고, 샘플의 한계를 인지하며, 불확실성 속에서 더 나은 의사결정을 하는 것이다."

통계학은 데이터를 수집, 분석, 해석, 표현하는 학문입니다. 마케터에게 통계학이 중요한 이유는 단순합니다. 잘못된 데이터 해석은 잘못된 의사결정으로 이어지고, 이는 광고비 낭비와 성장 기회 상실로 이어집니다.

통계학의 두 축목적마케팅 예시
기술 통계 (Descriptive)데이터를 요약하고 설명평균 전환율, 중앙값 주문금액 계산
추론 통계 (Inferential)샘플로 모집단을 추론A/B 테스트로 전체 고객 반응 예측

2. 모집단과 샘플

모집단(Population)은 우리가 알고 싶은 전체 집합입니다. 샘플(Sample)은 그 중 일부를 뽑은 것입니다. 마케팅에서는 전체 고객이 모집단이고, A/B 테스트에 참여한 고객이 샘플입니다.

샘플링 편향의 종류

편향 유형설명마케팅 예시
생존자 편향성공한 사례만 보임후기를 남긴 만족 고객만 분석
선택 편향무작위가 아닌 선택이메일 오픈율 = 관심 있는 구독자만 열람
확증 편향기대에 맞는 데이터만 주목성공한 캠페인만 보고 전략 결정
시간적 편향특정 기간 데이터만 봄성수기 데이터로 연간 성과 판단

샘플 크기도 중요합니다. 너무 작은 샘플은 우연에 의한 변동이 크고, 결론의 신뢰도가 낮습니다. A/B 테스트에서 충분한 샘플 크기 없이 조기 종료하면 잘못된 승자를 선택할 수 있습니다.

3. 정량 변수 vs 정성 변수

구분종류예시분석 방법
정량 변수연속형구매금액, 체류 시간평균, 분산, t-test
이산형구매 횟수, 클릭 수빈도, 포아송 분포
정성 변수명목형성별, 유입 채널빈도 분석, 카이제곱 검정
순서형만족도 (1~5), 등급중앙값, 스피어만 상관

4. 상관관계 vs 인과관계

마케터가 가장 자주 저지르는 통계적 오류입니다.

구분의미확인 방법
상관관계두 변수가 함께 변함피어슨/스피어만 상관계수
인과관계하나가 다른 하나를 유발함무작위 대조 실험(RCT)

허위 상관관계 (Spurious Correlation) 예시

변수 A변수 B숨겨진 변수 (혼동 변수)
아이스크림 판매량익사 사고 건수여름 기온
광고 클릭 수 증가매출 증가시즌 수요 증가
이메일 오픈율구매 전환율이미 구매 의향이 높은 세그먼트

마케팅에서 인과관계를 확인하는 가장 강력한 방법은 무작위 대조 실험(A/B 테스트)입니다. 참여자를 무작위로 실험군과 대조군으로 나누면 혼동 변수의 영향을 평균적으로 제거할 수 있습니다.

5. 기초 통계량

통계량정의마케팅 활용주의사항
평균 (Mean)합계 / 개수평균 주문금액 (AOV)이상값에 민감
중앙값 (Median)정렬 후 중간값고가 주문이 많을 때 대표값이상값에 강건
최빈값 (Mode)가장 자주 나오는 값가장 많이 팔린 가격대여러 개 존재 가능
분산 / 표준편차평균으로부터의 흩어진 정도광고 성과의 일관성 측정높을수록 불안정
백분위수n%가 이 값 이하상위 10% 고객 구매금액 (P90)분포 이해에 필수

e-커머스에서 평균 주문금액(AOV)보다 중앙값이 더 유용한 경우가 많습니다. 일부 고가 주문이 평균을 끌어올려 실제 대부분 고객의 구매 행동을 왜곡하기 때문입니다.

6. 확률의 기초

개념정의마케팅 예시
독립 사건하나의 발생이 다른 것에 영향 없음각 광고 클릭은 독립적
조건부 확률P(A|B) = A가 B 조건 아래 일어날 확률장바구니 담은 후 구매 전환율
기대값결과 값 × 확률의 합LTV = 구매 확률 × 평균 주문금액

p-value는 "귀무가설이 참일 때 관찰된 결과만큼 극단적인 결과가 나올 확률"입니다. p<0.05는 그 확률이 5% 미만임을 의미합니다. 이것이 "통계적으로 유의미하다"의 기준이 됩니다. 하지만 통계적 유의미함이 실질적 의미를 보장하지는 않습니다.

7. 베이지안 추론

베이지안 추론은 사전 지식(prior)과 새 데이터를 결합해 확률을 업데이트합니다. 마케팅에서 데이터가 적을 때 특히 유용합니다.

P(A|B) = P(B|A) × P(A) / P(B)

사후 확률 = (가능도 × 사전 확률) / 정규화 상수

요소의미마케팅 예시
사전 확률 (Prior)데이터 수집 전 기존 믿음과거 캠페인 전환율이 2%였다
가능도 (Likelihood)새 데이터가 관찰될 확률이번 테스트에서 100명 중 3명 전환
사후 확률 (Posterior)업데이트된 믿음전환율 예측이 2.3%로 업데이트됨

베이지안 A/B 테스트는 전통적인 빈도주의 A/B 테스트보다 직관적인 해석이 가능합니다. "B가 A보다 좋을 확률이 95%" 같은 방식으로 결과를 표현할 수 있어, 마케터가 실질적 의사결정을 내리기 더 쉽습니다.

8. 정규분포

정규분포(Normal Distribution)는 통계학에서 가장 중요한 분포입니다. 평균을 중심으로 좌우 대칭의 종 모양(bell curve)을 이룹니다.

범위포함 비율마케팅 활용
평균 ± 1 표준편차약 68%대부분 고객의 행동 범위
평균 ± 2 표준편차약 95%신뢰구간 95%의 기반
평균 ± 3 표준편차약 99.7%극단값 탐지 기준

마케팅 데이터는 종종 정규분포를 따르지 않습니다. 구매금액은 오른쪽으로 긴 꼬리(right-skewed)를 가집니다. 이 경우 평균보다 중앙값이 더 대표적인 값이 됩니다.

9. 설문조사의 함정

설문조사는 마케팅에서 자주 쓰이는 데이터 수집 방법이지만, 여러 통계적 함정이 있습니다.

함정내용해결 방법
유도 질문"얼마나 좋은지" 같은 긍정 전제중립적 언어 사용
응답자 편향극단적으로 만족/불만족인 사람만 응답인센티브 설계, 무작위 샘플링
사회적 바람직성 편향"옳은" 답을 하려는 경향익명 보장, 간접 질문
기억 편향과거 행동을 잘못 기억최근 경험 묻기, 행동 데이터 병행

10. 데이터 시각화

올바른 시각화는 데이터를 이해하고 전달하는 데 필수적입니다. 잘못된 시각화는 오해를 유발합니다.

차트 유형적합한 데이터마케팅 활용
라인 차트시간에 따른 변화일별 매출 트렌드, ROAS 추이
바 차트카테고리 간 비교채널별 전환 수 비교
산점도두 변수의 관계광고비 vs 매출 상관관계
히스토그램분포 형태주문금액 분포, 고객 구매 빈도 분포
파이 차트전체 중 비율 (항목이 적을 때)채널 기여도 비율 (3~5개)

시각화의 가장 흔한 오류는 y축을 0에서 시작하지 않아 변화를 과장하는 것입니다. 또한 같은 데이터를 어떤 차트로 표현하느냐에 따라 메시지가 완전히 달라질 수 있습니다. 항상 데이터를 왜곡하지 않는 정직한 시각화를 선택해야 합니다.

자주 묻는 질문 (FAQ)

상관관계와 인과관계의 차이는 무엇인가요?
상관관계는 두 변수가 함께 변한다는 것을 의미합니다. 인과관계는 하나가 다른 하나를 직접 유발한다는 것입니다. 상관관계가 있어도 인과관계가 없을 수 있습니다. 마케터가 가장 흔히 저지르는 실수 중 하나가 상관관계를 인과관계로 해석하는 것입니다.
베이지안 추론이란 무엇인가요?
베이지안 추론은 사전 확률(prior)과 새로운 데이터(likelihood)를 결합해 사후 확률(posterior)을 업데이트하는 방법입니다. 데이터가 적을 때도 기존 지식을 반영해 합리적인 추론을 할 수 있어 마케팅 실무에서 매우 유용합니다.
마케터가 통계를 알아야 하는 이유는 무엇인가요?
데이터 기반 의사결정이 마케팅의 표준이 되었습니다. A/B 테스트 결과를 올바르게 해석하고, 샘플 편향을 인지하고, 상관관계를 인과관계로 착각하지 않으려면 기초 통계 개념이 필수입니다. 통계 없이는 데이터를 보고도 잘못된 결론을 낼 수 있습니다.

더 많은 인사이트가 필요하신가요?

너드보드 기술 블로그에서 더 많은 글을 확인하세요