“두 지표가 같은 기간에 함께 증가했다”는 사실만으로 한 지표가 다른 지표의 원인이라고 말할 수 있을까? 데이터 저널리즘에서 상관관계와 인과관계를 구분하려면 눈에 띄는 패턴을 발견한 뒤, 시간적 순서와 제3의 변수, 표본 구성, 분석 설계를 차례로 검증해야 한다. 이 과정을 생략하면 정확한 계산으로도 잘못된 기사를 만들 수 있다.
기사화하기 전에는 세 가지를 먼저 질문해 보자. 두 변수가 실제로 함께 움직이는가, 원인으로 지목한 사건이 결과보다 먼저 발생했는가, 두 현상을 동시에 설명하는 다른 요인은 없는가? 첫 질문은 상관관계를 확인하지만, 뒤의 두 질문까지 통과해야 인과관계를 논의할 출발점에 설 수 있다.
상관관계와 인과관계는 어떻게 다른가
상관관계는 두 변수의 변화가 일정한 방식으로 함께 나타나는 통계적 관계다. 한 변수가 커질 때 다른 변수도 커지면 양의 상관, 한쪽이 커질 때 다른 쪽이 작아지면 음의 상관이라고 한다. 반면 인과관계는 한 사건이나 변수의 변화가 다른 결과의 변화를 실제로 유발하는 관계다. 캐나다 통계청의 상관관계와 인과관계 안내도 관계의 방향과 강도를 파악하는 일과 그 원인을 설명하는 일을 구별한다.
예를 들어 여름철 아이스크림 판매량과 일광화상 신고가 함께 증가할 수 있다. 그렇다고 아이스크림이 일광화상을 일으키는 것은 아니다. 더운 날씨와 강한 햇빛이 아이스크림 소비와 야외 활동을 모두 늘리는 제3의 변수일 수 있다. 데이터에 나타난 동행은 사실이지만, 그 동행의 이유를 잘못 설명하면 인과관계 보도는 틀린다.

상관계수가 알려주는 것과 알려주지 않는 것
상관계수는 두 수치형 변수 사이 선형 관계의 방향과 강도를 요약한다. 값의 절댓값이 크면 관측된 선형 관계가 강하다는 뜻이지, 한 변수가 다른 변수를 일으켰다는 뜻은 아니다. 이상치 하나가 계수를 크게 바꾸거나, 곡선 형태의 관계가 낮은 상관계수로 나타날 수도 있다. 전체 기간에는 강한 관계가 보여도 연령, 지역, 소득 집단으로 나누면 관계가 약해지거나 방향이 바뀌기도 한다.
산점도와 회귀선도 중요한 탐색 도구지만 결론 자체는 아니다. 축의 범위, 집단별 분포, 이상치, 비선형 패턴을 확인하고 원자료의 맥락을 함께 읽어야 한다. 특히 관찰자료에 그린 매끄러운 회귀선은 관계의 평균적 패턴을 보여줄 뿐, 원인에서 결과로 흐르는 경로를 자동으로 증명하지 않는다.
인과관계를 오해하게 만드는 네 가지 함정
제3의 변수와 교란
교란 변수는 원인 후보와 결과 양쪽에 관련되어 둘 사이의 관계를 실제보다 강하거나 약하게 보이게 한다. 교육 수준과 건강 결과를 비교할 때 소득, 나이, 거주 환경이 영향을 줄 수 있는 식이다. 회귀모형에 변수를 추가했다는 이유만으로 교란이 모두 제거되는 것도 아니다. 측정하지 않았거나 잘못 측정한 요인은 모형 밖에 남는다.

역인과성
두 변수의 관련성이 분명해도 원인과 결과의 방향을 거꾸로 해석할 수 있다. 건강 정보 검색량과 질병 신고가 함께 늘었다면 검색이 질병을 늘린 것이 아니라, 증상을 경험한 사람이 검색을 시작했을 가능성이 있다. 자료의 시간 단위가 월별처럼 거칠면 어느 사건이 먼저였는지 가려지기도 한다. 발생 시점과 측정 시점을 분리해 확인해야 한다.
우연과 허위 상관
많은 변수 조합을 시험하면 현실적 설명이 없는 관계도 일부 발견된다. 분석자가 유의한 조합만 골라 기사에 쓰거나 기간을 임의로 잘라내면 우연한 패턴이 중요한 발견처럼 보일 수 있다. 가설을 언제 세웠는지, 몇 개의 비교를 수행했는지, 다른 기간이나 표본에서도 같은 관계가 재현되는지를 점검해야 한다.
선택·측정·정보 편향
온라인 설문 응답자를 전체 시민처럼 해석하거나 특정 플랫폼 이용 기록을 국민 행동으로 확대하면 선택 편향이 생긴다. 기관별 신고 기준이 다르거나 집계 방식이 중간에 바뀌면 측정 편향도 발생한다. 결측치를 제외한 집단이 원래 표본과 다를 수도 있다. 표본이 누구를 포함하고 배제하는지, 변수 정의와 수집 방식이 기간 내내 동일한지 확인해야 한다.
데이터 저널리즘에서 인과관계를 점검하는 순서
- 질문과 변수를 분명히 한다. 원인 후보, 결과, 대상 집단, 분석 기간을 한 문장으로 적는다. ‘고용’이 취업자 수인지 고용률인지처럼 지표의 분모와 단위를 확인한다.
- 출처와 생성 과정을 추적한다. 원자료 생산 기관, 수집 목적, 표본 추출법, 포함·제외 기준, 개정 이력을 확인한다. 여러 자료를 결합했다면 지역 코드와 시점의 기준이 같은지도 살핀다.
- 기초 분포를 본다. 최솟값과 최댓값, 결측치, 중복, 이상치, 집단별 표본 수를 확인한다. 그래프의 추세가 소수 관측치에 좌우되는지 원자료와 대조한다.
- 시간적 선후관계를 확인한다. 원인 후보가 결과보다 먼저 발생했는지, 효과가 나타날 만한 시간 간격이 있는지 검토한다. 같은 시점의 단면자료라면 인과 방향 판단에 제약이 있음을 밝힌다.
- 대안 설명을 목록화한다. 제3의 변수, 역인과성, 정책 변화, 계절성, 장기 추세, 기록 기준 변경을 적는다. 분석 결과와 반대되는 설명도 같은 강도로 검토한다.
- 설계와 반복성을 비교한다. 무작위 실험, 자연실험, 준실험, 전후 비교, 반복 연구가 있는지 찾는다. 다른 연구가 같은 방향을 보이는지뿐 아니라 대상과 측정법이 비교 가능한지도 확인한다.
- 주장의 강도를 정한다. 현재 자료가 패턴 탐색인지, 교란을 조정한 관찰연구인지, 개입 효과를 식별하도록 설계된 연구인지 구분한 뒤 기사 문장의 강도를 맞춘다.

p값과 신뢰구간은 인과성 인증서가 아니다
p값은 특정 통계모형과 귀무가설 아래에서 현재 결과만큼 극단적인 결과가 관찰될 가능성과 관련된 값이다. p값이 작다고 해서 연구 가설이 참일 확률을 알려주거나 원인이 입증되는 것은 아니다. 표본이 매우 크면 실질적으로 작은 차이도 통계적으로 유의할 수 있고, 여러 분석 중 유리한 결과만 선택하면 해석이 왜곡될 수 있다.
신뢰구간은 추정치의 정밀도와 불확실성을 읽는 데 도움을 준다. 구간이 넓으면 가능한 효과의 범위가 크다는 신호이며, 좁은 구간도 편향된 표본이나 잘못된 모형을 고쳐 주지는 못한다. CDC의 데이터 분석·해석 지침처럼 점추정치, 신뢰구간, 통계 검정과 함께 우연, 선택 편향, 정보 편향, 교란을 종합적으로 검토해야 한다.
기사에서는 p값만 떼어 쓰지 말고 효과 크기와 신뢰구간, 표본 수, 연구 설계를 함께 제시하는 편이 좋다. “통계적으로 유의했다”와 “현실에서 중요한 차이다”도 구분해야 한다. 결과가 유의하지 않다는 사실 역시 효과가 전혀 없음을 확정하는 것은 아니며, 자료가 충분히 정밀하지 않았을 가능성을 살펴야 한다.
기사 문장은 근거 수준을 그대로 반영해야 한다
“원인이 되었다”, “때문에 증가했다”, “효과가 입증됐다”는 표현은 원인과 결과를 식별할 수 있는 설계와 충분한 검증이 있을 때 사용한다. 단순 비교, 설문, 행정통계의 동시 변화, 관찰자료 회귀분석만 있다면 “관련이 나타났다”, “함께 증가했다”, “연관성이 관찰됐다”, “가능성을 시사한다”가 더 정확하다.
- 위험: “재택근무 때문에 생산성이 높아졌다.”
- 대안: “조사 표본에서는 재택근무 일수와 보고된 생산성 사이에 양의 관련성이 나타났다.”
- 위험: “지원 정책의 효과가 입증됐다.”
- 대안: “정책 시행 뒤 지표가 개선됐지만 다른 경기 요인의 영향은 분리하지 못했다.”
제목과 본문의 강도도 일치해야 한다. 본문에 한계를 적어 놓고 제목에서 “원인 규명”이라고 단정하면 독자는 가장 강한 문장만 기억한다. 연구자가 인과 표현을 사용했더라도 기자는 연구 설계가 그 표현을 지지하는지 확인해야 하며, 보도자료보다 원문과 부록의 방법론을 우선해서 읽어야 한다.
독자가 분석을 재검토할 수 있게 공개할 것
투명성은 자료 링크 하나를 붙이는 데서 끝나지 않는다. 원자료의 출처와 내려받은 날짜, 분석 대상 기간, 표본 범위, 변수 정의, 단위, 결측치와 이상치 처리, 제외 기준, 자료 결합 방식, 사용한 통계모형을 설명해야 한다. 원자료 공개가 개인정보나 이용 조건 때문에 어렵다면 공개할 수 없는 이유와 재현 가능한 집계 수준을 제시한다.
분석 코드와 정제 절차, 주요 판단의 변경 기록을 함께 보관하면 오류 수정도 쉬워진다. 기사에는 독자가 결과를 해석하는 데 필요한 핵심 한계를 짧게 적고, 상세 방법론은 별도 문서로 연결할 수 있다. 그래프에는 축, 단위, 기간, 출처, 표본 수를 표시하고 가상 예시는 실제 관측치와 혼동되지 않도록 명시한다.
게시 버튼을 누르기 전 확인할 질문
- 상관관계와 인과관계를 문장 안에서 구별했는가?
- 원인 후보가 결과보다 먼저 발생했는가?
- 계절성, 소득, 연령 등 제3의 변수를 검토했는가?
- 역인과성과 우연한 패턴의 가능성을 확인했는가?
- 표본이 기사에서 지칭하는 모집단을 대표하는가?
- 변수 정의와 집계 기준이 기간 중 바뀌지 않았는가?
- p값과 상관계수를 인과 증거로 표현하지 않았는가?
- 효과 크기, 신뢰구간, 표본 수를 함께 읽었는가?
- 제목, 그래프, 본문의 주장 강도가 일치하는가?
- 원자료와 분석 방법, 한계를 독자가 확인할 수 있는가?
데이터는 흥미로운 패턴을 보여주지만 원인을 스스로 말하지 않는다. 데이터 저널리즘에서 상관관계와 인과관계를 구분하는 핵심은 계산 하나를 찾는 것이 아니라, 가능한 다른 설명을 체계적으로 제거하고 남은 불확실성을 기사에 정직하게 반영하는 데 있다. 근거가 허용하는 만큼만 말할 때 기사는 더 정확해지고 독자의 신뢰도 오래 유지된다.