- 기록 번호
- No. 181
- 분류
- 데이터 저널리즘
- 읽는 시간
- 약 6분
- 수정
접수
공공데이터포털에서 기사 소재 찾는 법: 데이터 저널리즘 실전 가이드
요약공공데이터포털에서 기사 소재를 찾는 검색어 조합, 데이터 유형 선택, 파일·오픈API 활용, 저작권과 검증 체크리스트를 실무형으로 정리했습니다.
기사거리는 이미 공개돼 있는데 왜 우리는 자주 놓칠까요? 공공데이터포털에서 기사 소재 찾는 법은 단순히 CSV 파일을 내려받는 기술이 아니라, 공개된 숫자에서 사회적 질문을 발견하는 취재 방식입니다. 지역 안전, 의료 접근성, 교통사고, 환경 민원, 예산 집행처럼 시민 생활과 가까운 문제는 공공기관 데이터 안에 흔적을 남깁니다. 중요한 것은 검색창에 무엇을 넣고, 어떤 필터를 적용하며, 상세페이지의 어떤 항목을 의심하고 확인할지입니다.
공공데이터포털은 공공기관이 보유한 데이터를 통합해 제공하는 창구입니다. 공공데이터는 「공공데이터의 제공 및 이용 활성화에 관한 법률」을 배경으로 공개·활용되는 자료이며, 포털에서는 파일데이터와 오픈API 등 여러 형태로 만날 수 있습니다. 다만 공개돼 있다고 해서 곧바로 결론이 되는 것은 아닙니다. 데이터는 취재의 출발점이고, 기사는 가설·검증·맥락·사람의 이야기까지 연결될 때 완성됩니다.

공공데이터포털에서 기사 소재를 찾는다는 뜻
데이터 찾기와 기사 찾기는 다릅니다. 데이터 찾기는 “교통사고 CSV가 있는가”를 확인하는 일이고, 기사 찾기는 “어느 지역에서 어린이 보행 사고가 반복되는가, 최근 정책 이후 줄었는가, 왜 특정 구간에 몰리는가”를 묻는 일입니다. 같은 데이터라도 질문이 없으면 표에 머물고, 질문이 있으면 취재 단서가 됩니다.
좋은 공공데이터 기사 소재는 보통 다섯 가지 조건을 가집니다. 첫째, 최신성이 있어 현재 독자와 연결됩니다. 둘째, 지역·기관·연령·시설 등으로 비교할 수 있습니다. 셋째, 평균에서 벗어난 이상치가 있습니다. 넷째, 예산·사고·민원·서비스처럼 시민에게 영향이 있습니다. 다섯째, 숫자를 확인해줄 현장과 당사자가 존재합니다. 이 기준으로 보면 데이터 목록은 자료 창고가 아니라 기사 아이디어 검색 엔진이 됩니다.
공공데이터포털 기본 메뉴를 취재 관점으로 보기
처음에는 데이터목록을 출발점으로 삼는 것이 좋습니다. 데이터 명칭, 키워드, 설명을 대상으로 검색할 수 있고, 분류체계, 서비스유형, 제공기관유형, 확장자 같은 필터를 조합할 수 있습니다. 서비스유형에는 다운로드, LINK, REST, SOAP, RSS/ATOM, 샘플 및 기타, LOD 연계파일, LOD 연계URL 등이 보일 수 있으며, 확장자는 CSV, XLS, XLSX, JSON, XML, ZIP, TXT, PDF, SHP, GEOJSON처럼 다양합니다. 화면 구성과 제공 방식은 접속 시점과 데이터별로 달라질 수 있으므로, 목록의 숫자 자체보다 필터로 좁혀가는 습관이 더 중요합니다.
공공데이터포털의 공공데이터 이용가이드는 파일데이터, 오픈API, 제공신청, 분쟁조정 등 기본 개념을 확인하기 좋은 공식 안내입니다. 파일데이터는 포털에서 직접 다운로드하거나 기관 사이트로 이동해 받을 수 있는 형태이고, 오픈API는 프로그램이 호출해 데이터를 가져오도록 공개된 인터페이스입니다. 표준데이터셋은 여러 기관의 유사 데이터를 같은 형식으로 모아 비교하기 좋고, 국가중점데이터는 사회적 파급력이 큰 주제를 찾을 때 유용합니다. 국가데이터맵은 한 데이터에서 끝내지 않고 관련 기관과 연관 데이터를 따라가는 데 도움이 됩니다.
검색어는 주제어보다 문제어로 시작하기
초보자가 가장 많이 막히는 지점은 검색창입니다. “복지”, “환경”, “교통”처럼 큰 주제어만 넣으면 목록이 너무 넓어집니다. 기사 아이디어 찾기에는 문제어가 더 좋습니다. 예를 들어 “불법 주정차”, “응급실”, “미세먼지”, “침수”, “빈집”, “폐업”, “민원”, “사고”, “점검”, “위반”, “노후”처럼 갈등과 변화가 드러나는 단어를 넣어보세요. 여기에 지역명, 기관명, 사건명, 정책명을 붙이면 취재 범위가 좁아집니다.
검색식은 넓게 시작한 뒤 좁히면 됩니다. “교통사고”로 전체 흐름을 보고, “어린이 보호구역 교통사고”, “서울 교통사고”, “보행자 사고”, “무인단속”처럼 갈라보는 식입니다. 보건의료라면 “응급의료”, “병상”, “의료기관”, “감염병”, “약국”을 비교하고, 환경이라면 “대기오염”, “악취”, “폐수”, “재난”, “침수”를 조합합니다. 인기 검색어나 추천 데이터는 정답이 아니라 단서입니다. 많은 사람이 찾는 데이터일수록 이미 보도된 주제일 수 있으므로, 지역·기간·대상자를 바꾸어 새 질문을 만들어야 합니다.

상세페이지에서 먼저 확인해야 할 항목
목록에서 마음에 드는 데이터를 찾았다면 곧바로 내려받기 전에 상세페이지를 읽어야 합니다. 제공기관은 데이터의 책임 소재와 해석 문의처를 알려줍니다. 수정일과 갱신주기는 최신성을 판단하는 기준입니다. 데이터가 2024년에 수정됐더라도 컬럼 안의 기준일자가 2022년일 수 있으므로, 파일 내부의 기준일도 반드시 확인해야 합니다.
컬럼명은 기사 질문의 재료입니다. 주소, 시군구, 시설명, 발생일, 건수, 금액, 상태, 처리결과 같은 컬럼이 있으면 비교와 추적이 가능합니다. 반대로 PDF만 제공되거나 컬럼 설명이 부족하면 분석 난도가 높아집니다. 조회수, 다운로드 수, 활용신청 수는 관심도를 보여줄 수 있지만 기사 가치와 동일하지는 않습니다. 조회수가 낮은 데이터라도 지역 문제와 연결되면 좋은 소재가 될 수 있습니다.
저작권과 이용허락 범위도 상세페이지에서 확인해야 합니다. 공공데이터는 별도 신청 없이 이용 가능한 경우가 많지만, 제3자 권리나 공공누리 유형에 따라 출처표시, 상업적 이용 가능 여부, 변경 가능 여부가 달라질 수 있습니다. 기사에는 최소한 데이터명, 제공기관, 기준일, 내려받은 날짜를 남기고, 그래프나 표를 가공했다면 “원자료를 바탕으로 재가공”했다는 점을 밝혀야 독자가 검증할 수 있습니다.
파일데이터와 오픈API 중 무엇을 선택할까
데이터 저널리즘을 처음 시작한다면 CSV나 XLSX 파일데이터부터 권합니다. 엑셀, 구글 스프레드시트, 간단한 피벗테이블만으로 지역별 합계, 연도별 변화, 상위 10개 기관, 누락값을 빠르게 볼 수 있기 때문입니다. 파일데이터는 한 시점의 자료를 내려받아 분석하는 데 강하고, 보도 전 원자료를 보관하기도 쉽습니다. 기사 마감이 짧거나 코딩 경험이 적다면 파일데이터가 현실적인 선택입니다.
오픈API 활용은 데이터가 자주 바뀌거나 양이 많을 때 유리합니다. 실시간 교통, 대기질, 시설 운영 현황, 반복 수집이 필요한 자료는 JSON이나 XML API로 가져오는 편이 효율적일 수 있습니다. 다만 오픈API는 개발계정·운영계정, 자동승인·심의승인, 인증키 발급 같은 절차가 데이터별로 다를 수 있습니다. 모든 API가 같은 방식으로 열리는 것은 아니므로 상세페이지의 활용신청 안내와 호출 예시를 확인해야 합니다.

기사 소재를 뽑는 7가지 질문
다운로드한 표를 열었다면 숫자를 보기 전에 질문 목록을 만드세요. 첫째, 시간이 지나며 수치가 변했는가. 월별·연도별 변화는 정책 효과나 사회 변화의 단서가 됩니다. 둘째, 지역별 격차가 있는가. 같은 인구 규모인데 사고, 민원, 시설 수가 크게 다르면 왜 그런지 물을 수 있습니다. 셋째, 예산·시설·사고·민원이 한쪽에 몰렸는가. 집중은 우연일 수도 있고 구조적 문제일 수도 있습니다.
넷째, 정책 발표와 실제 데이터가 일치하는가. “확대”, “개선”, “강화”라는 발표 뒤 실제 건수와 예산, 시설 접근성이 어떻게 변했는지 확인합니다. 다섯째, 누락값이나 비정상값이 의미 있는 단서인가. 0이 실제 0인지 미입력인지, 특정 기관만 값이 비어 있는지 확인해야 합니다. 여섯째, 다른 데이터와 결합하면 새로운 사실이 보이는가. 사고 데이터에 인구, 학교, 노인시설, 도로 정보를 붙이면 더 정교한 질문이 됩니다. 일곱째, 영향을 받는 시민의 이야기를 찾을 수 있는가. 숫자가 가리키는 현장과 사람을 만나야 기사가 독자에게 닿습니다.
실제 취재 흐름으로 바꿔보기
교통 데이터를 예로 들어보겠습니다. “교통사고”를 검색해 사고 위치와 유형이 있는 파일을 찾고, 확장자를 CSV나 XLSX로 좁힙니다. 상세페이지에서 기준일, 제공기관, 컬럼 설명을 확인한 뒤 시군구별 사고 건수를 계산합니다. 여기서 끝내면 단순 순위 기사입니다. “어린이 보호구역 주변 사고가 늘었는가”, “보행자 사고가 특정 도로에 반복되는가”, “단속 장비 설치 후 변화가 있었는가”로 질문을 바꾸면 취재가 시작됩니다.
보건의료 데이터는 지역 격차를 보기 좋습니다. 응급의료기관, 병상, 약국, 보건기관 같은 데이터를 인구 데이터와 함께 보면 단순 시설 수보다 접근성 질문을 만들 수 있습니다. 환경·재난안전 데이터는 반복 패턴이 중요합니다. 침수, 악취, 미세먼지, 산불, 폭염쉼터 데이터를 월별·지역별로 보면 계절성과 취약 지역이 드러납니다. 문화관광·상권 데이터는 지역 변화 기사에 적합합니다. 관광객, 공영주차장, 전통시장, 폐업, 축제 데이터를 연결하면 정책 홍보와 실제 방문·소비 흐름을 비교할 수 있습니다.
기사에 쓰기 전 검증 체크리스트
공공데이터는 공신력 있는 출처에서 왔더라도 항상 정확하다고 단정해서는 안 됩니다. 원자료 파일, 상세페이지 캡처 또는 PDF, 내려받은 날짜, 제공기관명, 데이터 설명을 함께 저장하세요. 기준일, 집계 방식, 단위도 확인해야 합니다. 건수인지 인원인지, 누적인지 월별인지, 주소 기준인지 발생지 기준인지가 달라지면 해석이 완전히 달라집니다.
개인정보와 소수값도 조심해야 합니다. 공공데이터가 비식별 처리되어 있더라도 작은 지역, 희귀 사례, 특정 날짜를 결합하면 개인이나 소규모 집단을 추정할 위험이 생길 수 있습니다. 범죄, 질병, 복지, 아동, 장애, 이주민 관련 데이터는 특히 조심스럽게 다루고, 특정 개인이나 집단의 책임을 데이터 하나로 단정하지 않아야 합니다. 필요한 경우 범위를 넓혀 집계하거나 일부 값을 비공개 처리하는 편이 안전합니다.
마지막으로 담당기관에 해석을 확인하세요. 누락값이 왜 생겼는지, 특정 연도에 집계 방식이 바뀌었는지, 기관 통합이나 행정구역 개편이 있었는지 물어보면 오보를 줄일 수 있습니다. 데이터로 말할 수 있는 것은 “이 자료의 기준과 범위 안에서 이런 패턴이 관찰된다”는 점입니다. 원인과 책임, 정책 효과는 추가 자료와 현장 취재로 검증해야 합니다.

공개되지 않은 자료가 필요할 때
검색해도 필요한 자료가 없다면 데이터요청이나 공공데이터 제공신청을 검토할 수 있습니다. 포털에 등록되지 않은 데이터라도 공공기관이 보유·관리하는 자료라면 신청 절차를 통해 제공 여부를 확인할 수 있습니다. 일반적으로 신청 후 일정 기간 안에 제공 여부가 결정되며, 필요한 경우 연장될 수 있습니다. 다만 비공개 사유, 개인정보, 제3자 권리, 시스템 사정 등에 따라 원하는 형태로 받지 못할 수도 있습니다.
제공 거부나 제공 중단이 있을 때는 공공데이터 분쟁조정 제도도 안내되어 있습니다. 이는 법률 자문이 아니라 제도 소개 수준으로 이해하면 됩니다. 취재 실무에서는 제공신청과 별도로 기관 홈페이지, 지방자치단체 열린데이터, 통계청, 보건복지·환경·교통 관련 전문 포털, 국회·지방의회 회의록도 함께 살피는 것이 좋습니다. 같은 주제라도 데이터의 기준과 목적이 다르기 때문에 여러 출처를 대조해야 더 단단한 기사가 됩니다.
공공데이터포털은 기사 소재 검색 엔진이다
공공데이터포털 활용법의 핵심은 다운로드 버튼을 찾는 데 있지 않습니다. 문제어로 검색하고, 필터로 좁히고, 상세페이지에서 기준과 한계를 확인한 뒤, 파일데이터나 오픈API를 목적에 맞게 선택하는 과정이 중요합니다. 그 다음에는 시간 변화, 지역 격차, 이상치, 정책과 현실의 차이, 누락값, 결합 가능성, 시민 영향이라는 질문으로 데이터를 다시 읽어야 합니다.
좋은 데이터 기사는 표에서 시작하지만 표에서 끝나지 않습니다. 출처를 밝히고, 이용허락 범위를 확인하고, 개인정보와 소수값을 조심하며, 담당기관과 현장을 통해 해석을 검증해야 합니다. 그렇게 할 때 공공데이터 검색은 단순 자료 수집을 넘어 사회를 설명하는 기사 아이디어 찾기의 강력한 도구가 됩니다.