오픈소스기반데이터분석 14강 - 비정형 데이터 분석 일정한 표 구조를 갖지 않는 이미지, 영상, 음성, 텍스트의 특징과 분석 가치를 이해한다. RSS를 이용한 데이터 수집에서 VLM 기반 이미지 해석, LLM 기반 키워드 추출, 워드클라우드와 보고서 작성으로 이어지는 비정형 데이터 분석 과정을 단계별로 정리한다. 제1장 비정형 데이터의 이해 1. 비정형 데이터의 정의 비정형 데이터는 일정한 형식이나 구조 없이 저장된 정보를 말한다. 행과 열이 분명한 표 형식의 데이터와 달리 이미지, 영상, 음성, 자연어 텍스트처럼 형태가 다양하며, 각각의 자료가 담고 있는 의미를 파악하려면 자료 유형에 맞는 분석 방법이 필요하다. 비정형이라는 표현은 데이터에 아무런 정보가 없다는 뜻이 아니다. 오히려 사진의 색상과 스타일, 영상의 장면, 음성의 내용과 분위기, 문장의 맥락처럼 풍부한 정보를 포함하지만, 이 정보가 전통적인 표 형태로 곧바로 정리되어 있지 않다는 뜻이다. 따라서 분석에 앞서 데이터의 의미를 추출하고 분석 가능한 형태로 바꾸는 과정이 중요하다. 핵심 정의: 비정형 데이터는 일정한 형식이나 구조 없이 저장된 이미지, 영상, 음성, 텍스트 등의 정보이며, 자료의 의미를 분석 가능한 정보로 변환하는 과정이 필요하다. 2. 비정형 데이터의 특징 강의에서는 비정형 데이터가 전체 데이터의 약 70%를 차지할 정도로 정형 데이터보다 양이 압도적으로 많다고 설명한다. 웹 기사, 사회관계망 게시물, 제품 사진, 고객 음성 등 현실에서 생성되는 많은 정보가 비정형 형태로 존재하기 때문이다. 비정형 데이터는 정보량이 풍부한 반면 전통적인 분석 방식만으로는 처리하기 어렵다. 예를 들어 의류 사진 한 장에는 색상, 소재, 실루엣, 계절감과 스타일이 함께 나타나지만, 사진 자체에는 이러한 속성이 별도의 열로 기록되어 있지 않다. 분석을 위해서는 이미지에서 필요한 특징을...