AI로 Excel 데이터 정리하는 방법 (2026 가이드)

데이터 정리가 여전히 업무 시간의 80%를 잡아먹는 이유

데이터 분석가에게 가장 많은 시간을 어디에 쓰는지 물어보면, 거의 항상 같은 답이 돌아옵니다. 바로 데이터 정리입니다. 차트 한 장 그리기 전에, 인사이트 하나 뽑아내기 전에, 원시 데이터는 반드시 정돈되어야 합니다. 중복 행은 병합해야 하고, 날짜 형식 — 여기는 MM/DD/YYYY, 저기는 DD.MM.YYYY — 은 통일해야 합니다. 빈 셀은 결정을 요구합니다: 그대로 둘 것인가, 0으로 채울 것인가, 아니면 보간할 것인가? "Califronia", "Califorrnia" 같은 철자 오류는 카테고리 열에 숨어서 집계를 조용히 망가뜨립니다. 전화번호는 "(555) 123-4567", "+1 555-123-4567", "5551234567" 등 여러 형식으로 같은 열에 섞여 들어옵니다. 시트 간 병합은 한 팀은 "Customer Name"으로, 다른 팀은 "Client Name"으로, 또 다른 팀은 "客户名"으로 열 이름을 지었기 때문에 깨집니다.

이것은 사소한 불편이 아니라 병목 그 자체입니다. 2026년, AI 도구는 이 지형을 완전히 바꿔 놓았습니다. 한때 오후 내내 잡아먹던 작업이 이제 몇 분이면 끝납니다. 지저분한 CSV를 업로드하고 평범한 영어로 필요한 작업을 설명하면, AI가 데이터를 스캔하고, 문제를 진단하고, 수정합니다. 단순 정확 매칭을 넘어선 중복 제거, 지능적인 형식 표준화, 맥락 인식 논리로 결측값을 보완하고, 의미론적 이해를 통해 시트 간 불일치를 조정합니다. 이 가이드는 오늘 바로 사용할 수 있는 실용적인 프롬프트와 도구를 통해 모든 단계를 안내합니다.

AI 기반 중복 제거 — 정확 매칭을 넘어서

Excel의 기본 "중복 제거" 도구에는 근본적인 한계가 있습니다. 셀 값을 문자 단위로 비교한다는 점입니다. 42행에 "John Smith"가 있고 87행에 "J. Smith"가 있으면, Excel은 이 둘을 별개의 레코드로 간주합니다. 한 행에 "Acme Corp."이, 다른 행에 "Acme Corporation"이 있으면 그대로 분리됩니다. 바로 이 지점에서 전통적인 중복 제거는 실패하고 AI는 빛을 발합니다.

AI 모델은 "J. Smith"와 "John Smith"가 동일한 전화번호, 이메일 도메인, 또는 주소를 공유할 때 동일 인물일 가능성이 높다는 것을 이해합니다. "IBM"과 "International Business Machines"이 같은 법인임을 인식합니다. 이를 퍼지 중복 제거(Fuzzy Deduplication) 또는 의미론적 중복 제거라고 하며, 여러 열을 동시에 분석하여 확률적 매칭 점수를 구축하는 방식으로 작동합니다.

다음은 퍼지 중복이 의심되는 데이터셋을 업로드할 때 ChatGPT나 Claude와 함께 사용할 수 있는 실용적인 프롬프트입니다:

프롬프트: "고객 목록을 업로드합니다. 열은 Full Name, Email, Phone, Address, Company입니다. 이름의 사소한 변형(예: 'J. Smith'와 'John Smith', 'Acme Corp.'과 'Acme Corporation')으로 인해 많은 행이 중복 고객일 것으로 의심됩니다. 데이터셋을 스캔하여 중복 가능성이 높은 모든 행을 플래그 지정해 주세요. 각 중복 그룹에 대해 행 번호, 충돌하는 값, 그리고 신뢰도를 보여주세요. 행을 삭제하지 말고 플래그가 지정된 보고서만 생성해 주세요."

Excel 내부에서 더 직접적인 접근 방식을 원한다면, Microsoft Copilot의 Agent Mode(2026년 Excel 365에서 사용 가능)가 네이티브로 퍼지 중복 제거를 수행할 수 있습니다. 데이터 범위를 선택하고 다음과 같이 프롬프트를 입력하기만 하면 됩니다:

Copilot 프롬프트: "이 테이블에서 Name과 Email 열에 대해 퍼지 매칭을 사용하여 중복 행을 찾아주세요. 중복을 그룹화하여 보여주고, 데이터 완전성을 기준으로 유지할 행을 제안해 주세요."

AI는 중복 클러스터를 그룹화된 보기로 반환하며, 가장 완전한 행을 유지 대상으로 플래그 지정합니다. 수식 하나 작성하지 않고도 신속하게 검토하고 삭제를 승인할 수 있습니다.

일관성 없는 형식 자동 수정

일관성 없는 형식은 Excel 분석의 숨은 킬러입니다. 날짜처럼 보이는 열이 실제 날짜 값, 텍스트 문자열("Jan 15, 2026"), 그리고 Excel이 잘못 해석한 숫자가 뒤섞여 있을 수 있습니다. 통화 열은 "$1,200.00", "1200", "1,200元"이 혼재되어 있습니다. 전화번호는 여섯 가지 형식으로 나타납니다. 국가 코드는 어떤 곳에서는 "US", 어떤 곳에서는 "USA", 또 다른 곳에서는 "United States"로 표기됩니다.

AI는 이러한 패턴을 감지하고 몇 초 만에 표준화할 수 있습니다. 문제를 수동으로 식별하고 패턴을 정의해야 하는 Excel의 "텍스트 나누기"나 "빠른 채우기"와 달리, AI는 전체 열을 스캔하여 통일된 형식을 자동으로 제안합니다.

다음은 날짜 불일치를 수정하기 위한 프롬프트 템플릿입니다:

프롬프트: "업로드한 데이터셋의 B열에는 여러 형식의 날짜가 포함되어 있습니다. 일부는 MM/DD/YYYY, 일부는 DD/MM/YYYY, 일부는 'March 5, 2026' 같은 텍스트, 그리고 일부는 시리얼 번호입니다. 존재하는 모든 형식을 감지하고, 어떤 행이 어떤 형식을 사용하는지 알려준 후, 전체 열을 일관된 YYYY-MM-DD 형식으로 변환해 주세요. 값이 모호한 경우(예: '03/04/2026'이 3월 4일인지 4월 3일인지 불분명)에는 검토할 수 있도록 플래그를 지정해 주세요."

숫자 형식의 경우 — 단위 제거, 천 단위 구분 기호 제거, 순수 숫자 값으로 변환 — 다음 프롬프트를 사용하세요:

프롬프트: "E열('Revenue')에는 '$1,200.00', '1200元', '1.2K', '1,200', '1200.00' 같은 값이 포함되어 있습니다. 전체 열을 소수점 둘째 자리까지의 순수 숫자로 표준화해 주세요. '1.2K'는 1200.00으로 변환하세요. 변환이 간단하지 않은 행에 대해서는 변환 전후 비교를 보여주어 제가 확인할 수 있게 해주세요."

데이터가 깨끗한 CSV나 Excel 형식으로 정리되면, Excel의 =IMPORTTEXT()=IMPORTCSV() 함수(2025년 Excel 365에 도입)를 사용하여 정리된 데이터를 통합 문서로 다시 가져올 수 있습니다. 이 함수들은 구분자, 인코딩, 데이터 유형 등의 가져오기 규칙을 수식 안에서 직접 정의할 수 있습니다. 일반적인 워크플로: 지저분한 데이터를 CSV로 내보내고, AI로 정리한 다음, =IMPORTCSV("C:\CleanedData\sales_clean.csv", ",", TRUE)로 가져옵니다. 여기서 세 번째 인수는 첫 행이 헤더임을 지정합니다.

결측값을 지능적으로 찾아 채우기

결측 데이터에 대한 기존 접근 방식은 조잡합니다. 빈 행 삭제, 0으로 채우기, 또는 열 평균으로 채우기. 이러한 방법은 분석을 왜곡합니다. 행을 삭제하면 정보가 손실됩니다. "Salary" 열의 0은 결측값이 아니라 데이터 포인트입니다. 평균 채우기는 하위 그룹 패턴을 무시합니다 — 모든 부서의 평균 연봉은 Engineering 관리자가 얼마를 받을지 전혀 알려주지 못합니다.

AI는 맥락을 바탕으로 결측값을 채웁니다. 동일 행의 관련 열을 살펴보고, 데이터셋 전반의 패턴을 검토하여 정보에 기반한 대체값을 산출합니다. 예를 들어, 어떤 행의 "Region" 값이 누락되었지만 "Zip Code"가 94105이면, AI는 "West Coast — San Francisco"로 추론합니다. "Annual Revenue"가 누락되었지만 "Number of Employees"가 250이고 "Industry"가 "SaaS"이면, AI는 무작정 평균을 내는 대신 업계 벤치마크를 기반으로 타당한 매출 범위를 추정합니다.

다음은 지능형 결측값 보완을 위한 프롬프트입니다:

프롬프트: "업로드한 판매 데이터셋에는 여러 열에 걸쳐 결측값이 산재해 있습니다. 데이터셋을 분석하고, 각 결측값에 대해 동일 행의 관련 열을 기반으로 보완값을 제안해 주세요. 범주형 열(예: 'Region'이 누락되고 'Zip Code'가 존재)의 경우 가장 가능성 높은 값을 추론하세요. 숫자형 열(예: 'Revenue'가 누락되고 'Units Sold'와 'Avg Price'가 존재)의 경우 계산된 값을 산출하세요. 제안 사항을 행 번호, 열 이름, 보완 전 값, 보완 후 제안 값, 추론 근거 열이 포함된 표로 제시해 주세요. 어떤 값도 덮어쓰지 말고 제안만 제공해 주세요."

시계열 데이터 — 월별 판매 수치, 주가, 웹사이트 트래픽 — 의 경우, AI는 추세와 계절성을 반영한 보간을 수행할 수 있습니다:

프롬프트: "이 데이터셋에는 2024년 1월부터 2025년 12월까지의 월별 판매 수치가 있지만, 2025년 3월, 7월, 11월이 비어 있습니다. 데이터는 강한 계절적 패턴(6월과 12월에 최고점)을 보여줍니다. 단순 선형 보간이 아닌, 계절적 패턴과 인접 월을 함께 고려하여 누락된 월을 보간해 주세요. 계산 과정을 보여주세요."

AI는 단순한 =AVERAGE(B2,B4)로는 결코 달성할 수 없는, 인접 월보다 전년 동월에 더 높은 가중치를 부여하는 가중 보간으로 응답할 수 있습니다.

시트 간 데이터 병합 및 조정을 위한 AI

여러 소스의 데이터를 병합하는 작업에서 AI의 의미론적 이해 능력이 진정으로 빛을 발합니다. 전통적인 VLOOKUP이나 INDEX-MATCH는 정확한 열 이름 일치를 요구합니다. 영업팀의 스프레드시트에는 "Customer Name" 열이 있고, 재무팀에는 "Client Name"이 있으며, 물류팀은 "客户名"을 사용할 때, 어떤 수식도 이 간극을 메울 수 없습니다 — 사람이 먼저 열을 수동으로 매핑해야 합니다.

AI는 이 세 열이 동일한 개념을 가리킨다는 것을 이해합니다. 시트 간 열 헤더를 분석하고, 의미론적 등가성을 감지하여 병합 키 매핑을 제안할 수 있습니다. 이 능력은 단순 동의어 매칭을 훨씬 넘어섭니다. AI는 한 시트의 "Invoice Date"가 다른 시트의 "Billing Date"와 대응되고, "PO Number"와 "Purchase Order #"가 동일 필드이며, "Qty"와 "Quantity Ordered"가 정렬되어야 함을 인식합니다.

다음은 시트 간 병합을 위한 프롬프트입니다:

프롬프트: "두 개의 Excel 시트를 업로드합니다. Sheet1(Sales)의 열은 Order ID, Customer Name, Product, Quantity, Order Date입니다. Sheet2(Finance)의 열은 Transaction ID, Client Name, Item, Qty, Invoice Date입니다. 이 둘을 단일 데이터셋으로 병합해야 합니다. 다음을 수행해 주세요: (1) 두 시트 간 의미론적으로 대응되는 열을 식별, (2) 최적의 병합 키(기본 키) 제안, (3) 한 시트에만 존재하는 행 플래그, (4) 동일 Order ID에 대해 충돌하는 값(예: 시트 간 다른 수량)이 있는 행 플래그."

조정 작업의 경우 — 벤더 송장과 구매 주문서 매칭, 창고와 회계 시스템 간 재고 수량 비교 — AI는 단순 IF 비교로는 불가능한 수준의 지능을 제공합니다:

프롬프트: "Sheet A에는 450건의 벤더 송장이 있습니다(열: Vendor, Invoice#, Amount, Date, Description). Sheet B에는 450건의 구매 주문서가 있습니다(열: Supplier, PO#, Total, PO Date, Line Items). 두 시트를 조정해 주세요: 벤더 이름으로 송장과 PO를 매칭하고('Staples Inc.'와 'Staples' 같은 변형 처리), 금액을 비교하여 $50 이상 차이가 나는 항목 플래그, 매칭되지 않은 송장이나 PO 식별. 조정 보고서를 생성해 주세요."

실제 재고 감사 시나리오에서, 한 소매 회사는 이 접근 방식을 사용하여 1,200건의 스캔된 재고 기록을 ERP 시스템 내보내기와 조정했습니다. AI는 47건의 불일치를 플래그 지정했는데, 그중 12건은 수동 감사에서 놓친 실제 집계 오류였고, 8건은 전통적인 VLOOKUP이라면 완전히 누락된 항목으로 보고했을 의미론적 불일치(창고는 "Wireless Mouse Model-X"로 기록했지만 ERP는 "Mouse, Wireless, X-Series"로 기록)였습니다.

단계별 실습: 실제 지저분한 데이터셋을 AI로 정리하기

현실적인 지저분한 데이터셋을 사용하여 완전한 데이터 정리 워크플로를 단계별로 살펴보겠습니다. SaaS 회사의 고객 지원 티켓 5,000건이 담긴 공개 데이터셋을 다운로드했다고 가정해 보겠습니다. CSV의 열은 Ticket ID, Customer Name, Email, Issue Category, Priority, Created Date, Resolved Date, Agent, Resolution Time (hrs), Satisfaction Score입니다.

파일을 열자마자 문제가 눈에 띕니다. 날짜 형식이 혼재되어 있고, 일부 Satisfaction Score는 텍스트("N/A")이며, Priority는 "High"/"high"/"HIGH"/"H"로 표시되고, Agent 이름에 오타가 있으며, Resolution Time이 세 행에서 음수입니다. 이 데이터셋을 AI로 단계별로 정리하는 방법입니다.

1단계: AI 기반 데이터 품질 스캔.

먼저 CSV를 ChatGPT나 Claude에 업로드하고 다음 프롬프트를 사용하세요:

프롬프트: "이 데이터셋을 분석하여 데이터 품질 보고서를 생성해 주세요. 각 열에 대해 다음을 나열하세요: (a) 결측값 개수, (b) 고유값 개수, (c) 감지된 데이터 유형, (d) 이상 징후(이상치, 불가능한 음수, 형식 불일치, 범주형 열의 오타). 심각도 순으로 상위 10개 이슈를 요약해 주세요."

AI는 중복 고객 레코드 23건, Priority 열의 형식 변형 14가지, 철자가 틀린 Agent 이름 8건, 음수 Resolution Time 3건(불가능), 누락된 Satisfaction Score 47건을 식별하는 보고서를 반환합니다. 이제 우선순위가 매겨진 수정 목록이 생겼습니다.

2단계: 중복 제거.

프롬프트: "Customer Name과 Email에 대한 퍼지 매칭을 사용하여 모든 중복 고객을 그룹화해 주세요. 각 그룹에 대해 행을 플래그 지정하고, 유지할 행(데이터가 가장 완전한 행)을 제안해 주세요. 진행하기 전에 그룹화 결과를 보여주세요."

승인 후, AI는 모든 필드가 채워진 행을 유지하면서 중복을 병합합니다.

3단계: 형식 표준화.

프롬프트: "다음 열을 표준화해 주세요: (1) Priority — 모든 변형('High', 'high', 'HIGH', 'H')을 일관된 형식 'High'로 매핑, Medium과 Low도 동일하게 처리. (2) Created Date와 Resolved Date — 모두 YYYY-MM-DD로 변환. (3) Agent — 오타 수정: 실제 Agent 이름은 [정확한 이름 목록]. 퍼지 매칭을 사용하여 각 오타를 올바른 이름에 매핑. 모든 변경 사항의 전후를 보여주세요."

4단계: 지능형 결측값 처리.

프롬프트: "누락된 Satisfaction Score 47건에 대해: 평균으로 채우지 마세요. 대신, 결측 점수가 특정 Agent, Issue Category, 또는 Resolution Time과 상관관계가 있는지 분석해 주세요. 패턴이 존재하면 조사 대상으로 플래그 지정하세요. 현재로서는 'Pending Survey'로 표시하세요. 음수 Resolution Time 3건에 대해서는: 데이터 입력 오류입니다. Created Date와 Resolved Date가 유효하면, 해당 날짜로부터 Resolution Time을 재계산해 주세요."

5단계: 검증.

프롬프트: "위의 모든 정리 단계 후, 데이터셋에 대해 최종 검증을 실행해 주세요. 다음을 확인하세요: (a) 중복 행이 남아 있지 않음, (b) 모든 날짜가 YYYY-MM-DD 형식임, (c) Priority에 'High', 'Medium', 'Low'만 포함됨, (d) 모든 행에서 Resolution Time이 음수가 아님, (e) 모든 Agent 이름이 알려진 목록에 매핑됨. 정리 전후 통계를 요약한 '데이터 정리 인증서'를 생성해 주세요."

이 워크플로가 끝나면 제품 수준의 데이터셋이 완성됩니다. 필터링, 정렬, IF 수식 작성, 수동 오타 수정 등 3~4시간의 수동 Excel 작업이 필요했을 이 과정이, 프롬프트 입력과 검토를 포함해 약 20분 만에 완료됩니다.

2026년 Excel 데이터 정리를 위한 최고의 AI 도구

2026년 AI 데이터 정리 환경은 다양한 복잡도와 비용 수준의 도구를 제공합니다. 다음은 여러분의 워크플로에 적합한 도구를 선택하는 데 도움이 되는 실용적인 비교입니다.

2026년 최선의 접근 방식은 종종 하이브리드입니다. ChatGPT나 Claude를 무거운 의미론적 정리(중복 제거, 형식 감지, 시트 간 조정)에 사용하고, 정리된 CSV를 Excel로 다시 가져와 Copilot이 지속적인 수식 생성과 시각화를 처리하도록 하는 것입니다. 반복적인 정리 작업의 경우, 고급 데이터 분석이 생성한 AI 생성 Python/pandas 스크립트를 저장하고 새로운 데이터가 들어올 때 자동으로 실행되도록 예약하세요.