크롤링·플랫폼 · 1차 데이터
쇼핑·병원·예약 플랫폼 18개 중 3개는 상세 페이지를 구글 검색 크롤러에도 차단했습니다
플랫폼 18개의 robots.txt 를 수집해 상세 페이지 URL 기준으로 크롤러 11종을 대조했습니다. AI 검색 크롤러 3종을 모두 허용한 플랫폼은 12개였고, 네이버 스마트스토어, 네이버 플레이스, 카카오맵 장소의 상세 페이지는 구글 검색 크롤러까지 차단되어 있었습니다.
매장과 상품 정보를 어느 플랫폼에 등록하느냐에 따라 구글과 AI 검색이 그 정보를 크롤링할 수 있는지가 달라집니다. 그 접근 범위를 정하는 파일이 플랫폼의 robots.txt 입니다.
쇼핑·병원·예약 플랫폼 18개의 robots.txt 를 2026-09-14에 직접 수집해, 상세 페이지 URL 패턴 기준으로 크롤러 11종의 허용 여부를 판별했습니다.
발견 01
모든 크롤러를 차단한 3개 플랫폼은 네이버와 카카오의 매장·상품 페이지였습니다
- 허용
- 차단
- robots.txt 없음(404)
수집일 2026-09-14. 행 순서는 쇼핑 → 뷰티·의료 → 지역·예약·서비스입니다. 칸에 마우스를 올리면 플랫폼과 사용자 에이전트 이름이 표시됩니다.
네이버 스마트스토어, 네이버 플레이스, 카카오맵 장소의 robots.txt 는 별도로 명시하지 않은 크롤러를 전부 차단합니다. 구글 검색 크롤러도 여기에 포함됩니다. 이 파일은 외부 크롤러에 보내는 크롤링 지시문이라, 네이버·카카오 자체 검색에 정보가 노출되는 것과는 별개입니다.
당근은 검색 크롤러 3종은 허용하고 AI 검색 크롤러와 사용자 트리거 에이전트는 차단했습니다.
발견 02
12개 플랫폼은 AI 검색 크롤러를 모두 허용했고, 그중 4개는 AI 학습 크롤러를 하나 이상 차단했습니다
유형별 플랫폼 가운데 OAI-SearchBot, Claude-SearchBot, PerplexityBot 3종을 모두 허용한 플랫폼의 비율입니다.
# Content-Signal: search=yes, ai-input=yes, ai-train=no
AI 검색 크롤러는 모두 허용하고 AI 학습 크롤러를 하나 이상 차단한 플랫폼은 11번가, 지그재그, 강남언니, 크몽입니다. AI 답변에 링크로 인용되는 경로는 허용하고, 모델 학습에 쓰이는 경로는 제한한 설정입니다.
발견 03
llms.txt 를 둔 플랫폼은 2개였습니다
robots.txt 가 /llms.txt 경로를 허용한 플랫폼에서만 파일을 수집했습니다.
llms.txt 가 있는 플랫폼은 여기어때, 크몽입니다. 구글은 생성형 AI 가이드에서 구글 검색이 이런 AI 전용 파일을 사용하지 않는다고 명시했습니다. 파일 유무보다 상세 페이지의 크롤링 허용 여부가 우선입니다.
그럼 매장·상품 정보는 어디에 게시해야 하나요?
- 입점한 플랫폼의 상세 페이지 URL 하나를 골라 robots.txt 로 먼저 확인합니다.
- 구글과 외부 AI 검색에 인용되는 것이 목표라면, 같은 정보를 크롤러가 접근할 수 있는 채널에도 게시합니다.
- 자사 사이트는 robots.txt 를 직접 설정할 수 있는 채널입니다. 검색 크롤러, AI 검색 크롤러, AI 학습 크롤러를 따로 지정합니다.
조사 방법
- 판별은 RFC 9309 규칙을 따랐습니다. 사용자 에이전트 이름이 명시된 그룹이 있으면 그 그룹만, 없으면 * 그룹을 보고, 규칙이 겹치면 가장 긴 규칙을 따릅니다.
- 경로는 플랫폼마다 상세 페이지 URL 패턴으로 판별했습니다(번호는 자리표시자). 상세 페이지 자체는 하나도 수집하지 않았습니다.
- 쿠팡, G마켓, 오늘의집, 올리브영: robots.txt 요청이 403(접근 차단)으로 응답해 파일을 수집하지 못했습니다.
- 에이블리: 상세 페이지 URL 패턴이 두 가지이고 패턴마다 판별 결과가 달라 표에서 제외했습니다.
- 네이버 플레이스(PC): PC URL(pcmap)도 별도로 수집했으며 판별 결과가 모바일과 같아 한 행으로 집계했습니다.
- 수집일 2026-09-14. UA MarketResearchBot/0.1 로 robots.txt 와 llms.txt 두 파일만 수집했습니다.
- robots.txt 는 크롤러에 보내는 크롤링 지시문(요청)입니다. 허용 표시는 접근이 허용됐다는 뜻이며, 해당 크롤러의 실제 수집 기록과는 별개입니다.