소셜·커뮤니티 · 1차 데이터
소셜 플랫폼 11개 중 7개는 게시물 URL 을 AI 검색 크롤러에 모두 차단했습니다
소셜 플랫폼 11개의 robots.txt 를 게시물 URL 기준으로 판별하니 7개가 AI 검색 크롤러 3종을 모두 차단했고, 3종을 모두 허용한 플랫폼은 유튜브, 미디엄이었습니다. 구글 검색 크롤러에는 10개 플랫폼이 허용되어 있었고, 레딧은 구글 검색 크롤러를 포함한 모든 크롤러를 차단했습니다.
브랜드가 인스타그램·유튜브·링크드인에 쌓은 게시물이 AI 답변의 인용 출처가 되는지는 플랫폼이 크롤러의 접근을 허용했는지부터 갈립니다. 그 접근 규칙을 정하는 파일이 robots.txt 입니다.
소셜 플랫폼 11개의 robots.txt 를 2026-09-14에 수집해, 공개 게시물 URL 패턴 기준으로 크롤러 11종의 허용 여부를 판별했습니다.
발견 01
AI 검색 크롤러 3종을 모두 허용한 플랫폼은 2개, 일부만 허용한 플랫폼은 2개였습니다
- 허용
- 차단
- robots.txt 없음(404)
수집일 2026-09-14. 칸에 마우스를 올리면 플랫폼과 사용자 에이전트 이름이 표시됩니다.
AI 검색 크롤러를 모두 허용한 플랫폼은 유튜브, 미디엄, 일부만 허용한 플랫폼은 링크드인, 페이스북입니다. 나머지는 게시물 URL 을 AI 검색 크롤러 3종에 모두 차단했습니다.
발견 02
구글 검색 크롤러에는 10개 플랫폼이 허용되어 있고, 레딧은 모든 크롤러를 차단했습니다
막대 하나가 크롤러 하나이고, 길이는 플랫폼 11개 가운데 게시물 URL 을 허용한 플랫폼 수입니다.
# Reddit believes in an open internet, but not the misuse of public content.
구글 AI 개요의 인용 링크는 구글 검색에 색인된 페이지에서 나옵니다. 구글 검색 크롤러에 허용된 플랫폼의 게시물은 그 경로가 열려 있고, AI 검색 크롤러에 차단된 플랫폼의 게시물은 ChatGPT·Perplexity 검색이 직접 수집하는 경로가 막혀 있습니다.
레딧 콘텐츠가 구글과 OpenAI 로 제공되는 경로는 robots.txt 가 아니라 데이터 API 계약입니다. 그 원문은 소셜 플랫폼 검색·AI 학습 설정 아티클에서 따로 대조했습니다.
발견 03
페이스북·인스타그램·스레드는 같은 기업의 플랫폼인데 robots.txt 가 서로 달랐습니다
| 플랫폼 | AI 검색 크롤러 | AI 학습 크롤러 | 구글 검색 크롤러 |
|---|---|---|---|
| 인스타그램 | 0 / 3 | 0 / 4 | 허용 |
| 페이스북 | 1 / 3 | 3 / 4 | 허용 |
| 스레드 | 0 / 3 | 0 / 4 | 허용 |
인스타그램과 스레드는 AI 학습 크롤러의 사용자 에이전트를 명시해 전부 차단했고, 페이스북은 같은 크롤러에 일부 경로만 차단해 게시물 URL 이 허용되어 있었습니다. 세 파일 모두 자동 수집에는 서면 허가가 필요하다는 주석을 달았습니다.
그럼 소셜 게시물을 AI 답변 인용 출처로 만들려면 어떻게 하나요?
- ChatGPT·Perplexity 검색 답변 노출이 목표라면 해당 크롤러가 크롤링할 수 있는 채널(유튜브·미디엄·자사 사이트)에 원본 콘텐츠를 둡니다.
- 인스타그램·틱톡처럼 구글 검색 크롤러에 허용된 플랫폼은 게시물 설명과 프로필을 사용자가 실제로 검색하는 키워드로 작성합니다.
- 소셜 게시물은 자사 사이트의 원본 콘텐츠로 링크하고, 원본 쪽 robots.txt 는 직접 허용 설정합니다.
조사 방법
- 판별은 RFC 9309 규칙을 따랐습니다. 사용자 에이전트 이름이 명시된 그룹이 있으면 그 그룹만, 없으면 * 그룹을 보고, 규칙이 겹치면 가장 긴 규칙을 따릅니다.
- 경로는 플랫폼마다 공개 게시물 URL 패턴으로 판별했습니다(번호는 자리표시자). 게시물 페이지 자체는 하나도 수집하지 않았습니다.
- 링크드인은 /posts/ URL 로 판별했습니다. 같은 파일에서 /feed/update/ URL 은 구글 검색 크롤러에도 차단되어 있습니다.
- 서브스택은 게시물 URL 패턴이 확실하지 않아 표에서 제외했습니다.
- 수집일 2026-09-14. UA MarketResearchBot/0.1 로 robots.txt 파일만 수집했습니다. 플랫폼이 크롤러마다 다른 파일을 제공하는지는 확인 범위 밖입니다.
- robots.txt 는 크롤러에 보내는 크롤링 지시문(요청)입니다. 허용 표시는 접근이 허용됐다는 뜻이며, 해당 크롤러의 실제 수집 기록과는 별개입니다.