AI 검색이 읽는 홈페이지: 크롤러 허용부터 llms.txt까지
AI 답변 인용을 보장하는 설정은 없습니다. 크롤러가 공개 페이지를 읽게 하고 가격·대상·운영자를 텍스트로 모은 뒤, 구조화 데이터와 llms.txt로 같은 사실을 정리하는 순서를 공식 문서 기준으로 다룹니다.

손님이 검색창 대신 ChatGPT에 "성수동 프로필 촬영 어디가 괜찮아요?"라고 묻는 장면을 떠올려 보세요. AI가 답변 옆에 붙인 링크를 눌러 들어온 사람이 그대로 문의를 남길 수도 있습니다. 그렇다면 내 홈페이지는 AI가 읽고 인용하기 좋은 상태일까요?
먼저 분명히 해 둘 게 있습니다. AI 답변에 인용되는 걸 보장하는 설정은 없습니다. 이 글은 1인 사업자·프리랜서가 ChatGPT·Perplexity·Google AI 기능이 읽을 수 있는 홈페이지를 만드는 순서를 다룹니다. 크롤러 허용, 사실 페이지, 구조화 데이터, llms.txt 순서예요. AI Creator Lab 사이트에 실제로 적용한 파일을 예로 들고 Claude Code나 Codex에게 그대로 맡길 수 있는 지시문도 함께 적었습니다.
문의가 ChatGPT에서 왔다
먼저 제가 직접 만들고 운영한 프로젝트 중 한 사례입니다(고객사 익명). 8월 27일에 배포한 사이트에서 8월 31일 첫 문의가 들어왔습니다. 8월 31일부터 9월 7일까지 8일간 저장된 문의 25건 중 21건(84%)의 첫 방문 출처가 ChatGPT였어요. 여기서 '첫 방문 출처'는 문의를 남긴 사람이 처음 사이트에 들어왔을 때 기록된 경로입니다.
다만 이건 한 프로젝트의 초기 관측값입니다. 2026년 9월 7일까지의 문의 저장·유입 기록을 기준으로 했고 다른 사이트에서 같은 결과가 나온다는 보장은 없습니다. 노출이나 문의 수를 약속하는 숫자로 읽지 않으셨으면 해요. 제가 이 사례에서 가져간 건 비율보다 순서였습니다. AI가 페이지를 읽을 수 있어야 하고, 읽은 내용이 정확해야 하고, 들어온 사람이 바로 문의할 수 있어야 한다는 순서요.
AI 검색이 페이지를 읽는 조건
AI 답변에 링크로 붙으려면 먼저 그 서비스의 크롤러가 내 페이지를 가져갈 수 있어야 합니다. 여기서 헷갈리기 쉬운 점은 회사마다 크롤러가 용도별로 나뉘어 있다는 거예요.
| 회사 | 검색·답변용 | 사용자 요청 시 방문 | 모델 학습용 |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT-User | GPTBot |
| Anthropic | Claude-SearchBot | Claude-User | ClaudeBot |
| Perplexity | PerplexityBot | Perplexity-User | (문서상 PerplexityBot은 학습용이 아님) |
같은 칸에 있어도 회사마다 규칙이 다릅니다. 각 문서에서 확인한 내용은 이렇습니다.
- OpenAI: OAI-SearchBot을 막은 사이트는 ChatGPT 검색 답변에 표시되지 않는다고 적혀 있습니다. 다만 사이트로 바로 가는 내비게이션 링크로는 나올 수 있다고 해요. robots.txt를 바꾸면 반영까지 약 24시간이 걸릴 수 있습니다. ChatGPT-User는 사용자가 시킨 동작이라 robots.txt 규칙이 적용되지 않을 수 있다고 합니다. OAI-SearchBot과 GPTBot을 둘 다 허용하면 한 번 크롤링한 결과를 검색과 학습 양쪽에 쓸 수 있다는 문장도 있어요.
- Anthropic: 세 봇 모두 robots.txt를 따른다고 합니다. Claude-SearchBot을 막으면 검색 결과에서 사이트가 덜 보이고 정확도도 떨어질 수 있습니다. Claude-User를 막으면 사용자가 Claude에게 시킨 웹 검색에서 내 페이지를 가져가지 못해 노출이 줄 수 있어요. 이 점에서 robots.txt를 따르지 않을 수 있는 ChatGPT-User·Perplexity-User와 다릅니다. IP로 막으면 robots.txt 자체를 못 읽게 되니 권하지 않는다는 주의도 있습니다.
- Perplexity: 검색 결과에 나타나게 하려면 PerplexityBot을 허용하라고 권합니다. PerplexityBot은 학습용 수집에 쓰지 않는다고 적혀 있어요. Perplexity-User는 대체로 robots.txt를 따르지 않습니다. 설정 변경이 반영되는 데 최대 24시간 정도 걸릴 수 있다고 해요.
- Google: AI 개요·AI 모드에 추가 요건이나 특별한 최적화는 없다고 말합니다. 보조 링크(AI 답변 옆에 붙는 출처 링크)로 뽑히려면 페이지가 색인돼 있고 검색 결과에 스니펫(제목 아래 두세 줄 설명)과 함께 보일 수 있어야 합니다. 그 자격을 갖춰도 실제로 나온다는 보장은 없다고 적혀 있어요. 노출을 줄이고 싶을 때는
nosnippet·noindex같은 기존 제어를 쓰면 됩니다.
Google에는 제어가 하나 더 생겼습니다. Search Console의 설정 > Search generative AI 메뉴예요. 2026년 8월 31일부터 모든 사이트에 열렸고 기본값은 "포함"입니다. "제외"로 바꾸면 AI 개요·AI 모드 같은 생성형 AI 기능에 내 사이트 링크가 나오지 않고 답변 근거로도 쓰이지 않습니다. 일반 검색 순위에는 쓰이지 않는 설정이라고 해요. 헷갈리기 쉬운 Google-Extended는 이 스위치가 아닙니다. Google은 이것을 다른 Google 시스템의 AI 학습과 그라운딩(답변 근거로 쓰는 것)을 제한하는 제어로 따로 안내합니다.
AI Creator Lab은 검색·답변용과 사용자 요청용, 학습용 크롤러를 모두 허용했습니다. 막은 건 관리자, API, 로그인·온보딩 흐름, 설정, 로그인한 회원이 쓰는 화면, 로그아웃 경로예요. 아래는 AI 봇 묶음을 그대로 옮긴 발췌입니다. 파일 앞쪽의 User-Agent: * 묶음에도 같은 규칙이 있고 맨 끝에 사이트맵 주소가 있습니다.
User-Agent: GPTBot
User-Agent: OAI-SearchBot
User-Agent: ChatGPT-User
User-Agent: ClaudeBot
User-Agent: Claude-User
User-Agent: Claude-SearchBot
User-Agent: anthropic-ai
User-Agent: PerplexityBot
User-Agent: Perplexity-User
User-Agent: Google-Extended
User-Agent: Applebot-Extended
User-Agent: Meta-ExternalAgent
User-Agent: CCBot
Allow: /
Allow: /api/og
Disallow: /admin
Disallow: /api
Disallow: /auth
Disallow: /onboarding
Disallow: /settings
Disallow: /activity
Disallow: /member/
Disallow: /home
Disallow: /community
Disallow: /projects
Disallow: /resources
Disallow: /u/
Disallow: /logout
이 블록을 내 파일에 통째로 덮어쓰지는 마세요. 경로는 사이트마다 다릅니다. 기존 robots.txt에 필요한 봇 이름만 더하는 쪽이 안전합니다.
학습용 크롤러까지 허용할지는 각자 판단할 문제입니다. 학습은 빼고 검색에만 나오고 싶다면 OpenAI 문서가 드는 예처럼 GPTBot은 막고 OAI-SearchBot은 열어 두는 방법이 있어요. Anthropic도 ClaudeBot과 Claude-SearchBot을 따로 막을 수 있습니다. 다만 열어 둔다고 검색에 나온다는 보장까지 하는 문서는 없습니다.
내 사이트 주소 뒤에 /robots.txt를 붙여 열면 파일에 어떤 규칙이 적혀 있는지 바로 볼 수 있습니다. 호스팅이나 방화벽이 봇을 막고 있는지는 이 파일만으로는 알 수 없어요. OpenAI와 Perplexity 문서가 공개 IP 대역 허용을 함께 안내하는 것도 그래서입니다.
하나 더 확인할 게 있습니다. Google 문서는 중요한 내용을 텍스트로 두라고 권합니다. 가격표를 이미지 한 장으로 올렸거나 버튼을 눌러야만 내용이 나타나는 구조라면 사람 눈에는 보여도 크롤러가 읽어 가는 HTML에는 빠져 있을 수 있어요. 브라우저에서 "페이지 소스 보기"를 열고 가격이나 서비스명을 검색해 보면 금방 알 수 있습니다.
사실 페이지: 가격·대상·범위·운영자를 한 곳에
크롤러가 들어와도 읽을 사실이 흩어져 있으면 AI가 답을 조립하기 어렵습니다. 소규모 사업자 사이트에서 자주 보이는 모습은 가격은 인스타그램에, 진행 방식은 블로그 글 하나에, 운영자 소개는 없는 경우예요.
AI에게 누군가 "OO 동네 프로필 촬영 얼마예요?"라고 물었을 때 인용될 수 있으려면 이런 사실이 한 페이지에 텍스트로 있어야 합니다.
- 무엇을 하는지: 서비스 이름과 한 줄 설명
- 누구를 위한 것인지: 대상 고객, 하지 않는 일
- 얼마인지: 가격과 기준일, 별도 비용
- 어떻게 진행되는지: 기간, 방식, 지원 범위
- 누가 운영하는지: 운영자 이름, 사업자 정보, 연락처
- 자주 묻는 질문: 실제로 받은 질문과 답
특히 "하지 않는 일"을 적어 두는 걸 권해요. AI Creator Lab은 llms.txt에 "실시간 방송이나 1:1 코칭은 없다"고 적어 두었습니다. 이런 문장이 있어야 AI가 없는 서비스를 있다고 답할 가능성이 줄어든다고 생각합니다(측정한 결과는 아니고 판단입니다).
구조화 데이터: 무엇을 넣나
구조화 데이터는 페이지 내용을 기계가 읽기 쉬운 형식으로 한 번 더 적어 두는 것입니다. Google은 JSON-LD 형식을 권합니다. <script type="application/ld+json"> 태그 안에 넣어서 화면 글자와 섞이지 않게 둡니다.
Google 문서에서 꼭 기억할 두 가지가 있어요. 첫째, 구조화 데이터를 올바르게 넣어도 리치 결과(검색 결과에 별점·경로·가격 같은 정보가 더 붙어 보이는 형식)가 나온다는 보장은 없습니다. 둘째, 화면에 보이지 않는 정보는 정확하더라도 넣지 말라고 합니다. AI 기능 문서에서도 구조화 데이터가 화면 텍스트와 일치하는지 확인하라고 적고 있어요. 그래서 구조화 데이터는 사실 페이지를 먼저 만든 다음 그 내용을 옮겨 적는 작업이라고 보면 됩니다.
AI 기능 쪽 기대치도 낮춰 두는 게 좋습니다. Google의 생성형 AI 최적화 가이드는 AI 검색에 구조화 데이터가 필수는 아니고 특별한 schema.org 마크업도 없다고 적습니다. 그래도 전체 SEO 전략의 일부로는 계속 쓰는 게 좋다고 해요. 같은 가이드는 GEO(생성형 엔진 최적화)도 Google 검색 입장에서는 결국 SEO라고 설명합니다.
AI Creator Lab에 들어 있는 유형은 이렇습니다.
| 유형 | 어디에 | 담는 내용 |
|---|---|---|
| Organization | 모든 페이지(공통 레이아웃) | 회사 이름, 로고, 연락처, 대표자(founder) |
| WebSite | 모든 페이지(공통 레이아웃) | 사이트 이름, 언어, 발행 주체 |
| BlogPosting | 블로그 글 | 제목, 날짜, 작성자(Person) |
| Course | 과정 소개 | 과정 이름, 설명, 제공자 |
| FAQPage | 질문 모음이 있는 페이지 | 화면에 보이는 질문과 답 |
| BreadcrumbList | 하위 페이지 | 홈 > 블로그 > 글 같은 위치 |
| DefinedTermSet·DefinedTerm | 용어 가이드 목록·용어 항목 | 용어 묶음, 그 안의 용어 이름과 뜻 |
| CollectionPage | 가이드 허브 | 묶여 있는 용어 모음 목록 |
제 사이트는 공통 레이아웃에 Organization을 넣어 모든 페이지에 붙어 있습니다. Google의 Organization 문서는 홈페이지나 회사를 소개하는 한 페이지(소개 페이지 같은 곳)에 두기를 권해요. 처음 시작한다면 그 권장대로 홈이나 소개 페이지에 Organization(동네 가게라면 LocalBusiness), 그리고 WebSite 정도로 충분합니다.
FAQPage는 따로 짚어야 합니다. Google 검색의 FAQ 리치 결과는 2026년 5월 7일부터 나오지 않습니다. 제 사이트에는 남아 있지만 새로 시작하는 분이 리치 결과를 기대하고 넣을 이유는 없어요. 질문과 답을 화면에 텍스트로 잘 두는 게 먼저입니다.
제 사이트에서 공들인 부분은 @id로 항목을 서로 연결한 것이에요. 회사 정보의 대표자와 블로그 글의 작성자가 같은 @id(/about#sihyun)를 가리키게 해서 "이 회사를 운영하는 사람이 이 글을 쓴 사람"이라는 관계가 드러나게 했습니다. 아래는 실제 코드에서 로고·연락처 같은 항목을 뺀 발췌입니다. name의 Notique는 운영 법인명이고 AI Creator Lab은 brand에 따로 적었어요. 내 사이트에 쓸 때는 상호와 주소, 소개 페이지 @id를 내 것으로 바꾸면 됩니다.
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "Organization",
"@id": "https://aicreatorlab.com/#organization",
"name": "Notique",
"url": "https://aicreatorlab.com",
"founder": {
"@type": "Person",
"@id": "https://aicreatorlab.com/about#sihyun",
"name": "김시현"
},
"brand": {
"@type": "Brand",
"name": "AI Creator Lab"
}
}
</script>
넣은 뒤에는 Google의 리치 결과 테스트로 오류를 확인합니다. 배포 후에는 Search Console의 URL 검사로 Google이 실제로 읽었는지 봅니다. 윅스·워드프레스·쇼피파이처럼 HTML을 직접 고치기 어려운 빌더라면 Google 문서가 안내하는 대로 검색엔진 설정 메뉴나 플러그인에서 넣을 수 있는지 찾아보면 됩니다.
llms.txt 만들기와 관리
llms.txt는 AI가 사이트를 빠르게 파악하도록 요약과 주요 링크를 마크다운으로 적어 두자는 제안입니다. Jeremy Howard가 2024년 9월 3일 llmstxt.org에 공개했고 2026년 8월 10일에 v2로 수정됐어요. 보통 사이트 루트(/llms.txt)에 두고 v2에서는 /docs/llms.txt 같은 하위 경로도 허용합니다. 1인 사이트라면 루트 하나로 시작하면 됩니다. 형식은 단순합니다.
#제목에 사이트 이름(유일한 필수 항목)>인용문으로 한두 줄 요약- 필요한 설명 문단
##소제목 아래 링크 목록. 항목마다- [이름](주소): 설명형식이고 설명은 선택
Google 입장은 분명합니다. 생성형 AI 최적화 가이드는 Google 검색이 llms.txt 같은 파일을 쓰지 않고 무시하므로 검색 노출과 순위에 득도 실도 없다고 적습니다. 다른 서비스를 위해 만드는 건 괜찮다고 해요. OpenAI·Anthropic·Perplexity 크롤러 문서에서도 이번에 확인한 범위에서는 llms.txt를 읽는다는 언급을 찾지 못했습니다. 그래서 저는 llms.txt를 노출을 올리는 장치가 아니라 사이트의 사실을 한 파일로 정리해 두는 요약본으로 봅니다. AI 에이전트나 사람이 읽을 때 도움이 되고 사실 페이지를 점검하는 체크리스트 역할도 합니다.
AI Creator Lab의 llms.txt는 앞부분에 서비스 설명과 대상을 두고, 이어서 준비 중인 과정·운영자·부트캠프·요금·운영사·주요 URL·주제별 안내·블로그 글을 적었습니다. 맨 뒤에는 인용할 때 유의할 점을 두었어요. 요금 부분의 발췌입니다.
## 요금 / Pricing (KRW)
- 판매 오픈 전이다. 지금은 결제할 수 없고, 오픈 알림 신청(무료)만 받는다.
- Lite 이용권: 월 9,900원 또는 연 99,000원.
- Pro 이용권: 월 49,000원 또는 연 490,000원.
- 가격 안내: https://aicreatorlab.com/#pricing
맨 윗줄처럼 판매 상태를 같이 적어 두지 않으면 AI가 "지금 결제할 수 있다"고 답할 수 있습니다. 덧붙이면 제 파일도 처음에는 주요 URL 목록을 주소만 나열했는데, 이 글을 쓰면서 규격에 맞게 [이름](주소) 링크 형식으로 바꿨습니다.
문제는 관리입니다. 2026년 9월 23일 사이트를 점검하다가 제 llms.txt에 옛날 정보가 남아 있는 걸 발견했어요. Lite 가격이 실제 9,900원이 아니라 예전 값인 월 18,000원으로 적혀 있었습니다. 지금은 숨긴 강의 페이지(/courses/ai-basics) 링크와 내린 글도 그대로 있었습니다. 사이트는 계속 바뀌었는데 이 파일만 멈춰 있었던 거죠.
그날 바로 고쳤고 테스트를 하나 추가했습니다. 지금 테스트는 llms.txt에 숨긴 과정 주소(/courses/ai-basics)나 "8개 챕터", "40강" 같은 예전 구성 문구가 들어 있으면 실패합니다. 코스·소개·가격 안내·실습 자료 주소와 "준비 중"이라는 표현이 빠져도 실패해요. 다만 가격 숫자는 아직 비교하지 않습니다. 이번에 틀렸던 게 바로 가격이었으니 이 부분이 남은 빈틈입니다. 이 일 이후로 llms.txt는 가격표처럼 다룹니다. 상품이 바뀌면 같이 바꿔야 하고 사람 기억에만 맡기면 빠지기 쉽다는 걸 배웠어요.
Claude Code·Codex에게 시키는 지시문
이 작업은 직접 코드를 짤 필요 없이 AI 코딩 도구에게 맡길 수 있습니다. 아래는 예시 지시문입니다. 괄호 부분을 내 사이트에 맞게 바꿔 쓰세요.
내 홈페이지를 AI 검색이 읽기 좋게 점검하고 고쳐 줘.
1. public/robots.txt(또는 robots 설정)를 확인해 OAI-SearchBot, Claude-SearchBot, Claude-User,
PerplexityBot이 공개 페이지에 접근 가능한지 알려 줘.
학습용 GPTBot·ClaudeBot은 (허용/차단)으로 설정해 줘. /admin 같은 비공개 경로는 막아.
기존 파일을 통째로 바꾸지 말고 필요한 줄만 추가해.
2. 가격, 대상, 진행 방식, 운영자 정보가 이미지가 아닌 텍스트로 HTML에 있는지 확인해 줘.
흩어져 있으면 (/about) 페이지에 한데 모으는 초안을 만들어 줘.
3. 홈페이지나 (/about) 페이지에 Organization JSON-LD를, 사이트 공통으로 WebSite JSON-LD를 넣어 줘.
<script type="application/ld+json">과 "@context": "https://schema.org"를 포함해.
화면에 없는 정보는 JSON-LD에 넣지 마.
4. public/llms.txt를 llmstxt.org 형식으로 만들어 줘. 링크 항목은 - [이름](주소): 설명 형식으로.
판매 상태와 가격은 가격 데이터를 쓰는 파일에서 읽어서 쓰고, 값이 다르면 실패하는 테스트를 추가해 줘.
5. 바꾼 파일 목록과 배포 후 내가 브라우저로 열어 볼 주소(내주소/robots.txt, 내주소/llms.txt 포함)를 마지막에 정리해 줘.
4번의 가격 비교 테스트는 제 사이트에서 틀렸던 부분에서 나왔어요. 가격이 한 곳에서만 정의되고 나머지는 그걸 따라가게 하면 llms.txt가 혼자 낡는 일을 줄일 수 있습니다.
확인하는 법
설정을 마쳤다면 실제로 AI 답변에서 어떻게 보이는지 기록해 볼 차례입니다. 같은 질문을 서비스별로 던지고 출처 링크로 붙었는지, 본문에 이름만 언급됐는지, 추천으로 나왔는지를 나눠 적는 방식은 홈페이지를 검색·AI 답변·문의 흐름에 연결하기에 관찰표와 함께 정리해 두었습니다. 문의 폼에 첫 방문 출처를 저장하는 방법도 그 글에 있어요.
그 전에 간단히 확인할 것만 추리면 이렇습니다.
- 배포한 뒤
내주소/robots.txt에서 검색·답변용 크롤러가 막혀 있지 않은지 내주소/llms.txt의 가격·판매 상태·링크가 지금 사이트와 같은지- 리치 결과 테스트에서 구조화 데이터 오류가 없는지
- Search Console에 사이트 소유 확인을 마친 뒤 URL 검사에서 페이지가 색인(Google이 검색 결과 후보로 저장한 상태)됐는지
- Search Console 설정 > Search generative AI가 "포함"으로 되어 있는지
AI 기능에서 얼마나 노출되는지 숫자로 보고 싶다면 Search Console의 생성형 AI 실적 보고서를 열어 보면 됩니다.
자주 묻는 질문
llms.txt가 없으면 ChatGPT에 안 나오나요? 그렇게 볼 근거는 찾지 못했습니다. OpenAI 문서가 검색 노출 조건으로 설명하는 건 OAI-SearchBot 허용 여부예요. Google은 검색에서 llms.txt를 무시한다고 밝혔습니다. llms.txt는 사실을 정리하는 데 도움이 되는 선택 사항으로 보면 됩니다.
구조화 데이터를 넣으면 AI 답변에 인용되나요? 보장되지 않습니다. Google은 AI 기능에 특별한 마크업이 필요 없다고 합니다. 구조화 데이터도 리치 결과를 보장하지 않는다고 적습니다. 화면의 사실과 맞게 정리해 두는 기본 작업으로 생각하는 편이 맞아요.
GPTBot을 막으면 ChatGPT 검색에서도 빠지나요? OpenAI 문서는 GPTBot(학습용)과 OAI-SearchBot(검색용)을 따로 설명합니다. 검색 노출에 관련된 건 OAI-SearchBot이에요.
윅스나 아임웹 같은 빌더로 만든 사이트도 되나요? 사실 페이지는 어떤 빌더에서든 만들 수 있습니다. robots.txt, JSON-LD, llms.txt를 얼마나 고칠 수 있는지는 빌더마다 다릅니다. 각 서비스 지원 문서에서 검색엔진 설정 메뉴나 플러그인 이름을 찾아보세요.
다음 단계
- 홈페이지를 기획하고 공개한 뒤 검색·AI 답변과 문의 기록까지 연결하는 과정은 준비 중인 코스 ChatGPT가 찾아오는 내 홈페이지에서 다룰 예정입니다. 지금은 판매 오픈 전이라 오픈 알림 신청만 받고 있어요.
- 기획부터 배포까지 읽을 순서는 바이브 코딩으로 홈페이지·앱 만들기에 모아 두었습니다.
- AI 답변 관찰과 문의 출처 기록은 홈페이지를 검색·AI 답변·문의 흐름에 연결하기를 이어서 읽어 보세요.
출처와 확인 (2026-09-24)
- AI features and your website (AI 개요·AI 모드 추가 요건 없음, AI 텍스트 파일·마크업 불필요, 보조 링크 자격과 비보장, 구조화 데이터와 화면 텍스트 일치, nosnippet·noindex, Google-Extended의 학습·그라운딩 제한)
- Optimizing your website for generative AI features on Google Search (2026-07-10 갱신. Google 검색은 llms.txt를 무시해 순위에 득실 없음, 구조화 데이터 필수 아님, GEO도 SEO)
- Search generative AI control (설정 > Search generative AI, 기본값 포함, 2026-08-31 전체 적용, 제외 시 링크·그라운딩 제외)
- Generative AI performance report (생성형 AI 기능 노출 확인)
- Introduction to structured data markup in Google Search (JSON-LD 권장, 보이지 않는 정보 금지, 빌더의 검색 설정·플러그인, 리치 결과 테스트·URL 검사)
- General structured data guidelines (올바른 마크업도 표시 비보장)
- Organization structured data (홈페이지나 소개 페이지 한 곳에 배치 권장,
@context·script 형식) - FAQ (FAQPage) structured data (2026-05-07부터 FAQ 리치 결과 미표시)
- Rich Results Test · Search Console 사이트 소유 확인
- Overview of OpenAI Crawlers (OAI-SearchBot·GPTBot·ChatGPT-User 용도, 차단 시 검색 답변 미표시·내비게이션 링크 가능, 반영 약 24시간, 두 봇 허용 시 크롤 공유, IP 대역)
- Does Anthropic crawl data from the web, and how can site owners block the crawler? (ClaudeBot·Claude-User·Claude-SearchBot 용도와 차단 영향, robots.txt 준수, IP 차단 주의)
- Perplexity Crawlers (PerplexityBot 검색용·학습 미사용, Perplexity-User의 robots.txt 처리, 반영 최대 24시간)
- The /llms.txt file (2024-09-03 제안, 2026-08-10 v2, 필수 H1, 하위 경로 허용,
[이름](주소): 설명링크 형식) - aicreatorlab.com/llms.txt와 robots.txt (본문 예시의 실제 파일, 2026-09-24 기준)
- 고객사 사례 수치: ChatGPT가 찾아오는 내 홈페이지 (2026-09-07 문의 저장·유입 출처 기록 기준, 한 프로젝트의 초기 관측값)



