GEO 아티클
GPT는 어떤 업체를 인용할까 — 공개된 기준과 공개되지 않은 것
OpenAI와 Google이 실제로 문서화한 접근 경로와 제어 수단을, 문서화하지 않은 선택 순서와 구분해 정리했습니다.
먼저 구분합니다 — 공개된 것과 공개되지 않은 것
GPT가 특정 업체를 인용하는 고정 공식은 공개되지 않았습니다. OpenAI와 Google이 공개한 것은 봇의 역할, 접근 경로와 표시 제어 수단입니다. 출처의 점수와 선택 순서는 공개 범위 밖입니다.
무엇이 문서화돼 있고 무엇이 아닌가 (2026년 8월 23일 확인) (1, 2, 3, 4)
| 구분 | OpenAI | |
|---|---|---|
| 문서화된 것 | 페이지에 접근하는 봇의 종류와 목적, robots.txt 제어 방법과 반영 시간, 봇별 IP 목록, 출처가 인라인 인용과 Sources 영역으로 표시되는 방식, noindex로 표시를 막을 수 있다는 점 | AI Overviews·AI Mode가 기존 검색 색인과 품질 시스템을 사용한다는 점, 추가 요건이나 전용 구조화 데이터가 필요 없다는 점, 스니펫 제어가 AI 기능에도 적용된다는 점 |
| 문서화되지 않은 것 | 어떤 페이지를 어떤 기준으로 몇 점으로 평가해 어떤 순서로 고르는지. 공개된 설명은 '질문과 관련 있다는 신호(signals the page is relevant to a user's query)' 한 줄입니다 | AI 응답에 특정 페이지가 선택되는 순서와 가중치 |
| 보장되는 것 | 없습니다. 공개 웹사이트는 ChatGPT 검색에 '표시될 수 있을' 뿐입니다 | 없습니다 |
Schema 적용이나 Google 검색 1위만으로 GPT 인용을 단정할 수 없습니다. 반면 접근과 표시를 막는 설정은 공식 문서로 확인하고 바로 수정할 수 있습니다.
ChatGPT가 페이지에 닿는 세 가지 경로
OpenAI는 목적이 다른 봇을 따로 운영하며 각 설정은 독립적으로 작동합니다. 모델 학습 차단과 ChatGPT 검색 표시를 같은 설정으로 다루면 원하는 노출까지 함께 막을 수 있습니다.
OpenAI 봇의 목적과 제어 (2026년 8월 23일 확인) (1)
| 봇 | 목적 | robots.txt 적용 | 차단하면 | IP 목록 |
|---|---|---|---|---|
| OAI-SearchBot | ChatGPT의 검색 기능에서 웹사이트를 표시하기 위한 수집 | 적용됨 | ChatGPT 검색 답변에 표시될 가능성이 사라집니다. 다만 제3자 검색 제공자를 통해 URL을 얻은 경우 링크와 페이지 제목은 표시될 수 있습니다 | openai.com/searchbot.json |
| GPTBot | 생성형 AI 파운데이션 모델 학습에 쓰일 수 있는 콘텐츠 수집 | 적용됨 | 학습 대상에서 제외됩니다. 검색 표시 여부와는 무관합니다 | openai.com/gptbot.json |
| ChatGPT-User | 사용자가 ChatGPT에서 요청했을 때의 페이지 방문 | 적용되지 않을 수 있음 | 사용자가 시작한 행동이므로 robots.txt로 통제하기 어렵습니다 | openai.com/chatgpt-user.json |
| OAI-AdsBot | ChatGPT 광고로 제출된 페이지의 정책 준수 검증 | — | 광고로 제출한 페이지에만 방문하며, 수집 데이터는 모델 학습에 사용되지 않습니다 | openai.com/adsbot.json |
실무로 옮기면 세 가지입니다
- 학습은 거부하되 검색에는 나오고 싶다면 GPTBot만 차단하고 OAI-SearchBot은 허용합니다. 두 설정은 서로 독립적입니다.
- robots.txt 변경은 ChatGPT 검색에 반영되기까지 약 24시간 걸릴 수 있습니다.
- 수집 접근은 robots.txt로 제어하고, 검색 표시까지 막으려면 noindex를 사용합니다. (1, 2)
# 모델 학습용 수집 제외
User-agent: GPTBot
Disallow: /
# ChatGPT 검색 표시용 수집 허용
User-agent: OAI-SearchBot
Allow: /
Sitemap: https://example.com/sitemap.xml출처는 어떻게 보이는가
ChatGPT 검색 답변의 출처는 인라인 인용과 Sources 영역에 표시됩니다. 인용을 누르면 원문으로 이동하고 데스크톱에서는 미리보기를 볼 수 있습니다. 출처 선택 순서는 공개되지 않았습니다. (3)
Google AI 기능에는 별도 요건이 없습니다
Google은 AI Overviews와 AI Mode 노출에 별도 요건이나 특별한 최적화가 필요하지 않다고 명시합니다. 아래 두 문장이 Google AI 기능의 기준입니다.
따라서 llms.txt는 Google AI 기능 노출을 위한 별도 신호가 아닙니다. Google은 AI 전용 텍스트 파일이 필요하지 않다고 명시합니다.
AI 응답 노출을 실제로 제어하는 수단
별도 진입 요건은 없지만 노출과 사용 범위를 제한하는 수단은 있습니다. 목적에 맞는 설정을 구분해 적용해야 합니다.
제어 수단과 적용 범위 (2026년 8월 23일 확인) (2, 4, 5, 6)
| 수단 | 무엇을 하는가 | 범위 |
|---|---|---|
| noindex | 검색 결과와 AI 기능 모두에서 페이지를 제외합니다. ChatGPT 검색에서도 표시를 막는 수단입니다 | 페이지 |
| nosnippet | 해당 페이지의 스니펫 텍스트를 표시하지 않습니다 | 페이지 |
| max-snippet:[n] | 표시되는 스니펫 길이의 상한을 지정합니다 | 페이지 |
| data-nosnippet | 페이지 안의 특정 영역만 스니펫에서 제외합니다 | 요소 |
| Search generative AI control (Search Console 설정) | AI Overviews·AI Mode·Discover의 생성형 AI 기능에서 사이트를 제외합니다. 순위나 다른 검색 영역의 포함 신호로는 쓰이지 않으며 반영에 1~2일이 걸립니다. 현재 일부 사이트 소유자 대상 롤아웃 중입니다 | 사이트 |
| Google-Extended | Gemini 모델 학습과 그라운딩 사용을 제어합니다. 검색 포함 여부에 영향을 주지 않고 순위 신호로도 쓰이지 않습니다 | 사이트 |
인용 대상 페이지에는 noindex·nosnippet·data-nosnippet 같은 제외 설정이 남아 있지 않은지 먼저 확인합니다.
자주 나오는 오해 세 가지
- Google-Extended 차단은 Google 검색 포함 여부와 순위에 영향을 주지 않습니다. (5)
- llms.txt는 Google AI 기능을 위한 별도 노출 신호가 아닙니다. (4)
- AI 기능 노출을 위한 전용 schema.org 구조화 데이터는 없습니다. (4)
구조화 데이터에서 최근 바뀐 것
Google은 2026년 5월 7일부터 FAQ 리치 결과 표시를 중단했고, 6월 15일 관련 문서도 삭제했습니다. FAQPage 마크업은 더 이상 Google 리치 결과의 자격 요소가 아닙니다. (7)
화면에 보이는 질문과 답변 본문은 여전히 유효합니다. 질문형 소제목과 바로 이어지는 답변은 사용자 질문과 문서를 연결하는 인용 단위가 됩니다.
구조화 데이터는 화면의 본문과 일치해야 합니다. 본문에 없는 정보를 JSON-LD에만 넣으면 구조화 데이터 정책을 위반합니다.
접근이 되고 난 다음에 남는 것
접근과 표시 설정을 정리한 뒤에는 문서가 질문에 직접 답하는지 확인합니다. OpenAI가 공개한 선택 설명은 '질문과 관련 있다는 신호'이며, 별도의 순위 요인 목록은 공개되지 않았습니다. (2)
출처 후보가 되기 위한 문서 요건
| 요건 | 페이지에서 확인할 것 | 왜 필요한가 |
|---|---|---|
| 접근 가능성 | 200 응답, robots 허용, canonical과 sitemap이 대표 URL을 가리킴 | 접근할 수 없는 문서는 후보 자체가 되지 않습니다 |
| 질문 대응 | 제목과 첫 문단이 하나의 질문에 답함 | 답변에 쓰이는 단위는 사이트가 아니라 문단입니다 |
| 원본 근거 | 자체 데이터, 절차, 측정 조건, 확인한 시점, 한계 | 다른 문서에서 그대로 가져올 수 없는 정보만 인용할 이유가 생깁니다 |
| 발행 주체 | 운영사·작성자·연락처·공식 도메인이 여러 페이지에서 일관됨 | 누구의 주장인지 확인되지 않으면 근거로 쓰기 어렵습니다 |
| 시점 표기 | 발행일과 수정일, 종료된 서비스와 깨진 링크 정리 | 시점을 알 수 없는 문서는 현재 상태로 인용하기 어렵습니다 |
| 본문 위치 | 핵심 정보가 이미지나 스크립트가 아닌 HTML 텍스트에 있음 | 텍스트로 존재하지 않는 정보는 인용될 수 없습니다 |
아래 항목은 업체 순위가 아니라 출처 후보가 되기 위한 최소 조건입니다.
관련 기준 바로 보기
- robots.txt·canonical·sitemap·JSON-LD 점검: AI 검색 노출을 위한 홈페이지 진단 25가지
- 네이버 검색과 생성형 AI 인용 비교: GEO 대행사와 네이버 SEO 대행사의 차이
- GEO 작업 범위와 비용: GEO 대행사 가격과 비용 구조
지금 바로 돌려볼 수 있는 확인 절차 4단계
아래 4단계를 순서대로 확인하면 사이트가 수집·표시·인용 중 어느 단계에서 막히는지 구분할 수 있습니다.
1단계 · robots.txt
- OAI-SearchBot이 허용돼 있는가
- GPTBot 정책이 OAI-SearchBot과 분리돼 있는가 (학습 거부와 검색 표시를 같이 막고 있지 않은가)
- 변경했다면 약 24시간 뒤에 다시 확인 — OpenAI가 안내하는 반영 시간입니다 (1)
2단계 · 서버 로그 대조
접근 로그에서 OAI-SearchBot user-agent와 요청 IP를 함께 확인합니다. IP는 openai.com/searchbot.json의 공개 대역과 대조해야 실제 방문으로 판정할 수 있습니다. GPTBot·ChatGPT-User·OAI-AdsBot도 각 JSON 주소로 같은 방식으로 확인합니다. (1)
3단계 · 표시 제어 확인
- 인용되기를 원하는 페이지에 noindex가 남아 있지 않은가
- nosnippet 또는 max-snippet이 스니펫을 과도하게 줄이고 있지 않은가
- 본문 핵심 영역에 data-nosnippet이 걸려 있지 않은가
- Search Console에 생성형 AI 제어가 노출되는 계정이라면 설정 상태가 의도와 맞는가 (4, 6)
4단계 · 인용 확인
같은 질문 세트로 실행해 응답 원문, 인용 URL과 수집 시각을 저장합니다. 인용 URL의 실제 연결 여부도 확인합니다. 판정 절차는 GEO 실무 체크리스트와 측정 기준, 지표 계산은 GEO 성과 지표 5가지에서 확인할 수 있습니다.
Google 노출은 Search Console의 생성형 AI 성과 리포트에서 확인할 수 있습니다. 이 리포트는 AI Overviews·AI Mode의 링크 노출 수를 제공하며 클릭·클릭률·평균 게재순위는 포함하지 않습니다. (8)
결론 — 공식은 없지만 확인할 수 있는 것은 많습니다
GPT가 업체를 인용하는 고정 공식과 선택 순서는 공개되지 않았습니다. 대신 확인 가능한 기준은 다음 네 가지입니다.
- ChatGPT가 페이지에 닿는 경로는 목적별로 구분됩니다.
- 수집 접근과 검색 표시에는 서로 다른 제어 수단을 사용합니다.
- Google AI 기능에는 추가 요건이나 전용 구조화 데이터가 없습니다.
- 공개된 선택 설명은 '질문과 관련 있다는 신호'입니다.
지금 할 일 두 가지
- robots.txt·noindex·스니펫 설정에서 의도하지 않은 차단을 제거합니다.
- 자체 데이터, 실제 절차, 측정 조건, 확인 시점과 한계를 공개 HTML 본문에 둡니다.
설정을 고친 뒤에는 같은 질문과 조건으로 인용 변화를 반복 측정하세요.
자주 묻는 질문
Google 검색 1위 업체는 GPT에도 반드시 인용되나요?
아닙니다. 검색 노출은 페이지가 발견될 가능성을 높이지만 ChatGPT의 인용을 보장하지 않습니다. OpenAI는 공개 웹사이트가 ChatGPT 검색에 표시될 수 있다고만 밝히고 있고, 어떤 출처를 어떤 순서로 고르는지에 대한 공식은 공개하지 않았습니다. Google 순위와 GPT 인용은 서로 다른 지표로 관리해야 합니다.
OAI-SearchBot을 허용하면 GPT 인용이 늘어나나요?
허용은 필요 조건이지 충분 조건이 아닙니다. OpenAI는 ChatGPT 검색에 표시되려면 OAI-SearchBot을 차단하지 말라고 안내하지만, 동시에 표시가 보장되지는 않는다고 밝히고 있습니다. robots.txt를 바꿨다면 검색 결과 반영에 약 24시간이 걸릴 수 있으니 그 뒤에 다시 확인하세요.
GPTBot을 차단하면 ChatGPT 검색에서도 사라지나요?
아닙니다. GPTBot은 모델 학습용 수집이고 OAI-SearchBot이 검색 표시용 수집이며, 두 설정은 서로 독립적으로 작동합니다. 학습에는 쓰이지 않게 하면서 검색에는 나오고 싶다면 GPTBot만 차단하고 OAI-SearchBot은 허용하면 됩니다. 다만 OAI-SearchBot을 차단하더라도 제3자 검색 제공자를 통해 URL을 얻은 경우 링크와 페이지 제목은 표시될 수 있고, 표시를 완전히 막으려면 noindex를 써야 합니다.
구조화 데이터를 많이 넣으면 GPT가 업체를 더 잘 인용하나요?
AI 기능 노출을 위한 전용 구조화 데이터는 없습니다. Google은 문서에서 "추가해야 할 특별한 schema.org 구조화 데이터도 없다"고 명시합니다. 구조화 데이터는 리치 결과 자격과 문서 정보 전달을 위한 것이며, 넣는다면 화면에 보이는 본문과 내용이 일치해야 합니다. 참고로 Google은 2026년 5월 7일부터 FAQ 리치 결과를 표시하지 않고 6월 15일 관련 문서도 삭제했으므로, FAQPage 마크업을 리치 결과 목적으로 유지할 이유는 사라졌습니다.
llms.txt를 만들면 Google이나 GPT 인용에 도움이 되나요?
Google 기준으로는 도움이 되지 않습니다. Google은 "이 기능들에 나타나기 위해 새로운 기계 판독 파일이나 AI 전용 텍스트 파일, 마크업을 만들 필요는 없다"고 문서에 적어 두었습니다. 우선순위는 공개된 HTML 본문, 크롤링 접근성, 고유한 정보와 명확한 내부 링크입니다.
반대로 AI 답변에 우리 페이지가 나오지 않게 하려면 어떻게 하나요?
목적에 따라 수단이 다릅니다. 검색과 AI 기능 모두에서 빼려면 noindex, 스니펫 노출 범위만 줄이려면 nosnippet·max-snippet·data-nosnippet을 씁니다. Google의 AI Overviews·AI Mode·Discover 생성형 AI 기능에서만 제외하려면 Search Console의 생성형 AI 제어를 사용하며, 이 설정은 순위 신호로 쓰이지 않고 반영에 1~2일이 걸립니다. Gemini 학습과 그라운딩만 막으려면 Google-Extended를 쓰는데, 이것은 검색 포함 여부와 순위에 영향을 주지 않습니다.
