구글봇은 구글 검색이 웹페이지를 발견하고 읽기 위해 사용하는 크롤러입니다. 링크와 사이트맵을 따라 웹을 돌며 페이지를 수집하고, 수집된 내용은 색인 단계에서 검색 데이터베이스에 저장됩니다.
이 글은 Google 검색 센터의 공식 문서를 기준으로 작성했습니다.
스마트폰 구글봇 기본 체제
구글봇에는 스마트폰용과 데스크톱용 두 유형이 있습니다. 구글이 모바일 화면을 기준으로 색인하는 방식으로 전환하면서, 현재 대부분의 크롤링은 스마트폰 구글봇이 수행합니다.
실무에서 확인할 지점은 하나입니다. 모바일 화면에서 본문과 링크가 데스크톱과 같게 제공되는지입니다. 모바일에서 내용을 줄여서 보여주는 사이트라면 구글이 읽는 내용도 줄어든 쪽이 됩니다. 모바일 사용성 점검과 함께 보면 됩니다.
구글봇이 하는 일과 하지 않는 일
구글봇은 크롤링까지만 담당합니다. 페이지를 읽었다고 해서 색인과 노출이 보장되지는 않고, 순위를 매기는 것도 구글봇의 일이 아닙니다.
접근 제어도 단계가 나뉩니다. robots.txt는 구글봇의 방문을 조절하고, noindex는 색인 여부를 조절합니다. robots.txt로 막힌 페이지는 내용을 읽을 수 없을 뿐, 다른 페이지가 링크하고 있으면 URL이 검색결과에 남을 수 있습니다. 검색에서 빼려면 크롤링을 허용한 상태에서 noindex를 써야 합니다.
진짜 구글봇인지 확인하는 방법
서버 방문 기록에 Googlebot이라는 User-Agent가 보여도 전부 진짜는 아닙니다. 이름은 누구나 흉내 낼 수 있어서, 스크래핑 봇이 구글봇을 사칭하는 경우가 있습니다.
구글은 공식 크롤러의 IP 대역 목록을 공개하고 있습니다. 의심되는 방문이 있다면 그 IP가 공개 목록에 속하는지 확인하는 것이 공식 검증 방법입니다. 개발자가 아니라면 서버나 보안 담당자에게 이 문서 기준으로 확인을 요청하면 됩니다.
구글봇과 AI 크롤러의 차이
GPTBot이나 ClaudeBot 같은 AI 크롤러는 구글봇과 별개의 봇으로, robots.txt에서 각각 따로 제어합니다. 헷갈리기 쉬운 것이 Google-Extended인데, 이것은 별도의 크롤러가 아니라 구글봇이 수집한 콘텐츠를 AI 학습에 쓸지 여부를 정하는 제어 토큰입니다. Google-Extended를 차단해도 구글 검색의 크롤링과 색인에는 영향이 없습니다.
자주 묻는 질문
구글봇이 우리 사이트에 얼마나 자주 오는지 볼 수 있나요?
구글 서치 콘솔의 크롤링 통계 보고서에서 요청 수와 응답 상태, 크롤러 유형을 확인할 수 있습니다. 방문 빈도는 사이트의 규모, 갱신 주기, 서버 상태에 따라 구글이 조절합니다.
구글봇 방문이 서버에 부담을 주면 어떻게 하나요?
서버가 느려지거나 오류를 반환하면 구글봇이 수집 속도를 스스로 늦춥니다. 부담이 계속되면 불필요한 페이지의 크롤링을 robots.txt로 줄이는 방법부터 검토하세요. 크롤 버짓 관리와 같은 맥락입니다.
구글봇만 허용하고 다른 봇을 막을 수 있나요?
가능합니다. robots.txt는 User-Agent 단위로 규칙을 나눠 적을 수 있습니다. 다만 사칭 봇은 robots.txt를 무시하는 경우가 많아, 악성 트래픽 차단은 서버나 방화벽에서 IP 기준으로 처리해야 합니다.
함께 알아두면 좋은 용어
- 크롤링: 검색로봇이 페이지를 찾아 읽는 과정
- robots.txt: 크롤러의 방문 범위를 조절하는 파일
- 크롤 버짓: 구글봇이 사이트를 수집하는 양
- Yeti: 네이버 검색의 크롤러