검색엔진 크롤러 (Search Crawler) 이해하기
검색엔진 크롤러는 인터넷의 링크를 따라다니며 페이지를 찾아 읽어 오는 자동 프로그램입니다. 구글의 크롤러 이름은 구글봇(Googlebot)입니다.
🤔 아무도 찾아오지 않는 페이지
- "사이트에 페이지를 분명히 올렸는데 검색엔진이 있는지도 모르는 것 같습니다"
- "구글봇이라는 말을 자주 듣는데 정확히 무엇을 하는 건지 모르겠습니다"
- "어떤 페이지는 하루 만에 검색되고 어떤 페이지는 한 달이 지나도 그대로입니다"
앞에서 본 발견, 저장, 표시 가운데 첫 단계인 발견을 이 글에서 다룹니다.
🔑 검색엔진 크롤러의 정의
검색엔진 크롤러는 인터넷의 링크를 따라다니며 페이지를 찾아 읽어 오는 자동 프로그램입니다. 구글이 쓰는 크롤러의 이름은 구글봇(Googlebot)이고, 네이버는 예티(Yeti)라는 이름을 씁니다.
크롤러가 하는 일은 두 가지로 요약됩니다.
- 주소를 알아냅니다. 이미 아는 페이지에 걸린 링크를 보고 새 주소를 수집합니다
- 그 주소에 접속해 내용을 받아 옵니다. 사람이 브라우저로 페이지를 여는 것과 같은 동작입니다
여기서 오해가 자주 생깁니다. 크롤러는 인터넷 전체를 훑어보지 않습니다. 크롤러 봇이 알고 있는 주소만 방문합니다. 주소를 알 방법이 없으면 그 페이지는 검색엔진에게 없는 것이나 마찬가지입니다.
🚚 크롤러봇, 배송을 담당하는 배송기사
동네를 도는 배송기사가 있습니다. 배송기사는 담당 구역의 집들을 알고 있고, 매일 그 집들을 돕니다.
여기에 새 집이 한 채 생겼습니다. 배송기사가 이 집을 알게 되는 방법은 셋입니다. 이미 아는 집 사람이 말해 주거나, 주민센터 주소록에 새로 올라오거나, 집주인이 직접 찾아와 등록하는 것입니다.
골목 안쪽에 문패도 없이 지어진 집은 어떤 경로로도 알려지지 않습니다. 아무리 잘 지은 집이어도 마찬가지입니다. 페이지도 같습니다. 어디서도 링크되지 않고 사이트맵에도 없으면 발견되지 않습니다.
배송기사의 동선에도 특징이 있습니다. 택배가 자주 오가는 집은 매일 들르고, 몇 달째 아무것도 없는 집은 점점 뜸하게 갑니다. 실제로 구글도 크롤링 관련 문서에서 인기가 높거나 자주 바뀌는 주소를 더 자주 방문한다고 설명합니다.
🔁 크롤러가 페이지에 도착하는 세 가지 경로
| 경로 | 방식 | 특징 |
|---|---|---|
| 내부 링크와 외부 링크 | 이미 아는 페이지에 걸린 링크를 따라 이동 | 가장 기본이고 영향이 큽니다 |
| 사이트맵 | 사이트가 제출한 주소 목록을 읽음 | 링크를 적게 받는 페이지의 발견을 돕습니다 |
| URL 검사 요청 | 서치 콘솔에서 사람이 직접 요청 | 급할 때 쓰고, 수량 제한이 있습니다 |
세 경로는 서로를 대신하지 못합니다. 사이트맵에 주소를 올려 두어도 어디서도 링크되지 않은 페이지는 발견이 늦어질 수 있습니다. 링크가 우선이고 사이트맵은 그것을 돕는 수단입니다.
⚖️ 데이터 수집용 크롤링과 다른 점
크롤링이라는 같은 단어를 쓰지만 목적이 전혀 다른 두 가지가 있습니다. 헷갈리기 쉬워서 표로 정리했습니다.
| 구분 | 검색엔진 크롤러 | 데이터 수집용 크롤링 |
|---|---|---|
| 사용 주체 | 구글, 네이버 같은 검색엔진 | 개인이나 기업이 직접 |
| 목적 | 검색 결과에 넣을 페이지 수집 | 가격, 리뷰 같은 특정 데이터 확보 |
| 사이트 입장 | 오게 만드는 것이 목표 | 대개 막는 것이 목표 |
| 대응 방향 | 잘 다니도록 길을 열어 줌 | 차단이나 접속 제한을 검토 |
같은 사이트에서 한쪽은 환영하고 한쪽은 막는 상황이 동시에 벌어집니다. 데이터를 모으는 쪽 크롤링은 웹 크롤링에서 별도로 다룹니다.
⏱️ 크롤링 예산이라는 제약
검색엔진이 사이트 한 곳에 쓰는 시간과 횟수에는 한도가 있습니다. 구글은 이 한도를 크롤링 예산이라고 부르고 별도 문서로 안내합니다.
페이지가 스무 개인 사이트에서는 신경 쓸 일이 아닙니다. 그런데 상품이 수만 개인 쇼핑몰에서는 이야기가 달라집니다. 한도가 정해져 있으니 크롤러가 엉뚱한 페이지를 도는 데 시간을 쓰면 정작 중요한 상품 페이지에 도달하지 못합니다.
한도를 낭비하게 만드는 대표적인 경우입니다.
- 주소만 다르고 내용이 같은 페이지: 정렬 조건이나 필터가 붙은 주소가 무한히 만들어지는 구조
- 끊어진 링크: 없는 페이지로 보내는 링크를 계속 따라가게 됨
- 너무 느린 응답: 한 페이지를 받는 데 오래 걸리면 같은 시간에 도는 페이지 수가 줄어듦
세 항목은 정규 URL, 내부 링크, 페이지 속도를 다룰 때 다시 나옵니다.
🔍 크롤러가 웹사이트를 색인하지 못하는 대표적인 상황
새 카테고리 페이지를 만들었는데 검색엔진이 모를 때
메뉴에 넣지 않고 주소만 만들어 둔 경우입니다. 담당자는 주소를 알고 있으니 문제를 못 느끼는데, 크롤러 입장에서는 어디서도 이어지지 않는 페이지입니다. 메뉴나 관련 페이지에서 링크를 하나만 걸어도 상황이 바뀝니다.
로그인해야 보이는 페이지가 검색되지 않을 때
크롤러는 로그인을 하지 않습니다. 회원만 볼 수 있는 페이지는 크롤러에게도 보이지 않으므로 검색 결과에 나올 수 없습니다. 이 경우는 고장이 아니라 의도된 동작이라, 노출이 필요하면 일부 내용을 로그인 없이 볼 수 있게 열어야 합니다.
화면에는 글이 보이는데 검색엔진은 빈 페이지로 인식할 때
브라우저에서 스크립트가 실행된 뒤에야 본문이 채워지는 구조에서 생깁니다. 크롤러가 처음 받아 가는 파일에는 본문이 없을 수 있습니다. 서치 콘솔의 URL 검사에서 크롤러가 실제로 받아 간 내용을 확인하면 바로 드러납니다.
세 상황 모두 글을 고쳐서는 풀리지 않습니다. 크롤러가 오는 길이 막힌 것이기 때문입니다.
크롤러 봇이 페이지를 받아 온 다음에 무슨 일이 벌어지는지는 색인에서 이어집니다.
📋 30초 요약
-
검색엔진 크롤러는 링크를 따라다니며 페이지를 찾아 읽어 오는 프로그램입니다. 인터넷 전체를 훑는 것이 아니라 크롤러 봇이 알고 있는 주소만 방문합니다.
-
동네를 도는 배송기사와 같습니다. 이웃이 알려 주거나, 주민센터 주소록에 오르거나, 집주인이 직접 등록해야 새 집을 알게 됩니다. 셋 다 없는 페이지는 발견되지 않습니다.
-
크롤링 예산이라는 한도가 있습니다. 중복 주소, 끊어진 링크, 느린 응답이 한도를 갉아먹으면 정작 중요한 페이지가 뒤로 밀립니다.
참고 자료
아래 공식 문서는 2026년 8월 기준으로 확인했습니다. 검색엔진 정책은 바뀔 수 있으므로 최신 내용은 원문에서 확인하시면 됩니다.
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.
검색엔진 크롤러와 데이터 수집용 크롤링의 차이는 무엇일까요?
이어서 배우면 좋은 개념
검색엔진 최적화 (SEO) 이해하기
검색엔진 최적화(SEO)는 검색엔진이 페이지를 발견하고 저장하고 검색 결과에 보여주는 과정에 맞춰 사이트와 글을 정리하는 일입니다.
웹 크롤링 (Web Crawling)
웹사이트의 정보를 자동으로 수집하는 기술입니다. 사람이 일일이 복사-붙여넣기 할 필요 없이, 프로그램이 웹페이지를 돌아다니며 원하는 데이터를 모아줍니다.
답변 엔진 최적화 (AEO) 이해하기
답변 엔진 최적화(AEO)는 검색과 AI가 질문에 바로 내놓는 답변에 내 콘텐츠가 뽑히도록, 콘텐츠를 질문과 완결된 답의 구조로 정리하는 작업입니다.
서치 콘솔로 색인 상태 확인하기
구글 서치 콘솔은 내 사이트가 검색에서 어떻게 처리되는지 알려 주는 무료 도구입니다. URL 검사로 페이지 한 개의 색인 상태를, 페이지 보고서로 사이트 전체 상태를 확인합니다.
관련 인사이트
seo-title-creator: 검색 데이터를 기반으로 블로그 제목을 정하는 클로드 코드 스킬
준이아빠블로그는 개설 6개월 만에 평균 게재순위 6위, 전체 방문의 86.63%가 자연 검색인 성과를 기록하고 있습니다. 그 출발점인 제목 선정 과정을 묶어 공개한 것이 seo-title-creator입니다. 측정한 근거로 제목 후보 3개를 약점까지 붙여서 제안하는 클로드 코드 스킬의 원리와 실측 결과, 설치와 사용법을 정리했습니다.
젠스파크가 공개한 무료 AI 오피스 GenOffice 정리
GenOffice는 젠스파크가 2026년 8월 3일 공개한 무료 오픈소스 AI 오피스입니다. 워드, 엑셀, 파워포인트, PDF를 다루는 데스크톱 앱 네 개로 구성되며 코드 전체가 공개돼 있습니다. 구성과 파일 처리 방식, 라이선스 조건, 설치 요건을 저장소 기준으로 정리했습니다.
LLMO가 필요한 이유: AI 답변에 내 글이 인용되지 않을 때
LLMO는 대규모 언어 모델이 답변을 만들 때 내 문서를 찾아 읽고 인용하도록 콘텐츠를 다듬는 작업입니다. SEO, AEO, GEO와 무엇이 다른지, 생성형 엔진이 문서를 고르는 순서는 어떻게 되는지, KDD 2024 논문이 실제로 검증한 기법은 무엇인지 정리했습니다.
