본문 바로가기
이루웹

대형 상품 애그리게이터, 구글은 왜 선택만 색인할까

존 뮬러가 블루스카이에서 지목한 사례로 본, 대형 상품 비교·애그리게이터 사이트가 일부만 색인되는 이유와 점검법을 정리했습니다.

이루웹21분 분량

결론부터 말하면 이렇다. 상품을 수만에서 수십만 개까지 긁어모은 대형 애그리게이터(비교·큐레이션) 사이트는, 구글이 크롤링은 열심히 해도 색인은 극히 일부만 허용하는 경우가 흔하다. 구글의 존 뮬러(John Mueller)가 2026년 10월, 블루스카이에서 한 사이트 운영자의 질문에 답하며 이 패턴을 직접 설명했다.

질문을 올린 운영자의 사이트는 구글봇이 117만 번 넘게 크롤링했는데도, 약 18만 개에 달하는 페이지 중 색인된 것은 단 4개뿐이었다. 심지어 그 4개 안에는 홈페이지조차 들어 있지 않았다. 뮬러는 이 사이트를 "대형 상품 애그리게이터"로 분류하며 두 가지 문제를 짚었다.

이 글에서는 뮬러가 실제로 어떤 근거로 이 사이트를 지목했는지, 크롤링과 색인이라는 두 지표가 왜 전혀 다르게 움직이는지, 그리고 비슷한 구조의 사이트가 색인률을 끌어올리려면 무엇부터 손봐야 하는지를 차례로 정리한다.

117만 번 크롤링했는데 색인은 단 4개였다는 수치를 정리한 카드뉴스 표지
존 뮬러는 2026년 10월 블루스카이에서 대형 상품 애그리게이터 사이트의 색인 문제를 직접 짚었다.

이 글에서 먼저 챙겨 갈 핵심만 추리면 이렇다.

  • 존 뮬러가 2026년 10월 블루스카이에서 지목한 사례의 정확한 수치(크롤링 117만 회, 색인 단 4개)와 발언 요지
  • 크롤링 횟수와 색인 개수가 왜 전혀 다른 지표인지, 그 차이가 생기는 구조적인 이유
  • 뮬러가 짚은 두 가지 문제, 반복되는 리다이렉트와 프로그래매틱 자동생성 콘텐츠의 가치 부족
  • 대형 상품 비교·애그리게이터 사이트에서 반복적으로 나타나는 색인 거부 패턴
  • 지금 운영 중인 사이트가 같은 문제를 겪고 있는지 서치 콘솔로 확인하는 구체적인 방법
  • 색인률을 끌어올리려면 어떤 순서로 무엇부터 손봐야 하는지의 실행 체크리스트

이 순서대로 읽으면, 지금 운영 중인 쇼핑몰이나 비교 사이트에 같은 증상이 있는지, 있다면 무엇부터 고쳐야 하는지 바로 판단할 수 있다.

존 뮬러가 2026년 10월에 실제로 뭐라고 했나요?

2026년 10월, 한 사이트 운영자가 블루스카이에서 존 뮬러에게 직접 질문을 던졌다. "구글봇이 사이트를 117만 번 넘게 크롤링했는데, 왜 색인된 페이지는 4개뿐이고 홈페이지조차 색인이 안 되느냐"는 내용이었다. Search Engine Roundtable이 2026년 10월 6일 이 대화를 다룬 기사에서 전한 내용이다.

뮬러는 먼저 기술적인 문제를 짚었다. 그는 "색인된 것으로 보이는 URL 중 상당수가 결국 홈페이지로 리다이렉트되고 있다"며 "여전히 해결해야 할 큰 기술적 문제가 있는 것으로 보인다"고 답했다. 색인 카운트에 잡힌 4개 중 일부조차 실질적으로는 홈페이지의 사본이었다는 뜻이다.

이어서 뮬러는 콘텐츠 자체의 가치 문제를 지적했다. 그는 이 사이트를 "대형 상품 애그리게이터"로 규정하며 "이런 유형의 사이트를 제대로 만들고 유지하는 것은 결코 쉬운 일이 아니다"라고 밝혔다. 그러면서 "수많은 URL이 있지만, 보아하니 프로그래매틱 방식으로 자동생성된 콘텐츠인 것 같다"고 덧붙였다.

뮬러가 남긴 가장 핵심적인 문장은 이것이다. "검색엔진에게 이 콘텐츠가 가치 있다는 것을 납득시키는 일도, 사용자에게 유용하다는 것을 납득시키는 일도 모두 쉽지 않을 것이다."

여기서 짚어야 할 것은 이 발언이 완전히 새로운 정책 발표는 아니라는 점이다. 뮬러는 구체적인 페이지 수 기준이나 "몇 퍼센트 이상이면 위험하다"는 수치를 제시하지 않았다. 기존에 알려진 크롤링·색인 원칙과 콘텐츠 품질 기준을, 대형 상품 애그리게이터라는 구체적인 사례에 적용해 다시 설명한 것에 가깝다.

크롤링은 117만 번인데 색인은 4개뿐인 게 어떻게 가능한가요?

크롤링과 색인은 완전히 다른 단계의 지표이기 때문이다. 크롤링은 구글봇이 페이지를 "방문해서 읽어 보는" 단계이고, 색인은 그중에서 구글이 "검색 결과에 노출할 가치가 있다"고 판단해 실제로 데이터베이스에 저장하는 단계다.

크롤링 117만 회 중 색인은 단 4개뿐이었다는 수치를 막대로 비교한 인포그래픽
크롤링 횟수가 많다고 해서 색인 개수가 비례해서 늘어나지는 않는다.

나쁜 예: 크롤링 통계 보고서에서 크롤 횟수가 높게 나오는 것을 보고 "구글이 우리 사이트를 좋아하는구나"라고 안심하는 것. 좋은 예: 크롤링 통계와 색인 생성 보고서를 함께 확인해, 방문은 많은데 색인은 적은 구간이 있는지 교차 점검하는 것.

구글은 페이지를 발견하면 일단 크롤링을 시도하지만, 크롤링한 모든 페이지를 색인하지는 않는다. 특히 같은 내용이 반복되는 페이지, 리다이렉트로 끝나는 페이지, 품질이 낮다고 판단한 페이지는 크롤링 이력은 남아도 색인에서 제외된다. 이번 사례에서 18만 개 중 4개만 색인됐다는 것은, 구글이 나머지 약 18만 개에 가까운 페이지를 검토한 뒤 "이 페이지들은 검색 결과에 보여줄 가치가 없다"고 판단했다는 뜻으로 읽을 수 있다.

이 주제를 더 깊이 들여다보고 싶다면 크롤 버짓(크롤링 예산)이란? 색인 속도의 숨은 변수에서 크롤링과 색인의 관계를 기초부터 다뤘고, 신규 사이트 크롤 버짓, 처음엔 왜 보수적일까요에서는 사이트 초기 단계에 크롤링 자체가 제한되는 이유를 설명했다.

구글이 공식적으로 밝힌 크롤 버짓의 구조를 간단히 요약하면 두 축으로 나뉜다. 하나는 크롤링 속도 제한(crawl rate limit)으로, 서버에 부담을 주지 않는 선에서 구글봇이 얼마나 빠르게 요청을 보낼지를 정하는 값이다. 다른 하나는 크롤링 수요(crawl demand)로, 그 페이지가 얼마나 인기 있고 얼마나 자주 바뀌는지에 따라 구글이 "다시 방문할 가치가 있는가"를 판단하는 값이다.

대형 상품 애그리게이터는 이 두 축을 동시에 갉아먹기 쉬운 구조다. 페이지 수가 압도적으로 많아 속도 제한 안에서도 많은 자원이 소모되고, 그중 상당수가 저품질이라 수요 점수까지 낮아진다. 결과적으로 정작 색인할 가치가 있는 핵심 상품 페이지에까지 크롤링 자원이 충분히 돌아가지 못하는 악순환이 생긴다.

서치 콘솔 색인 생성 보고서에서는 어떤 사유들을 구분해서 봐야 하나요?

구글 서치 콘솔의 "설정 > 색인 생성 > 페이지" 보고서를 열면, 색인되지 않은 URL이 사유별로 나뉘어 표시된다. 대형 애그리게이터 사이트를 운영한다면 사유를 뭉뚱그려 보지 말고 하나씩 구분해서 원인을 추적해야 한다.

  • 크롤됨 - 현재 색인되지 않음: 구글이 페이지를 읽기는 했지만, 색인할 가치가 없다고 판단해 제외한 상태다. 이번 사례에서 18만 개 중 대부분이 이 범주에 속했을 가능성이 크다.
  • 검색된 적 있지만 아직 색인되지 않음: 구글이 아직 페이지를 방문조차 못한 상태다. 신규 URL이 너무 많이 한꺼번에 생성될 때 흔히 나타난다.
  • 중복, Google이 선택한 표준 URL이 사용자가 제출한 URL과 다름: 필터·정렬 조합 URL에서 가장 자주 보이는 사유다. 구글이 비슷한 페이지 여러 개 중 하나만 표준으로 선택했다는 뜻이다.
  • 페이지에 리디렉션이 있음: 이번 사례에서 뮬러가 지적한 바로 그 문제다. 해당 URL이 색인 대상이 아니라 다른 곳으로 이동하는 통로일 뿐이라는 의미다.
  • 소프트 404: 상품이 품절되거나 삭제됐는데도 서버가 200 응답을 계속 보내는 경우 발생한다. 품절 상품 페이지를 방치한 애그리게이터 사이트에서 흔히 나타난다.

나쁜 예: 색인되지 않은 URL 수가 많다는 사실만 보고 "구글이 우리 사이트를 저평가한다"고 막연히 결론 내리는 것. 좋은 예: 사유별로 URL을 묶어, 리다이렉트 문제인지 중복 문제인지 콘텐츠 품질 문제인지부터 구분해 각각 다른 해법을 적용하는 것.

이렇게 사유를 구분하면, 뮬러가 지적한 두 가지 문제, 즉 리다이렉트와 콘텐츠 가치 중 어느 쪽이 지금 사이트에서 더 큰 비중을 차지하는지 데이터로 확인할 수 있다.

반복되는 리다이렉트는 왜 색인에 치명적인가요?

색인 수치에 잡힌 URL이 실제로는 다른 페이지로 넘어가는 리다이렉트라면, 구글 입장에서는 "색인할 만한 고유 페이지"가 아니라 "홈페이지의 중복 사본"으로 보인다. 뮬러가 이 사이트의 가장 먼저 짚은 문제가 바로 이것이었다.

뮬러가 짚은 리다이렉트와 프로그래매틱 콘텐츠라는 두 가지 위험 신호를 정리한 인포그래픽
페이지 수가 아니라 리다이렉트 처리와 콘텐츠 가치가 색인 여부를 가른다.

리다이렉트 자체는 정상적인 기술 요소다. 오래된 URL을 새 URL로 옮길 때, 또는 중복 상품 페이지를 대표 URL로 모아줄 때 반드시 필요하다. 문제는 원래는 고유한 콘텐츠를 담고 있어야 할 상품·카테고리 페이지가 대량으로 홈페이지나 다른 페이지로 리다이렉트되는 경우다. 이런 구조가 생기는 전형적인 원인은 다음과 같다.

  • 품절·단종 상품 페이지를 개별 안내 없이 전부 홈페이지로 리다이렉트
  • 필터·정렬 조합으로 생성된 URL이 실제 콘텐츠 없이 메인 카테고리로 리다이렉트
  • 사이트 구조를 개편하면서 구 URL을 일괄적으로 홈페이지 하나로만 연결

나쁜 예: 상품이 품절되면 해당 URL을 그냥 홈페이지로 리다이렉트해, 같은 목적지로 향하는 URL이 수천 개씩 쌓이는 구조. 좋은 예: 품절 상품은 "품절" 상태를 명시한 자체 페이지로 유지하거나, 가장 유사한 대체 상품 페이지로 개별 리다이렉트하는 구조.

색인 생성 보고서에 "페이지가 색인됨"으로 뜬다고 해서 안심할 일이 아니다. 그 URL을 직접 열어 실제로 리다이렉트 없이 고유한 내용이 뜨는지 확인하는 것이 먼저다.

프로그래매틱 자동생성 콘텐츠는 왜 색인에서 밀리나요?

데이터 없이 문구 조합만으로 찍어낸 페이지는, 구글이 봤을 때 사용자에게 줄 수 있는 정보가 사실상 없기 때문이다. 뮬러는 이 사이트에 대해 "수많은 URL이 있지만 프로그래매틱 방식으로 자동생성된 콘텐츠로 보인다"고 평가했다.

대형 상품 애그리게이터는 태생적으로 프로그래매틱 방식에 의존할 수밖에 없다. 사람이 수만 개 상품 페이지를 일일이 손으로 쓸 수는 없기 때문이다. 문제는 방식 자체가 아니라, 그 방식으로 만든 결과물이 페이지마다 실제로 다른 정보를 담고 있는지 여부다. 이 기준은 프로그래매틱 SEO 전반에 적용되는 원칙과도 같다. 자세한 내용은 프로그래매틱 SEO, 구글이 신뢰도를 낮추는 이유에서 다뤘다.

나쁜 예: 상품명이나 브랜드명 변수만 바꾸고, 가격·재고·설명 문구는 모든 페이지에서 동일하게 반복되는 템플릿. 좋은 예: 상품마다 실제 가격·재고·배송 조건·리뷰 수가 실시간으로 다르게 반영되는 템플릿.

같은 애그리게이터라도 데이터가 실제로 고유한지에 따라 결과가 완전히 갈린다. 가격 비교, 항공권 비교, 부동산 매물처럼 조합마다 진짜 다른 데이터가 뒷받침되는 업종은 프로그래매틱 방식으로도 안정적으로 색인되고 순위를 얻는다. 반대로 데이터 연동 없이 문구만 바꿔 페이지 수를 불린 경우, 이번 사례처럼 크롤링은 되어도 색인에서 대거 탈락하는 결과로 이어지기 쉽다.

대형 상품 비교·애그리게이터 사이트에서 흔히 나타나는 색인 거부 패턴은 무엇인가요?

이번 사례처럼 극단적이지 않더라도, 상품 데이터베이스 규모가 큰 사이트에서는 아래와 같은 패턴이 반복적으로 나타난다. 공통점은 전부 "페이지는 많은데 고유한 가치는 적다"는 구조라는 점이다.

  • 필터·정렬 조합 URL 폭증: 가격순, 인기순, 색상별, 사이즈별 조합마다 별도 URL이 생기면서 사실상 같은 상품 목록을 보여주는 페이지가 수백, 수천 개로 늘어난다.
  • 제조사 피드 그대로 긁어온 상품 설명: 여러 쇼핑몰이 같은 제조사 피드를 그대로 가져다 쓰면, 사이트마다 문구가 거의 동일해 구글 입장에서는 중복 콘텐츠로 보인다.
  • 페이지네이션(페이지 나누기) 과다 생성: 상품 수가 많을수록 2페이지, 3페이지, …, 100페이지까지 이어지는데, 뒤로 갈수록 실제 클릭·전환이 거의 없는 "얇은" 페이지가 쌓인다.
  • 파라미터 URL의 중복 색인 후보 등록: ?sort=price, ?color=black처럼 같은 콘텐츠를 가리키는 URL 변형이 캐노니컬 처리 없이 그대로 색인 후보로 제출된다.
  • 품절·단종 상품 URL 방치: 더 이상 유효하지 않은 상품 페이지가 정리되지 않고 그대로 쌓여, 사이트 전체의 품질 신호를 낮춘다.
색인되지 않는 애그리게이터 페이지와 색인되는 애그리게이터 페이지의 차이를 비교한 인포그래픽
같은 애그리게이터 구조라도, 고유 데이터가 실시간으로 반영되는지에 따라 색인 결과가 갈린다.

이 패턴들의 공통분모는 결국 "구글이 크롤링 자원을 들여도, 이 페이지를 색인하면 검색 사용자에게 도움이 될까?"라는 질문에 "아니오"로 답하게 만드는 구조라는 것이다. 페이지 하나하나는 작은 문제처럼 보여도, 이런 패턴이 사이트 전체에 쌓이면 뮬러가 이번 사례에서 지적한 것과 똑같은 결과로 이어질 수 있다.

업종별로 보면 좋은 예와 나쁜 예는 어떻게 다른가요?

업종마다 "고유 데이터"가 의미하는 바는 다르다. 아래 기준으로 지금 운영 중인 사이트를 점검해 보면 좋다.

  • 쇼핑몰·오픈마켓형 사이트: 좋은 예는 재고·가격·배송비가 실제 물류 시스템과 연동돼 실시간으로 바뀌는 상품 페이지다. 나쁜 예는 품절된 지 오래된 상품도 그대로 남아 있고, 가격 정보가 몇 달째 갱신되지 않는 페이지다. 상품 수가 수만 개를 넘는 쇼핑몰일수록 이 격차가 색인률 전체에 그대로 드러난다.
  • 가격 비교 사이트: 좋은 예는 쇼핑몰별 실제 최저가·배송비가 매일 갱신되는 비교표다. 나쁜 예는 쇼핑몰 이름만 나열하고 실제 가격 연동이 끊긴 채 방치된 비교표다. 가격이 실제와 다르면 사용자 신뢰는 물론 구글의 품질 판단에도 바로 부정적인 신호가 된다.
  • 부동산 매물 사이트: 좋은 예는 매물마다 실제 평수·가격·위치·사진이 다른 페이지다. 나쁜 예는 이미 거래 완료된 매물이 몇 달째 "거래중"으로 그대로 노출되는 페이지다. 거래 완료 매물을 방치하면 사용자 이탈률이 올라가고, 이는 다시 품질 신호 하락으로 이어진다.
  • 여행·항공권 비교 사이트: 좋은 예는 출발지·도착지·날짜 조합마다 실제 운임이 반영된 페이지다. 나쁜 예는 특가 문구만 반복되고 실제 예약 시 가격이 전혀 다르게 나오는 페이지다. 조합의 경우의 수가 많을수록, 실제 데이터 연동 없이는 품질을 유지하기 어렵다.
  • 중고거래·렌탈 플랫폼: 좋은 예는 상품 상태·사용 기간·실제 판매자 정보가 매물마다 다른 페이지다. 나쁜 예는 이미 거래가 끝나 사라진 매물 URL이 정리되지 않고 쌓여 있는 구조다. 거래가 끝난 매물은 소프트 404나 리다이렉트 처리를 명확히 해 둬야 한다.
  • 중고차 매매 플랫폼: 좋은 예는 차량번호·주행거리·사고이력처럼 개별 차량마다 다른 정보가 명확히 드러나는 페이지다. 나쁜 예는 차종명만 바뀌고 나머지 설명 문구는 동일한 템플릿이 반복되는 페이지다. 차량 한 대 한 대가 고유한 상품이라는 특성상, 데이터 고유성 문제가 가장 두드러지는 업종이기도 하다.

나쁜 예: 업종과 무관하게 "일단 페이지 수를 늘려야 트래픽이 는다"는 가정으로 데이터 검증 없이 URL부터 찍어내는 것. 좋은 예: 페이지 수보다 "이 조합을 실제로 검색하는 사용자가 있는가", "이 페이지가 다른 페이지와 구별되는 고유 정보를 담고 있는가"를 먼저 확인하는 것.

지금 운영 중인 사이트가 같은 문제를 겪고 있는지 어떻게 확인하나요?

가장 먼저 할 일은 구글 서치 콘솔의 색인 생성 보고서를 여는 것이다. 이 보고서는 전체 URL을 "색인됨"과 "색인되지 않음"으로 나누고, 색인되지 않은 URL은 그 이유까지 구체적으로 보여준다.

점검 순서는 다음과 같다.

첫째, 색인되지 않은 URL의 사유를 분류한다. "크롤됨 - 현재 색인되지 않음", "검색된 적 있지만 아직 색인되지 않음", "중복, Google이 선택한 표준 URL이 사용자가 제출한 URL과 다름" 같은 항목을 사유별로 묶어 보면, 어떤 유형의 문제가 가장 큰 비중을 차지하는지 바로 보인다.

둘째, 리다이렉트 비중을 따로 확인한다. "페이지에 리디렉션이 있음" 항목에 잡힌 URL 수가 많다면, 이번 사례처럼 리다이렉트가 색인을 가로막는 주요 원인일 가능성이 크다.

셋째, URL 검사 도구로 표본을 직접 확인한다. 색인되지 않은 URL 중 대표적인 몇 개를 URL 검사 도구에 넣어, "크롤됨" 여부와 "사용자가 지정한 표준 URL"과 "Google이 선택한 표준 URL"이 일치하는지 비교한다. 두 URL이 다르다면, 구글이 이 페이지를 중복으로 판단하고 있다는 신호다.

넷째, 색인된 페이지와 색인되지 않은 페이지의 공통점을 찾는다. 색인된 소수의 페이지가 공통으로 가진 특징(예: 고유 설명, 리뷰, 이미지)이 무엇인지, 반대로 색인되지 않은 다수의 페이지가 공통으로 빠뜨린 요소가 무엇인지 비교하면 우선순위가 보인다.

색인되지 않은 URL이 많다고 해서 무조건 나쁜 신호는 아니다. 다만 그 비율이 비정상적으로 높고, 특히 핵심 상품·카테고리 페이지까지 포함돼 있다면 구조적인 문제로 봐야 한다.

색인률을 끌어올리려면 어떤 순서로 손봐야 하나요?

순서가 중요하다. 고유 데이터를 아무리 보강해도 리다이렉트 문제가 그대로면 효과가 반감되고, 반대로 기술 문제만 고치고 콘텐츠 품질이 낮으면 색인은 돼도 순위는 오르지 않는다.

첫째, 리다이렉트 체인부터 정리한다. 여러 단계를 거쳐 최종 목적지에 도달하는 리다이렉트는 한 번에 연결되도록 손본다. 특히 상품·카테고리 페이지가 의도치 않게 홈페이지로 리다이렉트되고 있지 않은지 전수 점검한다.

둘째, 캐노니컬 태그를 명확히 지정한다. 필터·정렬 조합으로 생긴 URL에는 대표 URL을 가리키는 캐노니컬 태그를 넣어, 구글이 어떤 URL을 표준으로 봐야 하는지 혼동하지 않게 한다.

셋째, 가치가 없는 페이지는 먼저 정리하거나 noindex 처리한다. 품절 후 장기간 재입고 계획이 없는 상품, 데이터가 비어 있는 조합 페이지는 색인 후보에서 먼저 제외하는 편이 전체 사이트의 품질 신호를 지키는 데 유리하다.

넷째, 파라미터 URL을 통합한다. 정렬·필터 옵션으로 생기는 URL은 서치 콘솔의 URL 파라미터 설정이나 캐노니컬 태그로 핵심 URL에 모아준다.

다섯째, 고유 데이터를 보강한다. 가격·재고·리뷰·사양처럼 실제로 검증 가능한 정보를 각 페이지에 채워, 템플릿은 같아도 내용은 페이지마다 달라지도록 만든다.

여섯째, 핵심 페이지로 내부 링크를 집중시킨다. 가치가 높은 상품·카테고리 페이지에 내부 링크가 몰리도록 메뉴·추천 상품·브레드크럼 구조를 다시 짠다.

일곱째, 개선 후에는 서치 콘솔로 꾸준히 추적한다. 한 번 손봤다고 바로 색인률이 오르지 않는다. 색인 생성 보고서의 사유별 URL 수가 시간이 지나며 어떻게 바뀌는지 주기적으로 확인해야 한다.

대형 상품 애그리게이터 사이트의 색인률을 끌어올리기 위한 7가지 체크리스트 인포그래픽
리다이렉트 정리와 고유 데이터 보강을 함께 진행해야 색인률이 실질적으로 올라간다.

나쁜 예: 색인이 안 된다는 이유로 같은 페이지를 사이트맵에 반복 제출하거나 URL 검사 도구로 색인 요청만 계속 누르는 것. 좋은 예: 리다이렉트·캐노니컬·콘텐츠 품질 순으로 구조 자체를 고친 뒤, 자연스럽게 재크롤링과 재평가가 이뤄지길 기다리는 것.

구조를 고쳤다고 해서 다음 크롤링 때 바로 색인률이 오르는 것은 아니다. 사이트 규모에 따라 다르지만, 수만 개 단위의 URL을 재평가하는 데는 수 주에서 수개월이 걸릴 수 있다. 중요한 것은 속도가 아니라 방향이다. 색인 생성 보고서에서 "크롤됨 - 현재 색인되지 않음" 비중이 꾸준히 줄어들고 있는지를 지표로 삼고, 단기간에 급격한 변화를 기대하지 않는 편이 현실적이다.

이런 구조적인 점검은 신규 상품을 추가할 때부터 설계 단계에서 함께 반영하는 것이 가장 효율적이다. 상품 수가 많은 쇼핑몰·비교 사이트일수록, URL 구조와 색인 전략을 운영 중간이 아니라 처음 설계 단계에서부터 염두에 두는 쪽이 나중에 들어가는 손질 비용을 크게 줄여 준다.

색인 문제가 AI 검색 노출에도 영향을 주나요?

그렇다. AI 오버뷰나 AI 모드 같은 구글의 생성형 검색 기능은 기본적으로 구글의 기존 색인을 바탕으로 답을 구성한다. 즉 애초에 구글 색인에 들어가지 못한 페이지는 일반 검색 결과는 물론, AI 검색 답변에도 인용될 수 없다.

대형 상품 애그리게이터 입장에서는 이 점이 특히 더 아프다. "OO 모델 최저가", "OO 지역 매물 추천"처럼 AI 검색에서 자주 호출되는 비교·추천형 질의일수록, 애그리게이터 사이트가 원래 가장 유리한 답변 소스가 될 수 있는 영역이기 때문이다. 색인 문제를 먼저 해결해야 AI 검색이라는 다음 단계의 노출 기회도 따라온다.

순서를 혼동하지 않아야 한다. AI 검색 대응을 위한 콘텐츠 구조를 아무리 잘 짜도, 그 페이지가 애초에 구글 색인에 없으면 AI 검색 답변에도 등장할 수 없다. 색인이 먼저이고, AI 검색 최적화는 그다음이다.

자주 묻는 질문

크롤링 횟수가 많으면 색인에 유리한 것 아닌가요?

아니다. 크롤링은 구글이 페이지를 "검토하는" 단계이고, 색인은 그중 가치가 있다고 판단한 페이지만 저장하는 단계다. 이번 사례처럼 크롤링은 117만 번이 넘어도 색인은 4개에 그칠 수 있다. 크롤링 횟수 자체보다, 크롤링된 페이지가 실제로 색인으로 이어지는 비율을 살펴보는 것이 더 중요하다.

색인되지 않은 페이지는 그냥 삭제해야 하나요?

페이지마다 다르다. 실제 데이터(재고·가격·고유 설명)가 뒷받침되는 페이지라면 삭제보다 콘텐츠를 보강해 살리는 편이 낫다. 반대로 애초에 데이터가 비어 있고 검색 수요도 없는 조합 페이지라면 정리하거나 noindex 처리하는 것이 사이트 전체의 품질 신호에 도움이 된다.

robots.txt로 막으면 색인 문제가 해결되나요?

아니다. robots.txt는 크롤링 자체를 막는 역할이지, 색인 여부를 직접 결정하지 않는다. 오히려 robots.txt로 막힌 페이지도 다른 곳에서 링크가 걸려 있으면 설명 없이 색인되는 경우가 있다. 색인을 막고 싶은 저품질 페이지라면 크롤링은 허용하되 noindex 메타 태그를 쓰는 것이 더 정확한 방법이다.

"아그리게이터 유닛"이라는 용어와 같은 이야기인가요?

다른 개념이다. 이 글에서 다룬 "상품 애그리게이터"는 상품 비교·큐레이션 사이트 자체의 색인 문제를 가리킨다. 반면 구글 지역 검색에 등장하는 "아그리게이터·공급자 유닛"은 검색 결과 화면에 제3자 예약·정보 제공업체가 묶여 노출되는 별도의 기능을 뜻한다. 자세한 차이는 아그리게이터·공급자 유닛, 한국엔 왜 안 보일까에서 다뤘다.

네이버 쇼핑이나 스마트스토어에도 같은 기준이 적용되나요?

이 글에서 다룬 크롤링·색인 원칙은 구글 검색을 기준으로 한 설명이다. 네이버는 자체 로직으로 상품·문서 품질을 판단하므로 정확한 반영 기준은 다르다. 다만 "고유하고 검증 가능한 정보를 담아야 한다"는 기본 원칙은 플랫폼과 무관하게 유효하다.

사이트맵을 다시 제출하면 색인이 빨라지나요?

구조적인 문제가 남아 있는 상태에서 사이트맵만 다시 제출해서는 효과가 크지 않다. 사이트맵은 구글에게 "이 URL들이 존재한다"는 것을 알리는 역할일 뿐, 리다이렉트나 콘텐츠 품질 문제까지 해결해 주지는 않는다. 근본 원인을 먼저 고친 뒤 사이트맵을 갱신하는 순서가 맞다.

페이지 수가 적은 작은 쇼핑몰도 이 문제에서 자유로운가요?

페이지 수가 적으면 이번 사례만큼 극단적인 비율로 나타나지는 않지만, 원리는 똑같이 적용된다. 필터 조합이나 품절 상품 리다이렉트가 쌓이면 작은 쇼핑몰도 전체 페이지 대비 색인 비율이 낮아질 수 있다. 사이트 규모와 무관하게 서치 콘솔의 색인 생성 보고서를 정기적으로 확인하는 습관이 필요하다.

URL 검사 도구로 색인 요청을 반복하면 더 빨리 색인되나요?

효과가 제한적이다. URL 검사 도구의 색인 생성 요청은 개별 페이지를 우선 검토 대기열에 넣어 주는 기능일 뿐, 페이지 자체의 품질 판단 기준을 바꾸지는 않는다. 리다이렉트나 콘텐츠 품질 문제가 남아 있는 상태에서 요청만 반복하면, 같은 이유로 다시 색인에서 제외될 가능성이 크다.

신규 상품을 매일 수천 개씩 올리는 것 자체가 위험한가요?

업로드 속도 자체보다 데이터 품질과 고유성이 그 속도를 뒷받침하는지가 핵심이다. 실제 재고·가격 연동 없이 속도만 높이면 이번 사례처럼 크롤링 대비 색인 비율이 떨어지는 결과로 이어지기 쉽다. 반대로 데이터가 충분히 검증된 상태라면, 업로드 속도가 빠르다는 이유만으로 불이익을 받지는 않는다.

대형 상품 애그리게이터일수록 URL 구조 설계, 리다이렉트 관리, 데이터 품질까지 한 번에 짚어야 색인 문제로 되돌아오지 않습니다. 이루웹은 SEO 최적화 홈페이지 제작 단계에서부터 이런 구조적인 리스크를 함께 점검해 드리고 있으니, 지금 운영 중인 사이트에 비슷한 증상이 있다면 이루웹에 상담을 요청해 주세요.

검색되는 사이트가 필요하신가요?

이 글의 원칙을 그대로 적용해 사이트를 만듭니다. 상담은 무료입니다.