Crawling và indexing là gì? Khác nhau thế nào và Googlebot hoạt động ra sao

Crawling và Indexing trong quy trình Googlebot thu thập và lập chỉ mục

Crawling là quá trình Googlebot thu thập dữ liệu từ các trang web bằng cách theo dõi liên kết một cách có hệ thống. Indexing là bước tiếp theo — Google phân tích và lưu trữ nội dung đã crawl vào cơ sở dữ liệu để có thể hiển thị trong kết quả tìm kiếm. Một trang được crawl không đồng nghĩa nó sẽ được index.

Chào bạn, mình là Đăng — Search Marketing expert với 6 năm kinh nghiệm SEO B2B tại SME Solution. Trong bài này mình sẽ giải thích rõ sự khác biệt giữa hai khái niệm kỹ thuật hay bị dùng lẫn lộn này, và một khái niệm ít người biết: render budget.

Crawling là gì?

Crawling là quá trình Googlebot (chương trình thu thập dữ liệu tự động của Google) truy cập vào các trang web, đọc nội dung HTML và theo dõi các liên kết để phát hiện thêm trang mới. Tần suất và số lượng trang được crawl phụ thuộc vào crawl budget — được xác định bởi hai yếu tố chính: crawl rate limit (tốc độ Google crawl mà không làm quá tải server của bạn) và crawl demand (mức độ phổ biến và tần suất cập nhật nội dung của site).

Indexing là gì?

Indexing là bước Google phân tích nội dung đã crawl được và quyết định có lưu trữ nó vào chỉ mục (index) — cơ sở dữ liệu khổng lồ dùng để trả kết quả tìm kiếm — hay không. Một trang có thể bị crawl nhưng không được index nếu Google đánh giá nội dung trùng lặp, chất lượng thấp, hoặc có chỉ định noindex.

Cơ chế: quy trình khác nhau giữa trang HTML tĩnh và trang JavaScript

Đây là phần kỹ thuật quan trọng nhất, đặc biệt với các website B2B dùng framework hiện đại (React, Vue) cho phần hiển thị sản phẩm/dịch vụ.

Với trang HTML tĩnh đơn giản, quy trình chỉ gồm 2 bước: crawl rồi index. Nhưng với nội dung phụ thuộc JavaScript để hiển thị (phổ biến ở các website dùng framework JS hiện đại), quy trình cần thêm một bước: crawl → render → index. Google crawl HTML thô của trang trước, xếp hàng đợi để render (chạy JavaScript để tạo ra nội dung đầy đủ) ở một đợt xử lý riêng, sau đó mới index nội dung đã render.

Xem thêm  Noindex và nofollow khác nhau thế nào? Cách dùng đúng cho từng mục đích

Bước render này tiêu tốn tài nguyên tính toán riêng, gọi là render budget — khác với crawl budget. Render budget quyết định Google có đủ tài nguyên để thực sự “đọc” và hiểu nội dung động của trang hay không, không chỉ dừng ở việc tải được HTML thô. Hệ quả thực tế: một website JS nặng có thể bị delay đáng kể giữa thời điểm trang được crawl và thời điểm nội dung đầy đủ thực sự được index — đây là nguyên nhân phổ biến khiến nội dung mới trên các site hiện đại lên index chậm hơn kỳ vọng, dù crawl budget không hề thiếu.

Cập nhật quan trọng 2026: tốc độ server quan trọng hơn số lượng trang

Đây là hướng dẫn mới đáng chú ý từ chính đại diện Google. Theo chia sẻ của Gary Illyes (đội ngũ Search Relations của Google), thứ tự ưu tiên đúng khi tối ưu crawl budget nên là: tốc độ server trước tiên, chất lượng nội dung có thể crawl thứ hai, và số lượng URL xếp thứ ba — ngược lại với cách nhiều người vẫn nghĩ (thường lo lắng về số lượng trang trước). Illyes minh họa cụ thể: nếu website đang thực hiện các truy vấn cơ sở dữ liệu tốn kém, điều đó sẽ gây tốn tài nguyên server đáng kể — một site 500.000 trang với truy vấn SQL chậm có thể gặp vấn đề crawl nghiêm trọng hơn nhiều so với một site 2 triệu trang nhưng có tốc độ xử lý nhanh. Đây là thông tin quan trọng cho các doanh nghiệp B2B đang cân nhắc đầu tư hạ tầng: tốc độ và hiệu năng server ảnh hưởng trực tiếp đến khả năng Google crawl hiệu quả, không kém phần quan trọng so với việc kiểm soát số lượng trang.

Nguyên nhân lớn nhất gây lãng phí crawl budget: điều hướng theo bộ lọc

Một phát hiện đáng chú ý khác từ báo cáo crawl cuối năm 2025 của Google: điều hướng theo bộ lọc (faceted navigation) — các URL sinh ra từ việc lọc sản phẩm theo nhiều tiêu chí (giá, màu sắc, kích thước…) — chiếm tới 50% các vấn đề liên quan đến mẫu URL mà Google ghi nhận, với các tham số URL dựa trên hành động (như thêm vào giỏ hàng, sắp xếp) chiếm thêm khoảng 25% nữa. Khi crawl budget bị tiêu tốn vào các URL bộ lọc này, các trang sản phẩm và danh mục quan trọng thực sự sẽ được crawl ít thường xuyên hơn và có thể index chậm hơn. Với website B2B có catalogue sản phẩm lớn, nhiều tùy chọn lọc (theo công suất, kích thước, ứng dụng), đây là điểm cần rà soát kỹ — dùng thẻ canonical hoặc chặn qua robots.txt cho các tổ hợp URL bộ lọc không cần thiết index riêng lẻ.

Giới hạn dung lượng HTML mới: giảm từ 15MB xuống 2MB

Một thay đổi kỹ thuật cụ thể đáng lưu ý: vào tháng 1/2026, Google đã giảm giới hạn dung lượng HTML có thể crawl từ khoảng 15MB xuống còn 2MB — đồng thời Illyes cũng công khai xác nhận rằng tốc độ hạ tầng quan trọng hơn quy mô site. Với các trang có nội dung HTML quá nặng (thường do nhúng quá nhiều dữ liệu inline, script không cần thiết, hoặc cấu trúc trang phức tạp), phần vượt quá giới hạn này có thể không được Googlebot xử lý đầy đủ — đây là lý do nên định kỳ kiểm tra dung lượng HTML thô của các trang quan trọng, đặc biệt các trang danh mục sản phẩm lớn có xu hướng phình to theo thời gian khi thêm nhiều sản phẩm.

Xem thêm  Soft 404 là gì? Cách phát hiện qua Search Console và sửa đúng cách

Cách kiểm tra Googlebot có crawl và index đúng website không

  1. Dùng URL Inspection Tool trong Google Search Console — kiểm tra trạng thái crawl, ngày crawl gần nhất, và trạng thái index cho từng URL cụ thể.
  2. Xem báo cáo “Coverage” / “Pages” trong Search Console — phát hiện các trang bị loại khỏi index và lý do cụ thể.
  3. Kiểm tra file robots.txt — đảm bảo không vô tình chặn crawl các trang quan trọng.
  4. Với site dùng nhiều JavaScript, dùng chức năng “Xem trang đã lập chỉ mục” (View Crawled Page) trong URL Inspection để so sánh nội dung Google thực sự thấy sau render với nội dung hiển thị cho người dùng.

Ví dụ thực tế: website B2B với catalogue sản phẩm lớn

Để hình dung cách các yếu tố trên kết hợp trong thực tế, hãy xem một doanh nghiệp phân phối thiết bị công nghiệp với 2.000 sản phẩm, mỗi sản phẩm có thể lọc theo 5 tiêu chí (công suất, thương hiệu, giá, tình trạng, ứng dụng). Về mặt lý thuyết, tổ hợp URL do bộ lọc sinh ra có thể lên đến hàng chục nghìn URL — vượt xa số lượng sản phẩm thực tế. Nếu không kiểm soát, Googlebot có thể dành phần lớn crawl budget để thu thập các URL bộ lọc trùng lặp gần như hoàn toàn về nội dung, trong khi các trang sản phẩm mới thêm vào lại chậm được phát hiện và index. Giải pháp đúng: dùng canonical trỏ các URL bộ lọc về trang danh mục gốc, chặn crawl các tham số không cần thiết qua robots.txt, và chỉ để Google index các trang danh mục/sản phẩm thực sự có giá trị tìm kiếm độc lập.

Mối liên hệ giữa index bloat và chất lượng tổng thể site

Một khái niệm liên quan cần hiểu: “index bloat” (phình chỉ mục) xảy ra khi quá nhiều URL giá trị thấp hoặc trùng lặp được đưa vào chỉ mục của Google — không chỉ lãng phí crawl budget mà còn có thể ảnh hưởng đến cách Google đánh giá chất lượng tổng thể của toàn site. Khi tỷ lệ trang chất lượng thấp/trùng lặp trong tổng số trang được index quá cao, đây có thể là tín hiệu tiêu cực về mức độ chăm sóc chất lượng nội dung của toàn bộ website — dù từng trang riêng lẻ không vi phạm gì nghiêm trọng. Đây là lý do việc chủ động kiểm soát những gì được phép index (qua canonical, noindex, hoặc chặn crawl) quan trọng không kém việc tạo ra nội dung mới — quản lý tốt chỉ mục hiện có cũng là một phần của chiến lược SEO kỹ thuật bài bản.

Sai lầm thường gặp

  • Nhầm “đã submit sitemap” với “đã được index”. Submit sitemap chỉ giúp Google biết trang tồn tại, không đảm bảo crawl hay index.
  • Chặn crawl bằng robots.txt cho trang cần noindex, khiến Google không crawl được để đọc chỉ định noindex — nghịch lý này khiến trang vẫn có thể xuất hiện trong kết quả tìm kiếm (dù không có nội dung mô tả) vì Google không crawl được để biết cần loại bỏ.
  • Bỏ qua render budget với site JS nặng, không kiểm tra nội dung sau render có khớp với nội dung hiển thị cho người dùng hay không.
Xem thêm  Canonical URL là gì? Thẻ rel=canonical và thứ tự tín hiệu Google dùng để chọn

Tóm lại: hai khái niệm tách biệt nhưng luôn cần xét cùng nhau

Dù crawling và indexing là hai bước kỹ thuật riêng biệt trong quy trình, việc đánh giá sức khỏe SEO của một website luôn cần xem xét cả hai cùng lúc — một trang có thể được crawl hoàn hảo nhưng vẫn không được index nếu chất lượng nội dung chưa đạt, và ngược lại một trang có nội dung xuất sắc cũng vô nghĩa nếu Googlebot chưa từng crawl được nó. Hiểu rõ ranh giới giữa hai khái niệm này giúp chẩn đoán đúng vấn đề khi traffic organic không như kỳ vọng, thay vì đoán mò nguyên nhân.

FAQ

Crawl budget có quan trọng với website B2B nhỏ không?

Với site có dưới vài trăm trang, crawl budget hiếm khi là vấn đề — Google thường crawl đủ nhanh. Crawl budget chỉ thực sự đáng lo với site rất lớn (hàng chục nghìn trang trở lên) hoặc site có nhiều trang trùng lặp/tham số URL gây lãng phí crawl.

Làm sao biết một trang bị crawl nhưng không được index?

Vào Search Console → Coverage/Pages → xem mục “Crawled – currently not indexed” — đây là danh sách các trang Google đã thu thập nhưng quyết định không đưa vào chỉ mục, thường do chất lượng nội dung hoặc trùng lặp.

Trang mới đăng bao lâu thì được index?

Không có mốc cố định — từ vài giờ đến vài tuần tùy độ tin cậy của site và loại nội dung (HTML tĩnh thường nhanh hơn nội dung JavaScript cần render).

Tốc độ server chậm có ảnh hưởng đến crawl budget không?

Có, và theo hướng dẫn mới nhất từ Google, đây là yếu tố quan trọng hàng đầu — server xử lý chậm (đặc biệt với các truy vấn cơ sở dữ liệu tốn kém) có thể khiến Googlebot giảm tốc độ crawl để tránh gây quá tải, ảnh hưởng tiêu cực đến crawl budget nhiều hơn cả việc site có bao nhiêu trang.

Faceted navigation có nên tắt hoàn toàn để tránh vấn đề crawl không?

Không cần tắt hoàn toàn — bộ lọc vẫn hữu ích cho trải nghiệm người dùng, chỉ cần kiểm soát đúng cách (canonical, chặn crawl tham số không cần thiết) để tránh việc mọi tổ hợp lọc đều được Google thu thập và index riêng lẻ một cách lãng phí không cần thiết.

Nguồn tham khảo

Không chắc website của mình có đang bị vấn đề crawl hoặc render budget hay không? Dịch vụ SEO Audit tại SME Solution kiểm tra kỹ cả phần Googlebot thực sự thấy, không chỉ những gì hiển thị trên trình duyệt của người dùng.

Đánh giá bài viết post