Thu thập dữ liệu trong SEO

Bạn có thể xuất bản nội dung tốt nhất trong ngành, xây dựng một trang web ấn tượng và dành hàng tháng trời để tinh chỉnh chiến lược tìm kiếm. Nhưng nếu hệ thống tìm kiếm không thể phát hiện và truy cập thông tin đó một cách đáng tin cậy, thì phần lớn công sức của bạn sẽ rơi vào thế bất lợi.

Đó là ý tưởng cơ bản đằng sau khả năng thu thập dữ liệu .

Khả năng thu thập dữ liệu mô tả mức độ dễ dàng mà các hệ thống tự động có thể phát hiện, truy cập và di chuyển qua nội dung trên trang web của bạn. Theo truyền thống, cuộc thảo luận này hầu như chỉ tập trung vào các trình thu thập dữ liệu của công cụ tìm kiếm như Googlebot. Ngày nay, phạm vi đã rộng hơn. Tìm kiếm của Google vẫn vô cùng quan trọng, nhưng các trang web cũng có thể được truy cập bởi các trình thu thập dữ liệu và hệ thống truy xuất liên kết với ChatGPT, Perplexity, Claude và các nền tảng khám phá dựa trên trí tuệ nhân tạo khác.

Điều đó khiến khả năng thu thập dữ liệu trở thành một trong những yếu tố nền tảng của SEO kỹ thuật, nhưng nó ngày càng trở thành một phần của khái niệm rộng lớn hơn mà chúng ta gọi là khả năng truy cập tìm kiếm: đảm bảo rằng các hệ thống mà mọi người sử dụng để tìm kiếm, nghiên cứu, so sánh và đưa ra quyết định thực sự có thể truy cập được thông tin mà bạn muốn họ tìm thấy.

Khả năng thu thập dữ liệu không đảm bảo thứ hạng, lập chỉ mục, lưu lượng truy cập, trích dẫn AI hoặc đề xuất. Nó tạo ra cơ hội. Hệ thống tìm kiếm trước tiên cần một cách đáng tin cậy để tiếp cận và xử lý thông tin của bạn trước khi chúng có thể quyết định xem thông tin đó có xứng đáng được hiển thị hay không.

Khả năng thu thập dữ liệu là gì?

Khả năng thu thập dữ liệu là khả năng của công cụ tìm kiếm, trình thu thập dữ liệu tìm kiếm bằng AI hoặc hệ thống tự động khác truy cập các trang và tài nguyên trên một trang web.

Các trình thu thập dữ liệu thường tìm thấy URL thông qua các liên kết, sơ đồ trang web XML, các URL đã biết trước đó, các tham chiếu bên ngoài và các cơ chế tìm kiếm khác. Khi trình thu thập dữ liệu biết URL tồn tại, nó có thể yêu cầu trang đó từ máy chủ của bạn, phân tích phản hồi, xử lý HTML và các tài nguyên khác, theo các liên kết đến các trang bổ sung và có thể gửi thông tin vào hệ thống lập chỉ mục hoặc truy xuất.

Google mô tả việc thu thập thông tin, hiển thị và lập chỉ mục là các phần liên kết nhưng riêng biệt trong cách Google xử lý web trong tài liệu “Cách Google Search hoạt động” . Sự phân biệt đó rất quan trọng bởi vì một URL có thể tồn tại ngay cả khi không phải mọi phần của quá trình đó hoạt động đúng cách.

Một trang có thể không có liên kết nội bộ nào trỏ đến nó. Tường lửa có thể chặn trình thu thập thông tin hợp lệ. JavaScript có thể yêu cầu tương tác trước khi nội dung quan trọng hiển thị. Thẻ canonical có thể trỏ đến một trang khác. Máy chủ của bạn có thể thỉnh thoảng trả về lỗi, hoặc một phần quan trọng có thể vô tình bị chặn robots.txt.

Trang đó vẫn tồn tại đối với người dùng là con người, người biết chính xác vị trí của nó. Điều đó không nhất thiết có nghĩa là các hệ thống tìm kiếm trải nghiệm nó theo cùng một cách.

Khả năng được công cụ tìm kiếm thu thập chỉ là một bước trong việc tăng khả năng hiển thị trên công cụ tìm kiếm.

Một lý do khiến chủ đề này trở nên khó hiểu là việc thu thập dữ liệu, lập chỉ mục, hiển thị và xếp hạng thường được coi là những khái niệm có thể thay thế cho nhau. Chúng có liên quan đến nhau, nhưng lại đại diện cho các giai đoạn khác nhau của quy trình.

Sân khấuCâu hỏi đang được trả lời
Khám pháHệ thống có biết URL này tồn tại không?
Truy cập / Thu thập dữ liệuLiệu trình thu thập dữ liệu có được phép và có khả năng về mặt kỹ thuật để yêu cầu điều đó không?
Kết xuấtHệ thống có thể truy cập nội dung quan trọng sau khi trang tải xong không?
Lập chỉ mục / Xử lýHệ thống quyết định lưu trữ, tổng hợp hay xử lý thông tin?
Truy xuấtLiệu thông tin có thể được chọn lọc khi nó phù hợp với truy vấn hay không?
Bài thuyết trình / Trích dẫnHệ thống đó cuối cùng có xếp hạng, tham khảo, tóm tắt, đề xuất hay trích dẫn nó không?

Thất bại ngay từ đầu trong chuỗi đó sẽ làm giảm các cơ hội có được sau này.

Điều đó không có nghĩa là mọi trang được trình thu thập thông tin sẽ được lập chỉ mục, và chắc chắn không có nghĩa là mọi trang được lập chỉ mục sẽ được xếp hạng cao. Tương tự, việc cho phép trình thu thập thông tin tìm kiếm bằng AI không đảm bảo sẽ có trích dẫn trong kết quả do AI tạo ra.

Khả năng di chuyển trên địa hình gồ ghề là nền tảng, chứ không phải là đích đến.

Mối quan hệ rộng hơn giữa việc thu thập dữ liệu, hiển thị, lập chỉ mục, kiến ​​trúc website và khả năng tìm kiếm hiện đại cũng là lý do tại sao SEO kỹ thuật ngày càng trở nên quan trọng hơn khi tìm kiếm bằng AI phát triển , chứ không phải là kém quan trọng hơn.

Khả năng thu thập dữ liệu so với khả năng lập chỉ mục

Khả năng thu thập dữ liệu và khả năng lập chỉ mục có mối liên hệ chặt chẽ, nhưng không nên coi chúng là một.

Khả năng thu thập dữ liệu (Crawlability) hỏi liệu một hệ thống có thể truy cập trang và nội dung của nó hay không. Khả năng lập chỉ mục (Indexability) hỏi liệu nội dung đó có đủ điều kiện và phù hợp để được đưa vào chỉ mục tìm kiếm hay không.

Một trang web có thể được Googlebot thu thập thông tin đầy đủ trong khi vẫn chứa một noindexchỉ thị cụ thể. Trong trường hợp đó, Googlebot có thể yêu cầu và đọc trang, nhưng noindexchỉ thị này lại yêu cầu Google không giữ lại trang đó trong kết quả tìm kiếm.

Ngoài ra còn có một điểm quan trọng mà các giải thích cũ về khả năng thu thập thông tin thường bỏ qua: chặn một URL robots.txtkhông đồng nghĩa với việc loại bỏ URL đó khỏi kết quả tìm kiếm của Google một cách chắc chắn. Google có thể biết rằng một URL bị chặn thông qua các liên kết, ngay cả khi nó không thể truy cập nội dung của trang.

Google giải thích điều này trực tiếp trong tài liệu robots.txt của họ . Nếu mục tiêu là kiểm soát việc lập chỉ mục chứ không phải thu thập dữ liệu, thì có thể cần một chỉ thị khác.

Sự khác biệt này trở nên đặc biệt quan trọng khi noindexnó được đưa vào cuộc hội thoại. Google cần thu thập thông tin của một trang để thấy được noindexchỉ thị. Nếu bạn đồng thời ngăn Googlebot truy cập trang đó robots.txt, nó có thể sẽ không bao giờ thấy được chỉ thị yêu cầu nó không lập chỉ mục URL. Hướng dẫn về lệnh noindex của Google đã chỉ rõ hành vi này.

Do đó, các cơ chế kiểm soát thu thập dữ liệu, kiểm soát lập chỉ mục, tín hiệu chuẩn và các cơ chế kiểm soát bảo mật thực sự cần được xem xét riêng biệt chứ không phải gộp chung lại.

Vì sao khả năng thu thập dữ liệu lại quan trọng hơn trong lĩnh vực tìm kiếm bằng AI

Hành vi tìm kiếm đang mở rộng vượt ra ngoài trang kết quả truyền thống. Mọi người vẫn sử dụng Google, nhưng họ cũng tiến hành nghiên cứu thông qua AI Overviews, Google AI Mode, ChatGPT, Perplexity, Copilot, Claude và các hệ thống khác có thể sử dụng chỉ mục tìm kiếm, thu thập dữ liệu web, truy xuất hoặc kết hợp nhiều công nghệ để đưa ra câu trả lời.

Điều này không có nghĩa là SEO truyền thống trở nên lỗi thời. Trong nhiều trường hợp, nó thậm chí còn làm cho nền tảng kỹ thuật trở nên quan trọng hơn.

Hướng dẫn toàn diện hơn của chúng tôi về Tối ưu hóa tìm kiếm bằng AI sẽ khám phá cách các thương hiệu có thể cải thiện cơ hội được tìm thấy, hiểu, tin tưởng, truy xuất, trích dẫn và đề xuất trong các môi trường này. Khả năng thu thập dữ liệu nằm gần đầu quá trình đó bởi vì thông tin không thể truy cập được sẽ khó để bất kỳ hệ thống tìm kiếm nào sử dụng hiệu quả.

Tìm kiếm bằng AI của Google vẫn dựa trên các nguyên tắc cơ bản của tìm kiếm.

Google đã khẳng định rõ ràng rằng AI Overviews và AI Mode không yêu cầu một hệ thống tối ưu hóa kỹ thuật hoàn toàn riêng biệt.

Theo hướng dẫn của Google về các tính năng AI trong Tìm kiếm , các trang xuất hiện dưới dạng liên kết hỗ trợ vẫn cần đáp ứng các yêu cầu kỹ thuật Tìm kiếm thông thường của Google, được lập chỉ mục và đủ điều kiện để xuất hiện trong Kết quả tìm kiếm với đoạn trích.

Google cũng tiếp tục nhấn mạnh những nguyên tắc cơ bản quen thuộc, chẳng hạn như cho phép trình thu thập dữ liệu hoạt động robots.txt, đảm bảo cơ sở hạ tầng CDN hoặc máy chủ không chặn Googlebot, cung cấp các liên kết nội bộ có thể thu thập dữ liệu và giữ cho thông tin quan trọng luôn có sẵn ở dạng văn bản.

Google cũng khẳng định rằng chủ sở hữu trang web không cần lược đồ AI đặc biệt hoặc tệp máy đọc được dành riêng cho AI mới để đủ điều kiện sử dụng Tổng quan AI hoặc Chế độ AI.

Nói cách khác, AI không thay thế SEO kỹ thuật. Nó bổ sung thêm những trải nghiệm tìm kiếm mới trên nền tảng kỹ thuật mà vẫn cần được hoàn thiện để hoạt động hiệu quả.

Không phải mọi trình thu thập dữ liệu AI đều có cùng mục đích.

Cụm từ “ trình thu thập dữ liệu AI ” cũng có thể gây hiểu lầm vì nó ngụ ý rằng mọi hệ thống tự động truy cập vào trang web của bạn đều đang làm điều tương tự.

Họ không phải vậy.

Một trình thu thập dữ liệu có thể thu thập thông tin để phục vụ cho việc khám phá kết quả tìm kiếm. Một trình thu thập khác có thể truy xuất thông tin để đáp ứng yêu cầu của người dùng. Một trình thu thập khác có thể liên quan đến việc phát triển mô hình hoặc đào tạo. Những mục đích sử dụng đó có thể mang lại những hệ quả rất khác nhau về mặt kinh doanh, pháp lý và khả năng hiển thị.

Ví dụ, OpenAI phân biệt giữa OAI-SearchBotcác yếu tố hỗ trợ việc khám phá và hiển thị các trang web trong tìm kiếm ChatGPT và GPTBotcác yếu tố mà nhà xuất bản có thể kiểm soát riêng biệt khi đưa ra quyết định về nội dung có thể được sử dụng để cải thiện các mô hình AI tạo sinh của OpenAI. OpenAI giải thích những sự khác biệt này trong hướng dẫn dành cho nhà xuất bản và nhà phát triển của mình .

Tương tự, Perplexity mô tả PerplexityBot là trình thu thập dữ liệu của mình để hiển thị và liên kết các trang web trong kết quả tìm kiếm của Perplexity, chứ không phải là trình thu thập dữ liệu huấn luyện theo mô hình cơ bản.

Sự khác biệt đó thay đổi cách các doanh nghiệp nên suy nghĩ về việc quản lý bot.

Chúng tôi không khuyến khích bạn sao chép cấu hình “chặn mọi bot AI” từ một diễn đàn trực tuyến mà không hiểu rõ chức năng của từng trình thu thập dữ liệu. Một quy tắc nhằm ngăn chặn một loại sử dụng tự động cụ thể có thể vô tình làm giảm khả năng hiển thị của bạn trong trải nghiệm tìm kiếm AI mà khách hàng của bạn thực sự sử dụng.

Một trang web hiện đại nên có chính sách thu thập dữ liệu , chứ không phải là một tập hợp các quy tắc ngẫu nhiên.

Những yếu tố nào có thể ngăn cản công cụ tìm kiếm thu thập dữ liệu một cách chính xác một trang web?

Các vấn đề về khả năng thu thập dữ liệu có thể xảy ra ở nhiều cấp độ của một trang web, và một số vấn đề nghiêm trọng nhất lại không hiển thị trong WordPress, Shopify hoặc các nền tảng CMS khác. Khả năng truy cập tìm kiếm phụ thuộc vào toàn bộ đường dẫn từ trình thu thập dữ liệu đến nội dung.

Robots.txt, Noindex và Kiểm soát truy cập

Tệp của bạn robots.txtcung cấp hướng dẫn cho các trình thu thập thông tin hỗ trợ Giao thức loại trừ Robot (Robots Exclusion Protocol). Nó thường hữu ích để ngăn các trình thu thập thông tin lãng phí tài nguyên vào các URL mà bạn không muốn nhận yêu cầu, nhưng cần phải sử dụng cẩn thận.

Một Disallowquy tắc quá chung chung có thể ảnh hưởng đến toàn bộ một phần của trang web. Các quy tắc dành riêng cho trình thu thập thông tin cũng có thể tạo ra tình huống mà Googlebot được phép hoạt động trong khi một trình thu thập thông tin tìm kiếm khác lại bị chặn một cách vô ý.

Quan trọng hơn, các quy tắc dành cho robot phải phù hợp với mục tiêu thực tế.

Nếu bạn không muốn trình thu thập thông tin tuân thủ yêu cầu một nhóm URL có giá trị thấp, thì phương pháp robots.txtnày có thể phù hợp. Nếu bạn không muốn một trang có thể được thu thập thông tin xuất hiện trong kết quả tìm kiếm của Google, noindexthì đây thường là biện pháp kiểm soát phù hợp hơn. Nếu nội dung là riêng tư hoặc bí mật, cả hai đều không phải là cơ chế bảo mật. Cần có xác thực hoặc một hệ thống kiểm soát truy cập thực sự khác.

Nguyên tắc rất đơn giản: sử dụng phương pháp điều khiển phù hợp với kết quả bạn thực sự muốn đạt được.

Tường lửa, CDN, Bảo vệ chống bot và Khả năng sẵn sàng của máy chủ

Một robots.txttệp cấu hình hoàn hảo cũng sẽ không giúp ích gì nếu trình thu thập thông tin bị chặn trước khi truy cập trang web của bạn.

Cloudflare, tường lửa máy chủ, tường lửa ứng dụng web, hệ thống giới hạn tốc độ, plugin bảo mật, quy tắc định vị địa lý, thử thách JavaScript, CAPTCHA và hệ thống quản lý bot tự động đều có thể gây cản trở cho trình thu thập dữ liệu.

Điều này ngày càng trở nên quan trọng khi các doanh nghiệp tăng cường bảo vệ chống lại bot để đối phó với việc thu thập dữ liệu trái phép, các mối đe dọa an ninh và lưu lượng truy cập tự động không mong muốn. Một trình thu thập dữ liệu hợp pháp có thể trông giống như một yêu cầu tự động khác đối với lớp bảo mật được cấu hình mạnh mẽ.

Kết quả có thể gây khó hiểu. Hệ thống quản lý nội dung (CMS) của bạn cho biết trang này là công khai. Tệp robots.txt cho phép trình thu thập thông tin. Trình duyệt hoạt động bình thường. Tuy nhiên, trình thu thập thông tin lại nhận được lỗi 403, trang yêu cầu hoàn tác, 503hoặc thậm chí không có nội dung nào có thể sử dụng được.

Tính ổn định của máy chủ cũng rất quan trọng. Hệ thống tìm kiếm dựa vào phản hồi HTTP để hiểu điều gì đã xảy ra khi chúng yêu cầu một URL. Các trang quan trọng thường phải được tải thành công, các trang chuyển hướng phải hoạt động đúng cách, các trang bị xóa vĩnh viễn phải thông báo trạng thái đó một cách chính xác và 5xxcác lỗi dai dẳng cần được điều tra.

Đối với các trang web gặp sự cố về thu thập thông tin hoặc lập chỉ mục, nhật ký máy chủ có thể đặc biệt hữu ích vì chúng trả lời một câu hỏi mà nhiều công cụ thu thập thông tin không thể giải đáp:

Thực tế thì bot tìm kiếm đã yêu cầu gì, và máy chủ của bạn đã trả về gì?

Cấu trúc trang web và liên kết nội bộ

Trình thu thập thông tin di chuyển thông qua các liên kết, do đó cấu trúc trang web là một trong những tín hiệu mạnh mẽ nhất về khả năng thu thập thông tin mà bạn có thể kiểm soát.

Các trang quan trọng cần được kết nối một cách có ý nghĩa với phần còn lại của trang web. Thanh điều hướng, đường dẫn điều hướng, trung tâm dịch vụ, trang danh mục, liên kết ngữ cảnh, tài nguyên liên quan và bài viết hỗ trợ đều tạo ra các lộ trình khám phá, đồng thời giúp hệ thống hiểu được mối liên hệ giữa các phần khác nhau của trang web.

Một trang dịch vụ có tầm quan trọng chiến lược nhưng chỉ có thể truy cập được thông qua sáu thao tác nhấp chuột khó hiểu sẽ tạo ra một kiến ​​trúc rất khác so với kiến ​​trúc được kết nối trực tiếp với các dịch vụ, tài nguyên và nội dung hỗ trợ liên quan.

Đây là lý do tại sao liên kết nội bộ lại quan trọng hơn cả quan niệm lỗi thời về việc chỉ đơn thuần truyền “sức mạnh liên kết”. Liên kết nội bộ hỗ trợ việc tìm kiếm, thiết lập mối quan hệ, làm rõ thứ bậc, phân bổ quyền lực nội bộ và giúp ngăn chặn các trang quan trọng bị cô lập.

Các trang mồ côi cần được đặc biệt chú ý. Đây là những URL không có bất kỳ liên kết nội bộ có ý nghĩa nào trỏ đến chúng. Chúng có thể xuất hiện trong sơ đồ trang web XML hoặc được công cụ tìm kiếm biết đến từ một nguồn khác, nhưng chúng bị tách rời khỏi cấu trúc mà người dùng và trình thu thập thông tin thực sự điều hướng đến.

Khi tìm kiếm ngày càng trở nên có ý nghĩa và được hỗ trợ bởi trí tuệ nhân tạo, những mối quan hệ này càng trở nên có giá trị hơn. Hướng dẫn của chúng tôi về tìm kiếm ngữ nghĩa sẽ khám phá cách các hệ thống hiện đại ngày càng đánh giá ý nghĩa, mục đích, thực thể, ngữ cảnh và mối quan hệ thay vì chỉ dựa vào các từ khóa trùng khớp riêng lẻ.

JavaScript, Hiển thị và Tương tác người dùng

JavaScript không hẳn là có hại cho công cụ tìm kiếm. Google có thể hiển thị JavaScript, và các trang web hiện đại phụ thuộc rất nhiều vào nó.

Việc thực hiện vẫn rất quan trọng.

Nội dung quan trọng, liên kết, thẻ chuẩn, siêu dữ liệu, các yếu tố điều hướng hoặc thông tin có cấu trúc có thể trở nên khó xử lý hơn khi chúng phụ thuộc vào quá trình hiển thị phức tạp phía máy khách hoặc chỉ xuất hiện sau khi tương tác.

Tài liệu SEO JavaScript của Google giải thích cách Google thu thập thông tin, hiển thị và xử lý các trang dựa trên JavaScript. Không nên tự động cho rằng các trình thu thập thông tin tìm kiếm và AI khác có khả năng hiển thị tương tự như Googlebot.

Bài học thực tiễn không phải là “đừng bao giờ dùng JavaScript”. Mà là tránh việc che giấu những thông tin quan trọng về mặt chiến lược đằng sau sự phức tạp về mặt kỹ thuật một cách không cần thiết.

Nếu người dùng phải nhấp vào nút, cuộn đến một điểm cụ thể, mở một mục mở rộng hoặc kích hoạt một trạng thái ứng dụng nào đó trước khi thông tin quan trọng được hiển thị, hãy kiểm tra xem trình thu thập thông tin có còn truy cập được thông tin đó một cách đáng tin cậy hay không.

Điều này đặc biệt quan trọng đối với tính năng cuộn vô hạn, danh mục sản phẩm được tải chậm, các tab, điều hướng được tạo động, ứng dụng một trang và các triển khai không có giao diện người dùng.

Các URL chuẩn, URL trùng lặp, sơ đồ trang web và hiệu quả thu thập dữ liệu.

Khả năng thu thập dữ liệu tốt không phải là khuyến khích bot yêu cầu càng nhiều URL càng tốt. Thông thường, chiến lược tốt hơn là giảm số lượng URL không cần thiết đang cạnh tranh để thu hút sự chú ý.

Các tham số theo dõi, bộ lọc thương mại điện tử, thứ tự sắp xếp, đường dẫn sản phẩm trùng lặp, phân trang, giao thức thay thế, phiên bản máy in và các biến thể URL do CMS tạo ra có thể tạo ra một lượng lớn các trang có nội dung tương tự nhau.

Việc chuẩn hóa URL giúp các công cụ tìm kiếm xác định phiên bản nào của nội dung tương tự nên được coi là phiên bản chính. Các liên kết nội bộ, chuyển hướng, thẻ canonical và sơ đồ trang web XML lý tưởng nhất nên củng cố cùng một URL ưu tiên thay vì gửi các tín hiệu mâu thuẫn.

Đây cũng là điểm mà khả năng thu thập dữ liệu giao thoa trực tiếp với việc quản lý nội dung trùng lặp . Nội dung trùng lặp thường ít liên quan đến hình phạt khó hiểu mà chủ yếu là về sự rõ ràng: URL nào quan trọng, phiên bản nào nên được xử lý và liệu các biến thể không cần thiết có làm cho trang web khó thu thập dữ liệu và hiểu hơn hay không.

Sơ đồ trang web XML cung cấp một phương pháp tìm kiếm khác và đặc biệt hữu ích cho các trang web lớn, nội dung mới hoặc URL thay đổi thường xuyên. Tuy nhiên, sơ đồ trang web nên hỗ trợ kiến ​​trúc của bạn, chứ không phải bù đắp cho một kiến ​​trúc yếu kém.

Nếu cách duy nhất mà công cụ tìm kiếm có thể tìm thấy một trong những trang dịch vụ quan trọng nhất của bạn là thông qua sơ đồ trang web XML, thì đáng để đặt câu hỏi tại sao trang đó lại không được kết nối một cách có ý nghĩa với chính trang web.

Còn ngân sách cho việc thu thập dữ liệu thì sao?

Ngân sách thu thập dữ liệu là có thật, nhưng nó cũng là một trong những khái niệm bị lạm dụng nhiều nhất trong SEO kỹ thuật.

Đối với hầu hết các trang web nhỏ và vừa, ngân sách thu thập dữ liệu không nên là mối quan tâm hàng đầu. Kiến trúc trang web, lập chỉ mục, liên kết nội bộ, chất lượng sơ đồ trang web, hiển thị, trùng lặp và quyền truy cập của trình thu thập dữ liệu thường là những lĩnh vực thiết thực nhất cần xem xét trước tiên.

Hướng dẫn hiện tại của Google về quản lý ngân sách thu thập dữ liệu coi việc quản lý ngân sách thu thập dữ liệu là một vấn đề nâng cao, chủ yếu dành cho các trang web lớn hoặc thay đổi nhanh chóng, cũng như các trang web có các mô hình thu thập và tìm kiếm cụ thể.

Đối với các trang web thương mại điện tử, nhà xuất bản, sàn giao dịch, các nền tảng SaaS lớn và các trang web lập trình tự động với hàng nghìn hoặc hàng triệu URL tiềm năng, cuộc thảo luận này trở nên quan trọng hơn nhiều.

Việc có quá nhiều mục trùng lặp, điều hướng phân cấp, vô số tham số, URL tìm kiếm nội bộ, trang bị lỗi, phản hồi chậm, chuỗi chuyển hướng và các trang được tạo ra với giá trị thấp có thể tiêu tốn tài nguyên thu thập dữ liệu mà không đóng góp nhiều giá trị tìm kiếm.

Mục tiêu không phải là ép Google thu thập dữ liệu nhiều hơn .

Mục đích là tạo ra một danh sách URL sạch hơn và giúp các công cụ thu thập thông tin tập trung vào những phần quan trọng của trang web.

Hướng dẫn chi tiết hơn của chúng tôi về tối ưu hóa ngân sách thu thập dữ liệu sẽ đi sâu hơn vào nhu cầu thu thập dữ liệu, dung lượng thu thập dữ liệu, kiến ​​trúc trang web lớn và các cách để giảm hoạt động thu thập dữ liệu không cần thiết.

Các doanh nghiệp nên xử lý việc truy cập của trình thu thập dữ liệu AI như thế nào?

Việc quản lý trình thu thập dữ liệu AI nên bắt đầu từ mục tiêu kinh doanh.

Bạn có muốn nội dung của mình hiển thị trong kết quả tìm kiếm ChatGPT không? Bạn có muốn Perplexity hiển thị các trang của bạn không? Tổ chức của bạn có chính sách riêng về đào tạo mô hình không? Có những phần nào của trang web cần hiển thị trong kết quả tìm kiếm công khai nhưng không được phép truy cập bởi một số hệ thống tự động nhất định?

Đó là những câu hỏi khác nhau.

Điều đó có nghĩa là câu trả lời không nên tự động là “cho phép mọi thứ” hoặc “chặn mọi thứ”.

Ví dụ, một công ty có thể quyết định rằng việc khám phá thông tin tìm kiếm là có giá trị trong khi lại có quan điểm khác về quyền truy cập huấn luyện mô hình. Các nền tảng cung cấp các điều khiển trình thu thập dữ liệu riêng biệt cho phép phản ánh những khác biệt đó trong cấu hình kỹ thuật của bạn.

Điều quan trọng hơn cả là những lựa chọn này cần phải được cân nhắc kỹ lưỡng.

Bộ phận marketing cần hiểu rõ những hậu quả tiềm tàng về mặt khả năng hiển thị. Các nhà phát triển cần hiểu cách thức thực thi các quy tắc. Các nhóm bảo mật cần biết liệu cơ sở hạ tầng có mâu thuẫn với chính sách dự định hay không. Bộ phận pháp lý hoặc lãnh đạo cũng có thể cần tham gia khi các vấn đề liên quan đến sở hữu trí tuệ hoặc sử dụng dữ liệu trở nên quan trọng.

Sau khi triển khai, bạn cần kiểm tra lại hoạt động thực tế. Đừng cho rằng chỉ vì tệp robots.txt trông có vẻ chính xác mà trình thu thập thông tin đã truy cập thành công trang. Nhật ký máy chủ, nhật ký CDN, kiểm tra trình thu thập thông tin và kiểm tra phản hồi có thể xác nhận liệu chính sách có hoạt động như mong muốn hay không.

Bạn có cần tệp llms.txt không?

Ngày càng có nhiều sự quan tâm đến các tập tin có thể đọc được bằng máy, được thiết kế đặc biệt cho các hệ thống trí tuệ nhân tạo, bao gồm cả llms.txt

Điều đó không có nghĩa là các tập tin này đã thay thế cơ sở hạ tầng web mà các hệ thống tìm kiếm hiện đang sử dụng.

Đối với Tổng quan về AI và Chế độ AI của Google, hướng dẫn hiện tại của Google nêu rõ rằng chủ sở hữu trang web không cần các tệp AI có thể đọc được bằng máy mới, các tệp văn bản AI đặc biệt hoặc lược đồ đặc biệt để hiển thị trong các trải nghiệm này.

Điều đó có thể thay đổi khi các tiêu chuẩn và nền tảng phát triển, nhưng nó nên định hình các ưu tiên hiện tại.

Nếu trang web của bạn có các liên kết nội bộ bị lỗi, trình thu thập thông tin bị chặn, sự cố hiển thị JavaScript, tín hiệu canonical xung đột, máy chủ không đáng tin cậy hoặc kiến ​​trúc kém, việc thêm một tệp văn bản khác sẽ không khắc phục được vấn đề về khả năng truy cập cơ bản.

Trước tiên hãy xây dựng nền tảng vững chắc.

Cách kiểm tra khả năng thu thập dữ liệu

Một bài kiểm tra khả năng thu thập dữ liệu hữu ích nên xem xét trang web từ nhiều khía cạnh khác nhau thay vì chỉ dựa vào kết quả xuất từ ​​một công cụ duy nhất. Hãy bắt đầu với những trang thực sự quan trọng đối với doanh nghiệp: dịch vụ, sản phẩm, danh mục, địa điểm, tài nguyên, nội dung có giá trị cao và các trang chuyển đổi. Không phải mọi URL đều cần được chú trọng như nhau.

Từ đó, hãy thu thập dữ liệu trang web bằng một công cụ như Screaming Frog, Sitebulb hoặc một nền tảng thu thập dữ liệu cấp doanh nghiệp, và so sánh kết quả với những gì hiển thị trong Google Search Console. Hãy xem xét các mã trạng thái, đường dẫn chuyển hướng, liên kết nội bộ, thẻ canonical, chỉ thị, độ sâu thu thập dữ liệu, URL trùng lặp, báo cáo lập chỉ mục trang, kiểm tra URL, xử lý sơ đồ trang web XML và số liệu thống kê thu thập dữ liệu.

Lớp tiếp theo là quyền truy cập. Xem xét đồng thời robots.txtcác thẻ meta robots, X-Robots-Tagtiêu đề, canonical, cài đặt CDN, quy tắc tường lửa, hệ thống bảo vệ bot, xác thực và các chỉ thị dành riêng cho trình thu thập thông tin. Việc xem xét các yếu tố này một cách riêng lẻ có thể khiến các nhóm bỏ sót các xung đột giữa các lớp khác nhau của trang web.

Việc hiển thị cũng cần được kiểm tra trên các mẫu quan trọng, đặc biệt là những mẫu có sử dụng JavaScript. So sánh mã HTML gốc, mã HTML đã được hiển thị, nội dung hiển thị, siêu dữ liệu, liên kết nội bộ, dữ liệu có cấu trúc và tín hiệu chuẩn. Nếu một nội dung quan trọng đối với hoạt động kinh doanh chỉ tồn tại sau khi trình duyệt thực hiện một số thao tác, hãy xác nhận cách các hệ thống tìm kiếm thực sự nhận được nó.

Khi vấn đề vẫn chưa rõ ràng, nhật ký máy chủ và CDN có thể cung cấp thêm bằng chứng. Chúng có thể tiết lộ trình thu thập thông tin nào đang truy cập, URL nào chúng yêu cầu, mã trạng thái chúng nhận được, tần suất chúng quay lại và liệu các sự cố truy cập có xảy ra không thường xuyên hay không.

Cuối cùng, hãy tiếp tục theo dõi sau khi có những thay đổi quan trọng. Việc thiết kế lại, di chuyển hệ thống, cập nhật plugin, thay đổi tường lửa, thay đổi cấu hình CDN, phát hành JavaScript, sửa đổi mẫu và điều chỉnh bảo mật đều có thể tạo ra các vấn đề về khả năng thu thập thông tin mà không xuất hiện trong quá trình kiểm tra ban đầu.

Mục tiêu không phải là tạo ra bảng tính cảnh báo kỹ thuật lớn nhất có thể. Mục tiêu là xác định những vấn đề nào đang cản trở việc phát hiện và xử lý thông tin quan trọng một cách chính xác.

Triết lý đó là cốt lõi trong cách chúng tôi tiếp cận dịch vụ tư vấn SEO kỹ thuật tại Cadence Search. Công việc kỹ thuật nên được ưu tiên dựa trên tác động, quy mô, rủi ro, nỗ lực triển khai và tầm quan trọng đối với doanh nghiệp, chứ không phải dựa trên số lượng cảnh báo mà công cụ thu thập dữ liệu có thể tạo ra.

Khả năng di chuyển trên địa hình gồ ghề tốt trông như thế nào?

Một trang web có thể thu thập thông tin thường có tính dễ đoán.

Các trang quan trọng có thể truy cập được thông qua các liên kết chuẩn. Các liên kết này sử dụng các đích đến thực sự mà công cụ tìm kiếm có thể thu thập thông tin. URL trả về mã trạng thái như mong muốn. Hệ thống tìm kiếm không bị chặn nhầm lẫn. Các URL chuẩn, chuyển hướng, liên kết nội bộ và các mục trong sơ đồ trang web nhìn chung đều nhất quán. Nội dung quan trọng vẫn có thể truy cập được sau khi hiển thị. Các URL trùng lặp được kiểm soát. Máy chủ phản hồi đáng tin cậy. Các trang được thiết kế để dễ tìm kiếm được kết nối hợp lý với các chủ đề, dịch vụ, sản phẩm, địa điểm và thông tin hỗ trợ có liên quan.

Một trang web trưởng thành cũng cần phải giải thích được chính sách thu thập dữ liệu của mình.

Những trình thu thập thông tin tìm kiếm nào được cho phép một cách cố ý? Những trình nào bị chặn? Tại sao? Việc phát hiện và huấn luyện tìm kiếm có được coi là hai quyết định riêng biệt khi nền tảng cung cấp sự phân biệt đó không? Tường lửa có thực thi cùng một chính sách với tệp robots.txt không? Đã có ai thực sự kiểm tra cấu hình này chưa?

Nếu không ai biết câu trả lời cho những câu hỏi đó, thì trang web thực sự không có chiến lược thu thập dữ liệu. Nó chỉ có các thiết lập tích lũy dần.

Đây là điểm mà khả năng thu thập dữ liệu bắt đầu phát triển thành ý tưởng rộng hơn về khả năng truy cập tìm kiếm .

Các hệ thống tìm kiếm hiện đại cần phải khám phá thông tin, tiếp cận thông tin đó, hiển thị thông tin khi cần thiết, hiểu ngữ cảnh của thông tin, kết nối thông tin đó với các thông tin liên quan và truy xuất thông tin khi người dùng đặt đúng câu hỏi.

Nội dung của bạn sẽ không thể cạnh tranh hiệu quả nếu gặp khó khăn ngay từ những bước đầu tiên.

Câu hỏi thường gặp về khả năng thu thập dữ liệu

Khả năng thu thập thông tin có phải là một yếu tố xếp hạng không?

Sẽ hữu ích hơn nếu coi khả năng thu thập thông tin của công cụ tìm kiếm như một điều kiện tiên quyết cho nhiều cơ hội tìm kiếm hơn là một yếu tố xếp hạng đơn thuần. Các công cụ tìm kiếm cần đủ quyền truy cập để xử lý thông tin của bạn, nhưng chỉ việc làm cho một trang có thể được thu thập thông tin không đảm bảo trang đó sẽ được xếp hạng cao.

Một trang web có thể được công cụ tìm kiếm thu thập thông tin nhưng không được lập chỉ mục không?

Đúng vậy. Một trang có thể được công cụ tìm kiếm thu thập thông tin thành công nhưng lại bị loại khỏi chỉ mục vì một lý do nào đó như noindexchỉ thị, chuẩn hóa từ khóa, trùng lặp, vấn đề về tính đủ điều kiện, cân nhắc về chất lượng nội dung hoặc quyết định của công cụ tìm kiếm.

Một trang web bị chặn bởi robots.txt liệu vẫn có thể xuất hiện trên Google không?

Về mặt lý thuyết là có. Google có thể phát hiện ra một URL bị chặn thông qua các liên kết ngay cả khi Googlebot không được phép thu thập nội dung của trang. Đây là một lý do tại sao robots.txtkhông nên coi đây là một phương pháp đáng tin cậy để loại bỏ URL khỏi kết quả tìm kiếm.

Khả năng thu thập dữ liệu có ảnh hưởng đến khả năng hiển thị tìm kiếm của AI không?

Điều đó hoàn toàn có thể. Một số sản phẩm tìm kiếm bằng AI vận hành các trình thu thập dữ liệu tìm kiếm chuyên dụng, sử dụng các chỉ mục tìm kiếm hiện có, truy xuất thông tin trực tiếp từ web hoặc kết hợp nhiều phương pháp. Do đó, việc chặn trình thu thập dữ liệu liên quan đến việc khám phá tìm kiếm có thể làm giảm cơ hội nội dung của bạn được truy xuất hoặc hiển thị.

OpenAI cung cấp các tùy chọn điều khiển trình thu thập dữ liệu riêng biệt. OAI-SearchBotMột tùy chọn liên quan đến việc khám phá và hiển thị kết quả tìm kiếm ChatGPT, trong khi GPTBottùy chọn kia liên quan đến nội dung có thể được sử dụng để cải thiện các mô hình AI tạo sinh của OpenAI. Do đó, các doanh nghiệp có thể đưa ra các quyết định riêng biệt về khả năng hiển thị trên công cụ tìm kiếm và khả năng truy cập vào dữ liệu đào tạo.

Google có yêu cầu một lược đồ AI đặc biệt nào không?

Không. Hiện tại Google cho biết không có lược đồ đặc biệt, tệp văn bản AI hoặc mã đánh dấu máy đọc riêng biệt nào được yêu cầu để xuất hiện trong Tổng quan AI hoặc Chế độ AI. Các tiêu chí đủ điều kiện tìm kiếm hiện tại và các nguyên tắc kỹ thuật cơ bản vẫn được áp dụng.

Liệu Cloudflare hay tường lửa khác có thể ảnh hưởng đến khả năng thu thập dữ liệu của trình biên dịch không?

Đúng vậy. CDN, tường lửa, bảo mật, quản lý bot, xác thực, giới hạn tốc độ, CAPTCHA và các quy tắc định vị địa lý có thể ảnh hưởng đến quyền truy cập của trình thu thập thông tin một cách độc lập robots.txt. Một cuộc kiểm tra khả năng thu thập thông tin đúng cách nên xem xét cả cơ sở hạ tầng và cài đặt CMS.

Khả năng thu thập dữ liệu giờ đây là một phần của chiến lược cải thiện khả năng truy cập tìm kiếm lớn hơn.

Khả năng thu thập dữ liệu của công cụ tìm kiếm không phải là phần hấp dẫn nhất trong tiếp thị tìm kiếm. Đó chính là lý do tại sao nó dễ bị bỏ qua.

Các doanh nghiệp đương nhiên muốn thảo luận về thứ hạng tìm kiếm, trích dẫn AI, chiến lược nội dung, uy tín và tỷ lệ chuyển đổi. Nhưng tất cả những cuộc thảo luận đó trở nên khó khăn hơn khi trang web cơ bản không thể được tìm thấy và xử lý một cách đáng tin cậy.

Khả năng thu thập dữ liệu hiện đại đòi hỏi phải nhìn xa hơn chỉ mỗi Googlebot. Bạn cần xem xét kiến ​​trúc, liên kết nội bộ, hiển thị, thẻ canonical, sơ đồ trang web XML, hành vi máy chủ, quyền truy cập của trình thu thập dữ liệu, kiểm soát lập chỉ mục, hệ thống tìm kiếm AI và sự khác biệt ngày càng rõ rệt giữa khả năng hiển thị trên công cụ tìm kiếm và các hình thức truy cập tự động khác.

Điều đó không có nghĩa là bạn mở trang web của mình một cách bừa bãi cho mọi máy tính trên internet.

Điều đó có nghĩa là hiểu rõ những hệ thống nào quan trọng đối với chiến lược tìm kiếm của bạn và đưa ra những quyết định có chủ đích về cách chúng tương tác với nội dung của bạn.