Tệp Robots.txt được sử dụng để thông báo cho các robot web về cách chúng ta muốn chúng thu thập thông tin trên trang web của mình. Được đặt ở thư mục gốc của trang web, tệp này hướng dẫn các robot này truy cập vào những trang nào chúng nên hoặc không nên truy cập.
Việc sử dụng tệp robots.txt giúp các quản trị viên web ngăn chặn các công cụ tìm kiếm truy cập vào nội dung nhạy cảm hoặc không liên quan, từ đó đảm bảo chỉ những trang mong muốn mới được lập chỉ mục.
Điều này không chỉ giúp kiểm soát việc sử dụng băng thông của trang web bằng cách giảm lưu lượng truy cập trình thu thập thông tin không cần thiết, mà còn giúp giữ cho kết quả tìm kiếm sạch sẽ và phù hợp với người dùng, điều này có thể tác động tích cực đến SEO của bạn.
Ví dụ về Robots.txt
Dưới đây là một ví dụ cơ bản về cấu trúc của một tệp robots.txt:
User-agent: *
Disallow: /private/
Tệp Robots.txt hoạt động như thế nào?
Khi trình thu thập dữ liệu của công cụ tìm kiếm gặp một trang web, điểm dừng chân đầu tiên của chúng là tệp robots.txt. Điều này giống như việc kiểm tra luật chơi trước khi tham gia một trò chơi.
Robot sẽ đọc tệp robots.txt để hiểu những phần nào của trang web mà nó được phép truy cập và những phần nào nó nên tránh. Nếu tệp robots.txt quy định rằng một số khu vực nhất định của trang web bị cấm, robot sẽ bỏ qua những phần đó và chuyển sang phần còn lại của trang web được phép khám phá.
Cần lưu ý rằng robots.txt không phải lúc nào cũng hoàn hảo, và các robot không phải lúc nào cũng tuân theo các chỉ dẫn này.
Cách tìm tệp Robots.txt
Tệp robots.txt nên được đặt trong thư mục gốc của tên miền trang web của bạn.
Cụ thể, nếu trang web của bạn là www.example.com, thì tệp robots.txt phải có thể truy cập được tại địa chỉ www.example.com/robots.txt (ví dụ: www.seerinteractive.com/robots.txt !). Định dạng /robots.txt chính xác này là yêu cầu bắt buộc để đảm bảo các trình thu thập thông tin không bỏ sót tệp này.
Bằng cách đặt nó ở vị trí này, mọi công cụ tìm kiếm trên web khi truy cập đều biết chính xác vị trí của nó trước khi khám phá thêm.
Cách đọc tệp Robots.txt: Cú pháp và ví dụ

Vậy, làm thế nào để đọc và hiểu các tệp robots.txt? Bằng cách sử dụng bốn trường chính được mô tả trong tài liệu của Google : user-agent, allow, disallow và sitemap.
Chúng ta cũng sẽ xem xét Độ trễ thu thập dữ liệu và ký tự đại diện, những thứ có thể cung cấp thêm quyền kiểm soát đối với cách trang web của bạn được thu thập thông tin.
- Tác nhân người dùng
- Ký tự đại diện: * và $
- Cho phép và không cho phép
- Trì hoãn bò
- Sơ đồ trang web

- Cấm: Đường dẫn URL không thể được thu thập thông tin
- Cho phép: Đường dẫn URL có thể được thu thập thông tin
- User-agent: chỉ định trình thu thập thông tin mà quy tắc áp dụng.
- Sơ đồ trang web: Cung cấp vị trí đầy đủ của sơ đồ trang web.

Tác nhân người dùng
Nó là gì:
‘user-agent’ trong tệp robots.txt là tên dùng để xác định các trình thu thập thông tin có mục đích và/hoặc nguồn gốc cụ thể. Bạn nên định nghĩa user-agent khi cấp quyền truy cập khác nhau cho các trình thu thập thông tin cụ thể trên trang web của mình.
Ví dụ:
- User-agent: Googlebot-Image
Ý nghĩa của nó là:
Đây là user-agent từ Google dành cho công cụ tìm kiếm hình ảnh của họ.
Các chỉ thị sau đây chỉ áp dụng cho tác nhân người dùng ‘Googlebot-Image’.
Wildcards

Tệp robots.txt sử dụng hai ký tự đại diện: * và $.
* (Trình tự khớp)
Nó là gì?
Ký tự đại diện * sẽ khớp với bất kỳ chuỗi ký tự nào giống nhau.
Ví dụ:
- Tác nhân người dùng: *
Ý nghĩa của nó là gì
Điều này áp dụng cho tất cả các trình duyệt đối với các chỉ thị theo sau dòng hướng dẫn này.
$ (Kết thúc URL khớp)
Nó là gì?
Ký tự đại diện $ khớp với bất kỳ đường dẫn URL nào kết thúc bằng ký tự được chỉ định.
Ví dụ:
- Cấm: /no-crawl.php$
Ý nghĩa của nó là gì
Trình thu thập thông tin sẽ không truy cập được /no-crawl.php nhưng có thể truy cập được /no-crawl.php?crawl
Cho phép và không cho phép

Cho phép
Nó là gì?
Mục ‘Allow:’ trong Robots.txt hướng dẫn trình thu thập thông tin truy cập trang web, phần hoặc trang cụ thể. Nếu không có đường dẫn nào được chỉ định, mục ‘Allow’ sẽ bị bỏ qua.
Ví dụ:
- Cho phép: /crawl-this/
Ý nghĩa của nó là gì
Bạn có thể truy cập các URL có đường dẫn example.com/crawl-this/ trừ khi có yêu cầu bổ sung khác.
Cấm
Nó là gì?
Tệp Robots.txt có dòng ‘Disallow:’ chỉ thị cho trình thu thập thông tin không thu thập thông tin từ trang web, phần hoặc trang cụ thể được chỉ định.
Ví dụ:
- Cấm: /?s=
Ý nghĩa của nó là gì
Không nên truy cập các URL có chứa đường dẫn example.com/?s= trừ khi có thêm các thông số kỹ thuật được chỉ định.
💡 Lưu ý: nếu có các chỉ thị mâu thuẫn, trình thu thập dữ liệu sẽ tuân theo yêu cầu cụ thể hơn.
Trì hoãn bò

Nó là gì?
Chỉ thị trì hoãn thu thập dữ liệu trong robots.txt quy định số giây mà các công cụ tìm kiếm nên trì hoãn trước khi thu thập hoặc thu thập lại dữ liệu trang web. Google không phản hồi các yêu cầu trì hoãn thu thập dữ liệu, nhưng các công cụ tìm kiếm khác thì có.
Ví dụ:
- Độ trễ khi di chuyển chậm: 10
Ý nghĩa của nó là gì
Trình thu thập dữ liệu cần đợi 10 giây trước khi truy cập lại trang web.
Sơ đồ trang web

Nó là gì?
Trường sitemap trong robots.txt cung cấp cho trình thu thập thông tin vị trí của sơ đồ trang web. Địa chỉ được cung cấp dưới dạng URL tuyệt đối. Nếu có nhiều hơn một sơ đồ trang web, có thể sử dụng nhiều trường Sitemap:.
Ví dụ:
- Sơ đồ trang web: https://www.example.com/sitemap.xml
Ý nghĩa của nó là gì
Sơ đồ trang web của https://www.example.com có thể được tìm thấy tại đường dẫn /sitemap.xml
Hãy để lại nhận xét hoặc chú thích trong tệp robot.txt của bạn bằng cách sử dụng dấu thăng (#) để truyền đạt ý định đằng sau các yêu cầu cụ thể. Điều này sẽ giúp bạn và đồng nghiệp dễ dàng đọc, hiểu và cập nhật tệp hơn.
Ví dụ:
- # Đây là một bình luận giải thích rằng tệp này cho phép tất cả các tác nhân người dùng truy cập.
- Tác nhân người dùng: *
- Cho phép: /
Robots.txt Cho phép tất cả Ví dụ
Một tệp robots.txt đơn giản cho phép tất cả các tác nhân người dùng truy cập đầy đủ bao gồm:
- Chỉ thị user-agents với ký tự đại diện ‘match any’
- Tác nhân người dùng: *
- Hoặc là một lệnh Disallow trống hoặc một lệnh Allow có dấu gạch chéo.
- Không cho phép: Hoặc Cho phép:/

💡 Lưu ý: Nên thêm sơ đồ trang web vào tệp robots.txt nhưng không bắt buộc.
Testing Robots.txt
Luôn kiểm tra tệp robots.txt của bạn trước và sau khi triển khai! Bạn có thể xác thực tệp robots.txt của mình trong Google Search Console.

Nếu bạn nghĩ mình cần trợ giúp trong việc tạo hoặc cấu hình tệp robots.txt để giúp công cụ tìm kiếm thu thập dữ liệu trang web của bạn hiệu quả hơn, Seer rất sẵn lòng hỗ trợ .
Những suy nghĩ cuối cùng về các tệp .txt của Robot
Tệp robots.txt, nằm ở thư mục gốc của tên miền, cho phép chủ sở hữu trang web đưa ra hướng dẫn cho trình thu thập thông tin về cách trang web của họ nên được thu thập.
- Khi được sử dụng đúng cách, tập tin này có thể giúp trang web của bạn được các công cụ tìm kiếm thu thập thông tin hiệu quả hơn và cung cấp thêm thông tin về trang web của bạn cho các công cụ tìm kiếm.
- Nếu sử dụng không đúng cách, tệp robots.txt có thể là nguyên nhân khiến nội dung của bạn không hiển thị trong kết quả tìm kiếm.
Câu hỏi trắc nghiệm nhanh!
Bạn có thể viết một file robots bao gồm những nội dung sau không?
a) Liên kết đến sơ đồ trang web
b) Không cho phép trình thu thập dữ liệu của trang web website.com/no-crawl hoạt động.
c) Cho phép trình thu thập thông tin của trang web website.com/no-crawl-robots-guide
d) Sự chậm trễ về thời gian
e) Các chú thích giải thích chức năng của từng dòng

💡 Hãy chia sẻ câu trả lời của bạn với chúng tôi trên Twitter ( @seerinteractive ) !
Tài liệu bổ sung
- Google diễn giải thông số kỹ thuật robots.txt như thế nào?
- Hãy kiểm tra tệp robots.txt của bạn bằng công cụ robots.txt Tester.
- Bò hay không bò, đó là câu hỏi của BingBot.

