Sử dụng robot.txt, làm cách nào bạn không cho phép root trang web (http://www.example.com/) nhưng cho phép thư mục con (http://www.example.com/lessons/)?
Sử dụng robot.txt, làm cách nào bạn không cho phép root trang web (http://www.example.com/) nhưng cho phép thư mục con (http://www.example.com/lessons/)?
Câu trả lời:
User-agent: *
Disallow: /
Allow: /lessons/
Allow: /other-dir/
Điều này không cho phép toàn bộ trang web, nhưng rõ ràng cho phép các thư mục nhất định.
Bạn phải liệt kê các dòng Cho phép trước vì tệp được đọc trên cơ sở khớp đầu tiên.
Để đánh giá xem có cho phép truy cập vào URL hay không, robot phải cố gắng khớp các đường dẫn trong Cho phép và Không cho phép các dòng so với URL, theo thứ tự chúng xảy ra trong bản ghi. Trận đấu đầu tiên được tìm thấy được sử dụng. Nếu không tìm thấy kết quả khớp, giả định mặc định là URL được cho phép.
Tham khảo: http://www.robotstxt.org/norobots-rfc.txt
Google cung cấp một công cụ trong các công cụ quản trị trang web để kiểm tra tệp của bạn. Tôi luôn khuyên bạn nên kiểm tra tập tin của bạn. Xem "Kiểm tra tệp robot.txt của trang web:" gần cuối.
http://support.google.com/webmasters/ thông tin về các địa điểm