Cách HAYWEB chọn cho phép hay chặn robot AI trong tệp robots.txt

Gần đây nhiều chủ website hỏi tôi một câu giống nhau: có nên chặn robot AI không, chặn thì Google có phạt không. Cái bẫy nằm ngay ở chữ "robot AI" — người ta nói như thể chỉ có một loại, rồi chép về một khối chặn tìm được trên mạng, dán vào tệp chặn robot và yên tâm. Thực ra có 3 nhóm robot làm 3 việc khác nhau, và khối chặn chép sẵn ấy thường chặn luôn nhóm đang đưa website của bạn vào câu trả lời của ChatGPT. Bài này là phần thực chiến của bài nền sơ đồ web và tệp chặn robot.
Robot AI có mấy loại và khác nhau chỗ nào?
Trả lời ngắn: Ba nhóm. Nhóm 1 lấy nội dung để huấn luyện mô hình. Nhóm 2 đưa website vào kết quả bên trong công cụ AI, giống vai trò của robot tìm kiếm truyền thống. Nhóm 3 đi theo cú bấm của người dùng, tức là có người đang hỏi về bạn và công cụ mở trang của bạn ra để đọc. Ba nhóm này nên được quyết định riêng, vì chặn nhầm nhóm nào là mất đúng thứ nhóm đó mang lại.
Nhóm 1 — lấy nội dung để huấn luyện
Đây là nhóm bị nhắc tới nhiều nhất. Theo tài liệu của OpenAI, GPTBot được dùng để thu thập nội dung có thể dùng cho việc huấn luyện, xem tài liệu về các robot của OpenAI. Bên Anthropic, ClaudeBot thu thập nội dung web có thể góp vào việc huấn luyện, xem hướng dẫn của Anthropic dành cho chủ website. Còn Google-Extended là thứ Google mô tả là để nhà xuất bản quản việc nội dung Google thu thập có được dùng huấn luyện các thế hệ Gemini và làm nền dẫn chứng hay không, xem danh sách robot phổ biến của Google.
Nhóm 2 — đưa website vào kết quả bên trong công cụ AI
Đây là nhóm quan trọng nhất với người làm kinh doanh, và cũng là nhóm hay bị chặn nhầm nhất. OpenAI mô tả OAI-SearchBot là robot dùng để đưa website xuất hiện trong phần tìm kiếm của ChatGPT. Anthropic mô tả Claude-SearchBot là robot đi khắp web để cải thiện chất lượng kết quả tìm cho người dùng. Nói cách khác, nhóm này chính là "Googlebot của thế giới AI" — chặn nó thì website của bạn biến mất khỏi phần trả lời có dẫn nguồn, giống hệt việc chặn Googlebot thì biến mất khỏi Google.
Nhóm 3 — đi theo cú bấm của người dùng
ChatGPT-User và Claude-User thuộc nhóm này. OpenAI mô tả ChatGPT-User được dùng cho một số thao tác của người dùng trong ChatGPT: khi ai đó hỏi và công cụ cần mở một trang web ra xem. Một điểm cần nhớ: tài liệu của OpenAI ghi rõ với các thao tác do người dùng khởi xướng thì quy tắc trong tệp chặn robot có thể không áp dụng. Nghĩa là dù bạn có chặn, trang vẫn có thể được mở khi có người thật đang hỏi về bạn.

Chặn robot AI có làm tụt thứ hạng Google không?
Trả lời ngắn: Không. Đây là chỗ đáng để trích nguyên văn, vì nó gỡ đúng nỗi lo phổ biến nhất. Tài liệu robot phổ biến của Google viết rằng Google-Extended không ảnh hưởng tới việc một website có mặt trong Google Tìm kiếm, và cũng không được dùng làm tín hiệu xếp hạng trong Google Tìm kiếm. Nghĩa là bạn có thể từ chối cho lấy nội dung huấn luyện mà vẫn giữ nguyên chỗ đứng trên Google.
Điều này quan trọng vì nó tách hai câu chuyện vốn hay bị gộp: chuyện huấn luyện và chuyện xuất hiện. Bạn có quyền không muốn nội dung của mình thành nguyên liệu huấn luyện, mà vẫn muốn được máy tìm kiếm và công cụ AI dẫn về. Hai việc này khai bằng hai dòng khác nhau trong cùng một tệp. Cách nội dung được các công cụ AI trích dẫn nằm ở bài viết nội dung cho AI trích dẫn, còn bức tranh chung về tối ưu cho công cụ AI ở bài tối ưu AI search.
Vậy website của bạn nên mở hay chặn nhóm nào?
Trả lời ngắn: Tuỳ loại website, nhưng có một quy tắc chung: nhóm 2 gần như luôn nên để mở, nhóm 1 tuỳ bạn có coi nội dung là tài sản bán tiền hay không, nhóm 3 nên mở vì đó là lúc có người thật đang hỏi về bạn. Bảng dưới đây là cách HAYWEB tư vấn cho 4 loại website hay gặp.
Website dịch vụ, cửa hàng, phòng khám
Mục tiêu là có khách gọi tới, nên nhóm 2 và nhóm 3 để mở. Nhóm 1 tuỳ ý — chặn cũng không ảnh hưởng thứ hạng như đã dẫn ở trên, để mở cũng không hại gì rõ ràng. Với phần lớn khách của HAYWEB, chúng tôi để mở cả ba và dồn công sức vào việc viết nội dung đủ rõ để được trích dẫn.
Website bán nội dung độc quyền
Khoá học, tài liệu chuyên môn, số liệu tự thu thập — đây là ca nên chặn nhóm 1, vì nội dung chính là thứ bạn bán. Nhưng vẫn mở nhóm 2 và nhóm 3, bởi bạn cần khách tìm thấy trang bán hàng rồi mới mua được. Chặn hết là tự làm mình vô hình.
Trang xuất bản nhiều bài, báo điện tử
Nội dung là tài sản chính nên nhóm 1 thường bị chặn hoặc chuyển thành thoả thuận riêng với từng hãng. Nhóm 2 thì cân nhắc: mở thì được dẫn nguồn nhưng có thể mất lượt đọc, chặn thì giữ lượt đọc nhưng biến mất khỏi câu trả lời. Đây là quyết định kinh doanh, không có đáp án chung.
Khu nội bộ và trang có dữ liệu khách
Trang đăng nhập, hồ sơ, đơn hàng thì chặn cả ba nhóm, và quan trọng hơn là chặn ở tầng mạng chứ không chỉ khai trong tệp — lý do nằm ở mục ngay dưới đây.

Sự thật ít người nói: tệp chặn robot không chặn được thật
Trả lời ngắn: Tệp chặn robot chỉ nêu mong muốn của bạn, nó không ngăn được robot ở tầng kỹ thuật. Đây là câu của chính Cloudflare trong tài liệu về tệp chặn robot có sẵn cho robot AI: việc tuân thủ tệp này là tự nguyện, tệp thể hiện mong muốn nhưng không ngăn robot truy cập nội dung ở mức kỹ thuật, xem tài liệu tệp chặn robot có sẵn của Cloudflare.
Nói vậy không có nghĩa là tệp vô dụng. Các hãng lớn có công bố robot của mình đều tuân thủ — vì họ có danh tiếng để giữ. Nhưng nếu bạn cần chặn thật, ví dụ khu vực có dữ liệu khách, thì phải chặn ở tầng mạng. Và đừng chặn theo địa chỉ máy chủ: Anthropic nói rõ trong tài liệu của họ rằng chặn theo địa chỉ mà robot của họ dùng có thể không chạy đúng, nên dùng tệp chặn robot thay vì làm vậy.
Viết tệp chặn robot cho robot AI thế nào?
Trả lời ngắn: Năm bước. Liệt kê 3 nhóm và quyết định cho từng nhóm, viết mỗi khối theo đúng tên robot kèm một dòng lý do, giữ robot tìm kiếm truyền thống luôn mở, kiểm bằng lệnh gọi thật có khai đúng tên robot, và rà lại sau mỗi lần đổi website.
Bước 1 — quyết định cho từng nhóm, không quyết một lần cho cả chữ "AI". Lấy bảng ở mục trên, tìm dòng ứng với loại website của bạn, chốt ba ô. Việc này mất 5 phút và quyết định phần còn lại.
Bước 2 — viết mỗi khối theo đúng tên robot, kèm một dòng lý do. Cú pháp rất đơn giản: một dòng khai tên robot, một dòng cho phép hoặc chặn. Tài liệu Anthropic đưa đúng mẫu này cho ClaudeBot. Dòng lý do viết dưới dạng ghi chú trong tệp là để người sau không xoá nhầm — đây là thói quen HAYWEB áp cho mọi website khách.
Bước 3 — giữ robot tìm kiếm truyền thống luôn mở. Googlebot và các robot tìm kiếm khác không nằm trong câu chuyện AI. Chặn nhầm chúng là mất luôn nguồn khách chính, và đây là lỗi hay xảy ra khi người ta chép khối chặn dài từ blog nước ngoài.
Bước 4 — kiểm bằng lệnh gọi thật. Sau khi sửa, gọi thử trang bằng đúng tên từng robot và xem máy chủ trả về gì. Đừng tin bảng cấu hình của nhà cung cấp: nhiều nền tảng tự sinh tệp riêng và ghi đè tệp của bạn.
Bước 5 — rà lại sau mỗi lần đổi website. Tệp của môi trường thử thường chặn sạch mọi robot; lên bản thật mà quên tháo là biến mất khỏi kết quả tìm kiếm. Đây là một trong những lỗi đã bàn ở bài thiết kế lại website mà không mất thứ hạng, và cũng nằm trong danh sách rà kỹ thuật ở bài rà soát SEO kỹ thuật 30 điểm.

Cách HAYWEB tiếp cận
HAYWEB không chỉ áp dụng tách 3 nhóm robot AI ra rồi mới quyết định từng nhóm, giữ nhóm đưa website vào kết quả công cụ AI luôn mở, ghi một dòng lý do cho mỗi khối trong tệp, và kiểm lại bằng lệnh gọi thật có khai đúng tên robot thay vì tin bảng cấu hình, mà còn kết hợp toàn diện với:
- Kết cấu bài viết theo chuẩn 2026 — chi tiết chia sẻ qua tư vấn trực tiếp.
- Cách trình bày thông tin để công cụ tìm kiếm AI (ChatGPT, Gemini, Perplexity, AI Hay) trích dẫn chính xác.
- Đo lường bằng Google Search Console thật — theo dõi thứ hạng, lượt hiển thị và nhấp chuột từng bài để tối ưu theo dữ liệu.
- Điểm bảo mật Mozilla Observatory 100 trên 100 và tốc độ Lighthouse trên 90 giữ nguyên qua mọi lần cập nhật, kiểm tra hàng ngày.
- Cách theo dõi từng nhóm robot có thật sự vào đọc website hay không, và cách đọc nhật ký máy chủ để biết nhóm nào đang mang khách về — chia sẻ qua tư vấn 1-on-1 (HAYWEB dùng khi rà tệp chặn robot cho website khách, gồm bảng đối chiếu tên robot với lượt vào thật theo tuần).
Trải nghiệm khách hàng như ví dụ thực tế trên — và còn hơn, vì HAYWEB sở hữu thêm các chỉ tiêu nâng cao chuẩn 2026 chỉ chia sẻ qua tư vấn trực tiếp.
Có cần làm tệp llms.txt không?
Trả lời ngắn: Chưa cần gấp. llms.txt là đề xuất của cộng đồng do Jeremy Howard công bố ngày 3/9/2024, đặt một tệp dạng văn bản ở gốc website để cung cấp nội dung dễ đọc cho mô hình ngôn ngữ, xem trang giới thiệu đề xuất llms.txt. Điểm cần biết: tài liệu gốc không nêu công ty AI lớn nào cam kết dùng tệp này.
Vì vậy cách nhìn lành mạnh là coi nó như một việc rẻ tiền, làm khi rảnh thì tốt, nhưng đừng đánh đổi thời gian của những việc đã có bằng chứng rõ ràng — như viết nội dung để được trích dẫn, hay dựng dữ liệu cấu trúc đúng loại. Nếu công cụ AI nội địa hay thị trường Việt là ưu tiên của bạn, phần đó bàn ở bài AI Hay và tối ưu cho công cụ nội địa.
Bốn lỗi hay gặp khi xử lý robot AI
Lỗi 1 — chép nguyên một khối chặn tìm được trên mạng
Các khối chặn phổ biến gộp cả ba nhóm vào một danh sách dài. Dán vào là chặn luôn OAI-SearchBot và Claude-SearchBot, tức là tự gỡ mình khỏi câu trả lời của công cụ AI mà không hề biết. Cách đúng: tự viết theo bảng quyết định của bạn, mỗi khối một lý do.
Lỗi 2 — tưởng chặn trong tệp là chặn được thật
Tệp chặn robot là lời nhắn, không phải cái khoá. Với nội dung thật sự cần bảo vệ, hãy đặt sau đăng nhập hoặc chặn ở tầng mạng. Đây là điều Cloudflare nói thẳng trong tài liệu của họ, và cũng là điều nhiều người hiểu nhầm nhất.
Lỗi 3 — chặn theo địa chỉ máy chủ của robot
Anthropic nói cách chặn theo địa chỉ mà robot của họ dùng có thể không chạy đúng, và khuyên dùng tệp chặn robot. Địa chỉ máy chủ thay đổi theo thời gian, nên danh sách bạn tự chặn hôm nay có thể sai vào tháng sau, lại còn dễ chặn nhầm người dùng thật.
Lỗi 4 — quên rà lại sau khi làm website mới
Môi trường thử thường chặn sạch mọi robot cho khỏi bị lập chỉ mục. Lên bản thật mà quên tháo là mất hết. Cách kiểm nhanh sau mỗi lần lên bản mới: mở thẳng địa chỉ tệp chặn robot của website và đọc bằng mắt, rồi đối chiếu với báo cáo trong Search Console theo bài đọc Search Console ra quyết định.
Câu hỏi thường gặp về robot AI và tệp chặn robot
Chặn GPTBot có làm website mất hạng trên Google không?
Không. GPTBot là robot của OpenAI, không liên quan tới xếp hạng của Google. Với chính Google, tài liệu robot phổ biến nói rõ Google-Extended không ảnh hưởng việc website có mặt trong Google Tìm kiếm và không phải tín hiệu xếp hạng. Nghĩa là bạn có thể từ chối cho lấy nội dung huấn luyện mà vẫn giữ nguyên vị trí trên Google.
Chặn hết robot AI cho chắc có được không?
Được, nhưng bạn đang trả giá bằng nguồn khách. Chặn hết nghĩa là chặn cả nhóm đưa website vào kết quả bên trong ChatGPT và các công cụ AI khác. Với website dịch vụ đang cần khách, đó là tự làm mình vô hình ở một kênh đang lớn dần. Nếu lo về nội dung bị lấy huấn luyện, chỉ cần chặn riêng nhóm huấn luyện là đủ.
Làm sao biết robot AI có thật sự vào đọc website của mình không?
Cách chắc nhất là đọc nhật ký máy chủ và lọc theo tên robot, vì mỗi robot đều khai tên riêng trong dòng nhận dạng. Cách nhanh hơn là gọi thử trang bằng đúng tên robot rồi xem máy chủ trả về gì — cách này kiểm được tệp của bạn có hiệu lực hay không, dù chưa cho biết robot có thật sự ghé qua.
Nền tảng dựng website của tôi tự sinh tệp chặn robot thì làm sao sửa?
Nhiều nền tảng cho sửa tệp trong phần cài đặt, một số khác thì ghi đè tệp của bạn. Cách kiểm: mở thẳng địa chỉ tệp chặn robot của website và đọc nội dung thật đang được phục vụ, không đọc bản trong phần quản trị. Nếu không sửa được và bạn thật sự cần, hãy hỏi nhà cung cấp về lớp chặn ở tầng mạng.
Bắt đầu thế nào với tệp chặn robot của bạn?
Ba việc làm được ngay hôm nay. Bước 1 — mở thẳng địa chỉ tệp chặn robot của website mình và đọc xem đang chặn ai; đồng thời chạy rà soát miễn phí tại hayweb.vn/kiemtra. Bước 2 — lấy bảng quyết định ở trên, chốt ba ô cho loại website của bạn rồi viết lại tệp theo từng nhóm, giữ nguyên quy ước đường dẫn và sơ đồ web theo bài sơ đồ web và tệp chặn robot. Bước 3 — nếu muốn bàn cụ thể cho website thật của bạn chứ không phải mẫu chung, liên hệ HAYWEB tư vấn trực tiếp — nhà sáng lập Nguyễn Thế Quyền trả lời, không qua trung gian bán hàng.
Kiến thức liên quan
Nền tảng — nên đọc trước
- Sitemap.xml và robots.txt: cách HAYWEB cấu hình 2 tệp bắt buộc cho websitesitemap và robots.txt · 12 phút đọc
Cùng chủ đề
- SEO kỹ thuật 2026: bảng kiểm 30 điểm cho website doanh nghiệp Việttechnical SEO checklist · 15 phút đọc
- Core Web Vitals tháng 3/2026: ngưỡng LCP 2 giây, INP 200ms — website Việt ưu tiên điện thoại di độngcore web vitals 2026 · 12 phút đọc
- Cách HAYWEB sửa Core Web Vitals: 15 kỹ thuật sửa LCP, INP, CLSsửa Core Web Vitals · 13 phút đọc
- Thẻ canonical và trùng lặp nội dung: cách HAYWEB xử lý cho websitethẻ canonical · 12 phút đọc
Cần làm website chuyên nghiệp? Gọi trực tiếp HAYWEB.
Nhà sáng lập Nguyễn Thế Quyền trả lời trực tiếp, không qua trung gian bán hàng. Hoặc so sánh website của bạn với chuẩn HAYWEB trên 7 chỉ tiêu kỹ thuật — chỉ cần URL, không cần đăng ký.
Tài liệu tham khảo
- OpenAI — Bots (GPTBot thu thập nội dung có thể dùng huấn luyện · OAI-SearchBot đưa website vào kết quả tìm trong ChatGPT · ChatGPT-User theo thao tác người dùng, quy tắc robots.txt có thể không áp) — retrieved 2026-08.
- Google Search Central — Google common crawlers (Google-Extended quản việc dùng nội dung huấn luyện Gemini và làm nền dẫn chứng; KHÔNG ảnh hưởng việc có mặt trong Google Tìm kiếm, KHÔNG phải tín hiệu xếp hạng) — retrieved 2026-08.
- Anthropic — Does Anthropic crawl data from the web (ClaudeBot huấn luyện · Claude-User theo câu hỏi người dùng · Claude-SearchBot cải thiện kết quả tìm; chặn theo địa chỉ máy chủ có thể không chạy đúng) — retrieved 2026-08.
- Cloudflare — Managed robots.txt (tuân thủ robots.txt là tự nguyện; tệp nêu mong muốn nhưng không ngăn robot truy cập ở tầng kỹ thuật) — retrieved 2026-08.
- llmstxt.org — Đề xuất llms.txt của Jeremy Howard, công bố 3/9/2024 (tài liệu gốc không nêu công ty AI lớn nào cam kết dùng) — retrieved 2026-08.
- RFC 9309 — Robots Exclusion Protocol (chuẩn hoá cú pháp tệp robots.txt, tháng 9/2022) — retrieved 2026-08.