DEV Community

BeanBean
BeanBean

Posted on • Originally published at nextfuture.io.vn

Chặn GPTBot Sai Cách: Vẫn Mất Traffic Từ ChatGPT Search

Originally published on NextFuture

Bạn thêm User-agent: GPTBot Disallow: / vào robots.txt, yên tâm là bài viết của mình đã "biến mất" khỏi ChatGPT. Vài ngày sau, bạn thử search tên bài viết ngay trong ChatGPT — và nó vẫn nằm đó, kèm link và trích dẫn chính xác. Vấn đề: bạn chặn nhầm bot, không phải block thất bại.

Mỗi công ty AI chạy hai loại bot, không phải một

Theo phân tích trên Dev.to, OpenAI, Anthropic, Google và Perplexity đều tách crawler thành hai nhóm: bot huấn luyện (training) và bot trích dẫn (citation). Hai nhóm này không dùng chung blocklist — chặn cái này không ảnh hưởng gì đến cái kia, vì chúng vận hành như của hai công ty khác nhau.

Công tyBot training (chặn = không bị dùng train model)Bot citation (chặn = biến mất khỏi AI search)

OpenAIGPTBotOAI-SearchBot, ChatGPT-User
AnthropicClaudeBotClaude-SearchBot, Claude-User
GoogleGoogle-ExtendedGooglebot (bot tìm kiếm truyền thống, đã crawl web hàng chục năm)
Perplexity— (không train model riêng)PerplexityBot, Perplexity-User
Metameta-externalagent— (chưa có sản phẩm search công khai)

Lý do tách hai bot: bot training chạy batch, quét hàng loạt trang rồi có khi vài tháng sau mới quay lại — nó cần volume, không cần dữ liệu mới nhất. Bot citation thì ngược lại, fetch đúng một trang trong tích tắc ngay khi có người hỏi — nó cần tốc độ và độ mới, không cần quét toàn site. Gộp hai nhiệm vụ vào một bot khó hơn nhiều so với chạy hai hệ thống riêng, nên hãng nào cũng tách làm hai.

Cấu hình robots.txt để chặn đúng bot

Muốn ngăn nội dung bị dùng để train model nhưng vẫn được trích dẫn khi người dùng hỏi ChatGPT/Claude/Perplexity, đây là ví dụ cấu hình tách bạch hai nhóm (minh hoạ theo bài viết gốc — nên rà lại danh sách bot mới nhất trước khi áp dụng cho site thật):

User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Enter fullscreen mode Exit fullscreen mode

Điểm quan trọng cần nhớ: robots.txt hoạt động theo nguyên tắc "không nhắc tên = mặc định cho phép". Nếu bạn chỉ chặn training bot mà không khai báo rõ citation bot, việc site "được phép xuất hiện" trên AI search đang phụ thuộc vào default hiện tại của từng hãng — thứ có thể đổi bất cứ lúc nào khi họ cập nhật logic crawler, mà bạn sẽ không được báo trước.

Việc cần làm ngay

Mở robots.txt của site hoặc blog bạn đang chạy, đối chiếu với bảng trên xem đang chặn đúng bot chưa. Nếu mục tiêu là "không bị train nhưng vẫn được trích dẫn", khai báo rõ từng bot thay vì dựa vào default. Và theo dõi thêm: danh sách bot của các AI company gần như chắc chắn sẽ dài thêm trong năm tới, robots.txt hôm nay đúng chưa chắc còn đúng sau vài tháng.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)