
AI Visibility Index: Tại sao 95% website đang vô hình trước các công cụ tìm kiếm AI?
Phân tích chuyên sâu từ AI Visibility Index về khả năng hiển thị của website trên các công cụ AI. Khám phá lý do tại sao việc chặn crawler không đúng cách đang khiến website của bạn mất đi cơ hội tiếp cận người dùng trong kỷ nguyên AI Search.
Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.
Điểm tin nhanh:
- Chỉ 8.9% website chặn ít nhất một AI crawler, nhưng 94.8% website không bao giờ xuất hiện trong các câu trả lời của AI.
- Việc chặn các crawler đào tạo (training) không ảnh hưởng đến khả năng truy xuất (retrieval) của AI, nhưng nhiều quản trị viên web đang nhầm lẫn giữa hai loại này.
- Gemini hiện là trợ lý AI có khả năng trích dẫn nguồn (citation) rộng rãi nhất trong các thử nghiệm với 2.9% tỷ lệ xuất hiện.
Trong kỷ nguyên mà người dùng dần chuyển dịch từ tìm kiếm truyền thống sang các trợ lý AI như ChatGPT, Claude hay Perplexity, câu hỏi lớn nhất không còn là "Website của tôi có đứng top Google không?" mà là "Liệu AI có biết đến sự tồn tại của tôi không?". Dữ liệu mới nhất từ AI Visibility Index cho thấy một nghịch lý đáng báo động: trong khi phần lớn các website vẫn mở cửa cho AI, thì gần như tất cả đều hoàn toàn vô hình trong các câu trả lời của trợ lý ảo. Đây không chỉ là vấn đề về SEO, mà là sự đứt gãy trong cách đo lường tầm ảnh hưởng thương hiệu, tương tự như những thách thức trong AI Search và sự đứt gãy trong đo lường.
Hiểu về AI Visibility Index: Sự hiện diện và Khả năng đọc
AI Visibility Index đo lường hai trụ cột độc lập nhưng bổ trợ cho nhau. Thứ nhất là Answer Presence (Sự hiện diện trong câu trả lời), xác định xem doanh nghiệp có được AI nhắc tên khi người dùng đặt câu hỏi về sản phẩm hoặc dịch vụ hay không. Thứ hai là Machine Readability (Khả năng đọc của máy), kiểm tra xem website có cấu trúc robots.txt, sitemap và schema.org chuẩn xác để AI có thể "hiểu" nội dung hay không.

Việc tối ưu hóa khả năng hiển thị này đòi hỏi tư duy khác biệt so với SEO truyền thống. Nếu bạn đang loay hoay với các chiến lược tăng trưởng, hãy tham khảo cách Great Question và chiến lược Demand Generation để hiểu cách AI đóng vai trò đòn bẩy cho SaaS.
Dữ liệu thực tế: Khoảng cách giữa các trợ lý AI
Thống kê từ 5,978 câu trả lời của các trợ lý AI cho thấy sự khác biệt đáng kể về khả năng trích dẫn nguồn giữa các mô hình. Dưới đây là bảng so sánh tỷ lệ xuất hiện của các website trong câu trả lời của AI:
| Trợ lý AI | Tỷ lệ xuất hiện (%) | Số trang được nhắc tên |
|---|---|---|
| Gemini | 2.9% | 8 / 193 |
| ChatGPT | 1.7% | 5 / 193 |
| Claude | 1.6% | 5 / 193 |
| Perplexity | 1.6% | 8 / 193 |
Sai lầm trong việc chặn AI Crawler
Một trong những phát hiện đáng chú ý nhất là sự nhầm lẫn trong việc cấu hình robots.txt. Nhiều quản trị viên web đang chặn nhầm các tác nhân truy xuất (retrieval agents) thay vì chỉ chặn các trình thu thập dữ liệu đào tạo (training crawlers). Việc chặn nhầm này khiến website trở nên hoàn toàn không thể trích dẫn.
Lưu ý: Việc chặn
GPTBothayClaudeBot(thường dùng để đào tạo mô hình) không giống với việc chặnOAI-SearchBothayPerplexity-User(dùng để trả lời câu hỏi trực tiếp). Hãy kiểm tra kỹ cấu hìnhrobots.txtcủa bạn để tránh làm mất đi cơ hội xuất hiện trong các câu trả lời của AI.
Tầm quan trọng của Schema.org và Dữ liệu cấu trúc
Chỉ có 54.6% website xuất bản dữ liệu cấu trúc schema.org trên trang chủ, và con số này thậm chí thấp hơn đối với LocalBusiness schema (19.3%). Trong thế giới của các AI Agent, dữ liệu cấu trúc chính là ngôn ngữ giao tiếp trực tiếp. Nếu bạn đang xây dựng các hệ thống AI Agent, việc hiểu rõ cách quản lý dữ liệu là yếu tố sống còn, giống như cách Agent4Lease tối ưu hóa hạ tầng quản lý AI Agent.
Đánh giá & Lời khuyên Thực tiễn
Từ góc độ kỹ thuật, việc website không xuất hiện trong AI không hẳn là lỗi của AI, mà là do thiếu các tín hiệu "đọc được" (machine-readable signals).
- Ưu điểm: Việc tối ưu hóa cho AI thường đồng nhất với các tiêu chuẩn SEO kỹ thuật tốt (sitemap, schema, tốc độ tải trang).
- Nhược điểm: Hiện tại chưa có một chuẩn chung cho tất cả các AI, khiến việc tối ưu hóa trở nên rời rạc.
- Lời khuyên: Hãy tập trung vào việc triển khai
LocalBusinessschema nếu bạn là doanh nghiệp địa phương. Đồng thời, hãy cẩn trọng với việc chặn crawler; chỉ chặn các bot đào tạo nếu bạn thực sự không muốn dữ liệu của mình được dùng để huấn luyện mô hình, nhưng hãy để mở cho các bot tìm kiếm (search agents).
Câu hỏi thường gặp (FAQ)
Tại sao website của tôi chặn GPTBot nhưng vẫn cần hiển thị trên AI?
Việc chặn GPTBot chỉ ngăn OpenAI sử dụng dữ liệu của bạn để đào tạo mô hình. Để website xuất hiện trong câu trả lời tìm kiếm, bạn cần cho phép OAI-SearchBot truy cập.
Schema.org có thực sự giúp AI trích dẫn nguồn tốt hơn không?
Có. AI ưu tiên đọc các dữ liệu có cấu trúc rõ ràng như tên doanh nghiệp, địa chỉ, và danh mục sản phẩm để xác thực thông tin trước khi đưa vào câu trả lời.
Làm thế nào để kiểm tra website của tôi có đang bị chặn bởi AI không?
Bạn có thể kiểm tra file robots.txt tại đường dẫn /robots.txt trên website của mình và tìm kiếm các dòng Disallow dành cho các user-agent như GPTBot, ClaudeBot, hay PerplexityBot.
Kết luận
Sự hiện diện của website trong kỷ nguyên AI không còn là lựa chọn, mà là yêu cầu bắt buộc để duy trì lợi thế cạnh tranh. Việc hiểu rõ cách các AI crawler vận hành và tối ưu hóa cấu trúc dữ liệu sẽ giúp bạn không bị bỏ lại phía sau. Hãy bắt đầu kiểm tra lại cấu hình kỹ thuật của bạn ngay hôm nay và đừng quên theo dõi hi_dev để cập nhật những xu hướng công nghệ mới nhất.
Do you like this post?
Upvote to push this post higher on the community feed




