
Giải mã hiện tượng Pelicanmaxxing: Liệu các phòng thí nghiệm AI có đang gian lận trong các bài kiểm tra benchmark?
Khám phá thực hư về nghi vấn các phòng thí nghiệm AI cố tình huấn luyện mô hình trên các bài kiểm tra benchmark nổi tiếng như 'vẽ bồ nông đi xe đạp' thông qua một thực nghiệm khoa học với hơn 1.000 mẫu hình ảnh.
Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.
Điểm tin nhanh:
- Benchmark 'vẽ bồ nông đi xe đạp' của Simon Willison đã trở thành một thước đo không chính thức nhưng cực kỳ phổ biến để đánh giá khả năng của các mô hình AI.
- Thực nghiệm trên 1.008 hình ảnh từ 7 mô hình frontier cho thấy không có bằng chứng thuyết phục nào về việc các phòng thí nghiệm AI đang 'pelicanmaxxing' (tối ưu hóa mô hình chỉ để vượt qua bài kiểm tra này).
- Kết quả cho thấy hiệu suất của các mô hình trên các đối tượng khác nhau không có sự thiên vị rõ rệt cho bồ nông hay xe đạp, bác bỏ giả thuyết về sự gian lận trong huấn luyện.
Trong giới công nghệ, khi hàng tỷ USD được đổ vào cuộc đua LLM, những bài kiểm tra benchmark không chính thức đôi khi lại có sức nặng hơn cả các con số kỹ thuật khô khan. Prompt 'Generate an SVG of a pelican riding a bicycle' (Tạo một file SVG hình con bồ nông đi xe đạp) đã trở thành một huyền thoại trên Hacker News, nơi cộng đồng dùng nó để 'thử lửa' các mô hình mới. Nhưng liệu các ông lớn AI có đang thực hiện hành vi 'pelicanmaxxing' – tức là tinh chỉnh mô hình chỉ để đạt điểm cao trong bài test vui vẻ này? Hãy cùng phân tích sâu hơn.

Phương pháp thực nghiệm: Cách chúng ta kiểm chứng
Để trả lời câu hỏi này, chúng ta cần một quy trình đánh giá nghiêm ngặt thay vì những cảm tính cá nhân. Tôi đã xây dựng một ma trận thử nghiệm bao gồm 8 loài động vật và 6 loại phương tiện, tạo ra tổng cộng 48 tổ hợp prompt khác nhau. Các mô hình được thử nghiệm bao gồm GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 và DeepSeek V4 Pro.
Quy trình xử lý dữ liệu được thực hiện qua ba giai đoạn chính:
- Render: Chuyển đổi SVG sang PNG để kiểm tra tính hợp lệ.
- Đánh giá: Sử dụng GPT-5.6 Luna để chấm điểm khả năng thể hiện động vật, phương tiện và tính mạch lạc của cảnh vật.
- Trích xuất đặc trưng: Sử dụng Gemini 3.1 Flash-Lite để nhận diện các thành phần trong ảnh.
Lưu ý: Việc đánh giá chất lượng hình ảnh AI thường gặp khó khăn do tính chủ quan. Tuy nhiên, việc sử dụng LLM làm judge giúp chúng ta có một hệ quy chiếu đồng nhất hơn so với việc tự đánh giá thủ công.
Kết quả phân tích: Dữ liệu nói gì?
Sau khi thu thập 1.008 mẫu hình ảnh, kết quả cho thấy các mô hình không hề thể hiện sự ưu ái đặc biệt cho bồ nông hay xe đạp. Dưới đây là bảng tổng hợp thứ hạng trung bình của các đối tượng:
| Đối tượng | Thứ hạng (trên 8 động vật) | Ghi chú |
|---|---|---|
| Mèo | 1 | Dễ nhận diện |
| Cá voi | 2 | Hình khối đơn giản |
| Bồ nông | 6 | Độ khó trung bình |
Nếu các phòng thí nghiệm thực sự 'pelicanmaxxing', chúng ta sẽ thấy bồ nông đứng đầu bảng xếp hạng. Thực tế, các mô hình hiện nay đang xử lý tốt hơn các đối tượng phổ biến như mèo hoặc cá voi. Tương tự, đối với phương tiện, xe đạp không hề đạt điểm cao hơn các loại phương tiện khác như ván trượt hay thuyền.
Phân tích chuyên sâu về sự memorization
Một giả thuyết khác cho rằng các mô hình 'học vẹt' (memorized) cảnh bồ nông đi xe đạp. Tuy nhiên, dữ liệu cho thấy xu hướng các nhân vật hướng sang phải là một đặc điểm chung của 60% tổng số hình ảnh được tạo ra, không chỉ riêng với bồ nông. Điều này cho thấy đó là xu hướng mặc định của mô hình khi xử lý các prompt về chuyển động, thay vì là một sự ghi nhớ có chủ đích từ dữ liệu huấn luyện.
Việc hiểu rõ cách mô hình vận hành là rất quan trọng, giống như cách chúng ta cần tối ưu hóa các quy trình tích hợp AI vào quy trình phát triển để đảm bảo tính an toàn và hiệu quả. Nếu bạn đang xây dựng các hệ thống tự động, hãy cân nhắc việc xây dựng chính sách AI Code Review để kiểm soát đầu ra của mô hình thay vì tin tưởng hoàn toàn vào các benchmark bên ngoài.
Đánh giá & Lời khuyên Thực tiễn
Từ góc nhìn của một kỹ sư cấp cao, bài kiểm tra 'bồ nông đi xe đạp' chỉ nên được xem là một công cụ giải trí. Trong môi trường production, việc đánh giá hiệu năng AI cần dựa trên các bộ dữ liệu đặc thù (domain-specific benchmarks) thay vì các prompt ngẫu nhiên.
- Ưu điểm: Giúp cộng đồng có cái nhìn nhanh về khả năng suy luận hình ảnh và xử lý SVG của mô hình.
- Nhược điểm: Thiếu tính khoa học, dễ bị nhiễu bởi các yếu tố ngẫu nhiên và không phản ánh được khả năng giải quyết vấn đề phức tạp.
- Lời khuyên: Nếu bạn đang phát triển các ứng dụng AI, hãy tập trung vào việc xây dựng hệ thống Lint tự động để kiểm soát chất lượng dữ liệu đầu ra thay vì tối ưu hóa cho các benchmark mang tính chất 'vibe coding'. Đừng quên rằng chất lượng thực sự không nằm ở danh xưng hay giá cả, mà nằm ở cách bạn kiểm soát hệ thống.
Câu hỏi thường gặp (FAQ)
Tại sao benchmark này lại nổi tiếng đến vậy?
Nó nổi tiếng vì tính hài hước và sự đơn giản. Nó cho phép bất kỳ ai cũng có thể kiểm tra nhanh khả năng của một mô hình AI mà không cần kiến thức kỹ thuật sâu.
Liệu có khả năng các lab AI sẽ 'pelicanmaxxing' trong tương lai?
Với sự cạnh tranh khốc liệt, các lab có thể tối ưu hóa cho các benchmark chính thức (như MMLU, GPQA). Tuy nhiên, việc tối ưu hóa cho một prompt ngẫu nhiên như bồ nông đi xe đạp là không thực tế về mặt kinh tế.
Tôi nên dùng benchmark nào để đánh giá mô hình của mình?
Bạn nên sử dụng các bộ benchmark chuyên biệt cho tác vụ của bạn (ví dụ: code generation, logic, hoặc xử lý văn bản) thay vì các benchmark hình ảnh ngẫu nhiên.
Kết luận
Tổng kết lại, không có bằng chứng nào cho thấy các phòng thí nghiệm AI đang 'pelicanmaxxing'. Các mô hình hiện nay đang hoạt động dựa trên khả năng tổng quát hóa dữ liệu thay vì ghi nhớ các prompt đơn lẻ. Hy vọng bài phân tích này giúp bạn có cái nhìn khách quan hơn về các tin đồn trong giới AI. Hãy tiếp tục theo dõi hi_dev để cập nhật những phân tích kỹ thuật chuyên sâu và chính xác nhất về thế giới công nghệ.
Do you like this post?
Upvote to push this post higher on the community feed





