Thử thách vẽ Mona Lisa: Khi các mô hình AI hàng đầu đối đầu trên canvas kỹ thuật số
Khám phá kết quả thử nghiệm hiệu năng của GPT-5.6, Claude, Gemini và Grok trong nhiệm vụ vẽ tranh Mona Lisa. Bài viết phân tích sâu về khả năng sử dụng công cụ, chi phí token và độ chính xác của các mô hình AI frontier hiện nay.
Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.
Điểm tin nhanh:
- Thử nghiệm so sánh khả năng thực thi tác vụ vẽ tranh của 4 mô hình AI hàng đầu: GPT-5.6 Sol, Claude Fable 5, Grok 4.5 và Gemini 3.6 Flash.
- Kết quả cho thấy sự khác biệt lớn về chiến lược sử dụng công cụ (tool calling) và chi phí vận hành giữa các mô hình.
- Các mô hình AI hiện nay vẫn gặp khó khăn trong việc tự đánh giá và dừng lại đúng thời điểm để đạt chất lượng tối ưu, thường có xu hướng chỉnh sửa quá đà.
Trong kỷ nguyên của các mô hình ngôn ngữ lớn, chúng ta thường bị choáng ngợp bởi những con số benchmark khô khan. Tuy nhiên, liệu các mô hình này có thực sự sở hữu khả năng thực thi tác vụ phức tạp trong môi trường thực tế? Thay vì nhìn vào các bảng xếp hạng lý thuyết, chúng ta hãy đặt chúng vào một "đấu trường" sáng tạo: vẽ lại bức tranh Mona Lisa bằng các công cụ bút chì màu kỹ thuật số. Đây không chỉ là bài kiểm tra về khả năng thị giác, mà còn là thước đo về khả năng lập kế hoạch, sử dụng API và quản lý tài nguyên của các AI Agent hiện đại.
Thiết lập đấu trường kỹ thuật
Để đảm bảo tính khách quan, chúng tôi đã xây dựng một môi trường sandbox nơi các mô hình được cung cấp một canvas trắng và bộ công cụ chuyên dụng bao gồm: plan, view_target, view_canvas, set_color, set_brush, set_pressure, draw, smudge, erase và clear_canvas. Việc này tương tự như cách chúng ta xây dựng các môi trường cô lập trong Xây dựng Collaborative Multi-Persona Sandbox: Khi lập trình viên chán ngấy các giải pháp Cloud Wrapper.
So sánh hiệu năng và chi phí
Việc theo dõi sát sao từng bước thực thi giúp chúng ta thấy rõ sự khác biệt trong cách các mô hình tiếp cận bài toán. Dưới đây là bảng tổng hợp các thông số kỹ thuật chính:
| Mô hình | Tổng số token | Chi phí ước tính | Số bước trung bình | Đánh giá tự thân (trung bình) |
|---|---|---|---|---|
| GPT-5.6 Sol | 3.4M | $7.74 | 29 | 6.0 |
| Claude Fable 5 | 14.6M | $160.58 | 75 | 15.6 |
| Grok 4.5 | 34.0M | $9.21 | 99 | 14.3 |
| Gemini 3.6 Flash | 27.7M | $12.87 | 77 | 22.6 |
Lưu ý: Chi phí của Claude Fable 5 cao vượt trội, gấp khoảng 20 lần so với các đối thủ, trong khi kết quả đầu ra không tương xứng với khoản đầu tư này.

Phân tích chiến lược Tool Calling
Cách các mô hình sử dụng API công cụ phản ánh tư duy logic của chúng. GPT-5.6 Sol thể hiện sự tối ưu hóa bằng cách đặt tham số trực tiếp trong lệnh draw, trong khi Grok 4.5 lại tiêu tốn tài nguyên vào việc thiết lập trạng thái bút vẽ liên tục. Điều này gợi nhớ đến tầm quan trọng của việc tối ưu hóa trong Tối ưu hóa chi phí MCP Token: Chiến lược cắt giảm 92% ngân sách với Code Mode.


Vấn đề về sự hội tụ của mô hình
Một phát hiện thú vị là các mô hình AI thường đạt đỉnh chất lượng ở giữa quá trình và sau đó lại làm hỏng tác phẩm do chỉnh sửa quá đà. Đây là một dạng lỗi logic trong việc đánh giá trạng thái, tương tự như những rủi ro trong Khi Debugger đánh lừa bạn: Những cạm bẫy tiềm ẩn trong quá trình gỡ lỗi phần mềm. Việc lạm dụng các lệnh view_canvas không giúp mô hình cải thiện kết quả cuối cùng mà ngược lại, làm tăng chi phí và giảm độ chính xác.


Đánh giá & Lời khuyên Thực tiễn
Từ góc độ kỹ thuật, thử nghiệm này cho thấy:
- Ưu điểm: Các mô hình frontier hiện nay đã có khả năng điều khiển công cụ phức tạp và duy trì ngữ cảnh dài hạn tốt hơn đáng kể.
- Nhược điểm: Khả năng tự đánh giá (self-correction) vẫn là điểm yếu chí mạng. Các mô hình thường không biết khi nào nên dừng lại.
- Phạm vi ứng dụng: Phù hợp cho các tác vụ tự động hóa quy trình (workflow automation) nhưng cần có cơ chế kiểm soát (guardrails) chặt chẽ để tránh việc AI thực hiện các hành động thừa thãi gây tốn kém chi phí.
- Lưu ý Production: Khi triển khai AI Agent, hãy luôn thiết lập giới hạn số bước (max_steps) và cơ chế dừng sớm (early stopping) để tránh vòng lặp vô tận hoặc tiêu tốn token không kiểm soát.
Câu hỏi thường gặp (FAQ)
Tại sao Claude Fable 5 lại có chi phí cao như vậy?
Do kiến trúc của mô hình này yêu cầu nhiều token hơn cho mỗi bước xử lý và xu hướng thực hiện nhiều lệnh gọi công cụ phụ trợ, dẫn đến chi phí vận hành tăng vọt so với các mô hình khác.
SSIM là gì và tại sao lại dùng nó để đánh giá?
SSIM (Structural Similarity Index Measure) là chỉ số đo lường độ tương đồng cấu trúc giữa hai hình ảnh, giúp đánh giá khách quan hơn so với việc chỉ nhìn bằng mắt thường.
Có thể áp dụng quy trình này cho các tác vụ khác không?
Chắc chắn. Bạn có thể tham khảo cách xây dựng các hệ thống tương tự trong bài viết về Kiến trúc Local-first: Xây dựng công cụ tự động dọn dẹp bot Instagram với Python và SQLite.
Kết luận
Thử nghiệm vẽ tranh Mona Lisa không chỉ là một trò chơi thú vị mà còn là bài học đắt giá về khả năng thực thi của AI. Việc hiểu rõ cách các mô hình tương tác với công cụ là chìa khóa để xây dựng các hệ thống AI Agent hiệu quả và tiết kiệm. Hãy tiếp tục theo dõi hi_dev để cập nhật những phân tích chuyên sâu về công nghệ AI và các giải pháp tối ưu hóa hạ tầng mới nhất.
Do you like this post?
Upvote to push this post higher on the community feed





