Back to Explore
Evals là PRD mới: Cách Expedia định nghĩa lại quy trình phát triển AI Agent

Evals là PRD mới: Cách Expedia định nghĩa lại quy trình phát triển AI Agent

Xavi Amatriain, Giám đốc AI tại Expedia, khẳng định trong kỷ nguyên AI, các bộ đánh giá (Evals) chính là tài liệu đặc tả sản phẩm (PRD) mới. Bài viết phân tích cách xây dựng hệ thống AI Agent an toàn, hiệu quả thông qua việc kiểm soát rủi ro và tư duy thiết kế hệ thống thay vì phụ thuộc vào guardrails.

Website
Upvote this postSign in to upvote this article.

Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.

Điểm tin nhanh:

  • Evals (các bộ đánh giá) hiện đóng vai trò là tài liệu đặc tả sản phẩm (PRD) trong quy trình phát triển AI, giúp mã hóa yêu cầu bảo mật và tính năng ngay từ khâu thiết kế.
  • Expedia áp dụng mô hình quản trị AI dựa trên rủi ro (toll gates) thay vì sử dụng các guardrails cứng nhắc gây ảnh hưởng đến vòng lặp phản hồi của người dùng.
  • Kiến trúc AI Agent nên được xây dựng theo hướng kết hợp các tác nhân chuyên biệt (specialized agents) thay vì dựa vào một mô hình AGI nguyên khối duy nhất.

Trong thế giới phát triển phần mềm truyền thống, chúng ta đã quen với việc viết hàng chục trang PRD (Product Requirements Document) trước khi đặt tay vào code. Nhưng với sự trỗi dậy của các hệ thống AI Agent, tài liệu này đang dần trở nên lỗi thời. Xavi Amatriain, Giám đốc AI và Dữ liệu tại Expedia Group, đã đưa ra một tuyên bố gây chấn động tại sự kiện VB Transform 2026: "Evals chính là PRD mới". Đây không chỉ là một thay đổi về thuật ngữ, mà là một cuộc cách mạng trong tư duy kỹ thuật, nơi các tiêu chuẩn đánh giá trở thành cốt lõi của sản phẩm.

Ảnh bìa bài viết

Evals: Từ công cụ kiểm thử đến kiến trúc sản phẩm

Theo Amatriain, việc mã hóa các yêu cầu sản phẩm vào Evals (bao gồm cả red teaming và các tiêu chuẩn bảo mật) cho phép đội ngũ kỹ thuật nhúng trực tiếp tư duy thiết kế vào quy trình phát triển trước khi bất kỳ dòng code nào được viết. Điều này giúp loại bỏ sự mơ hồ trong các tài liệu văn bản truyền thống. Khi chúng ta xây dựng các hệ thống AI phức tạp, việc hiểu rõ nợ kỹ thuật không hề biến mất, chúng ta chỉ đang trả giá bằng Token cho AI là điều tối quan trọng.

Quản trị AI dựa trên rủi ro và Toll Gates

Expedia không tin vào việc đặt quá nhiều guardrails cứng nhắc, vì chúng thường làm sai lệch dữ liệu phản hồi của người dùng. Thay vào đó, họ sử dụng hệ thống "toll gates" (cổng kiểm soát) được hiệu chỉnh theo mức độ rủi ro. Dưới đây là bảng thống kê thực trạng triển khai AI trong doanh nghiệp hiện nay:

Chỉ số khảo sát Tỷ lệ / Kết quả
Doanh nghiệp triển khai AI không cần review 66%
Doanh nghiệp tin tưởng tuyệt đối vào automated evals 5%
Tỷ lệ agent thất bại với khách hàng dù qua evals nội bộ 50%
Doanh nghiệp từng gặp sự cố bảo mật AI 54%

Evals are the new PRD, Expedia’s AI chief tells VB Transform 2026

Kiến trúc Agent: Composition over Monolith

Amatriain nhấn mạnh rằng việc tin vào một AGI (Trí tuệ nhân tạo tổng quát) duy nhất là sai lầm. Thay vào đó, hệ thống nên được thiết kế theo dạng composition: các công cụ (tools) tạo thành kỹ năng (skills), các kỹ năng tạo thành sub-agents, và cuối cùng là hệ thống agentic hoàn chỉnh. Điều này tương tự như cách chúng ta xây dựng công cụ quét Tech Stack website bằng Go để tối ưu hóa hiệu năng thay vì dùng các giải pháp cồng kềnh.

Mẹo hay: Việc chia nhỏ các agent giúp việc cô lập và bảo mật từng thành phần trở nên dễ dàng hơn nhiều so với một hệ thống nguyên khối.

Bảo mật là thiết kế, không phải là lớp phủ

Trong kỷ nguyên AI, các cuộc tấn công sẽ đến từ các hệ thống AI khác. Do đó, bảo mật phải được "shift-left" (đưa về phía trước) ngay trong khâu thiết kế. Việc quản trị rủi ro và đạo đức trong Enterprise Generative AI không còn là lựa chọn mà là yêu cầu bắt buộc đối với các CIO.

Đánh giá & Lời khuyên Thực tiễn

Từ góc nhìn của một kỹ sư, mô hình của Expedia mang lại sự linh hoạt cao nhưng đòi hỏi kỷ luật cực lớn:

  • Ưu điểm: Giảm thiểu thời gian phát triển, tăng độ chính xác thông qua Evals, tối ưu hóa vòng lặp phản hồi.
  • Nhược điểm: Đòi hỏi hạ tầng đánh giá (evaluation infrastructure) cực kỳ mạnh mẽ và khả năng tự động hóa cao.
  • Lưu ý: Khi triển khai, đừng bao giờ để agent thực hiện các hành động quan trọng (như thanh toán) mà không có sự xác nhận cuối cùng của người dùng. Hãy áp dụng tư duy quản trị rủi ro và đạo đức ngay từ ngày đầu tiên.

Câu hỏi thường gặp (FAQ)

Tại sao Evals lại quan trọng hơn PRD truyền thống?

Vì Evals có thể thực thi được và chứa đựng các tiêu chuẩn bảo mật cụ thể, giúp giảm thiểu sai lệch giữa tài liệu thiết kế và kết quả thực tế của mô hình AI.

Làm thế nào để quản trị AI mà không dùng quá nhiều guardrails?

Sử dụng hệ thống toll gates dựa trên rủi ro. Chỉ áp dụng kiểm soát nghiêm ngặt với các tác vụ có rủi ro cao, thay vì áp dụng đồng loạt cho toàn bộ hệ thống.

Tại sao nên chọn kiến trúc nhiều agent thay vì một mô hình lớn?

Kiến trúc phân tán giúp cô lập lỗi, dễ dàng bảo trì, nâng cấp từng phần và tối ưu hóa hiệu năng cho các tác vụ chuyên biệt.

Kết luận

Việc chuyển dịch từ PRD sang Evals là minh chứng cho sự trưởng thành của ngành công nghiệp AI. Để bắt kịp xu hướng này, các kỹ sư cần tập trung vào việc xây dựng các bộ đánh giá tự động hóa và tư duy kiến trúc hệ thống thay vì chỉ tập trung vào việc tinh chỉnh prompt. Hãy bắt đầu bằng việc xây dựng AI Agent từ con số 0 và đừng quên theo dõi hi_dev để cập nhật những kiến thức chuyên sâu nhất về công nghệ AI Agent.

Discussion (0)

You need to log in to post comments. Log In

No comments yet. Start the discussion!