Back to Explore
AMD Helios: Cú đáp trả đanh thép của AMD trước Nvidia NVL72 với 72 GPU và 31TB HBM4

AMD Helios: Cú đáp trả đanh thép của AMD trước Nvidia NVL72 với 72 GPU và 31TB HBM4

AMD chính thức công bố Helios, hệ thống rack-scale AI đầu tiên với 72 GPU Instinct MI455X và 31TB HBM4, thách thức trực tiếp vị thế của Nvidia NVL72 trong kỷ nguyên hạ tầng AI.

Website
Upvote this postSign in to upvote this article.

Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.

Điểm tin nhanh:

  • AMD Helios là hệ thống rack-scale AI đầu tiên của AMD, trang bị 72 GPU Instinct MI455X và 31TB HBM4.
  • Kiến trúc dựa trên các tiêu chuẩn mở như UALink, Ultra Ethernet và OCP Open Rack Wide, cạnh tranh trực tiếp với NVLink độc quyền của Nvidia.
  • Dự kiến ra mắt bản thử nghiệm vào nửa cuối năm 2026 và sản xuất hàng loạt vào quý 2 năm 2027.

Trong cuộc đua khốc liệt về hạ tầng AI, nơi mà các ông lớn công nghệ đang đổ hàng tỷ USD để giành lấy lợi thế về tính toán, AMD vừa tung ra một quân bài chiến lược mang tên Helios. Đây không chỉ là một hệ thống phần cứng đơn thuần, mà là một tuyên ngôn về sự cởi mở trong kiến trúc hệ thống, nhắm thẳng vào vị thế thống trị của Nvidia NVL72. Khi các kỹ sư đang phải đối mặt với những thách thức về tối ưu hóa bộ nhớ cho mô hình ngôn ngữ lớn, sự xuất hiện của Helios mang đến một giải pháp thay thế đầy hứa hẹn cho các trung tâm dữ liệu quy mô lớn.

Kiến trúc phần cứng đột phá của AMD Helios

AMD Helios được thiết kế như một hệ thống rack-scale toàn diện, tập trung vào việc tối đa hóa mật độ tính toán và băng thông bộ nhớ. Hệ thống này bao gồm 18 khay tính toán (compute trays), mỗi khay chứa 4 bộ tăng tốc MI455X dựa trên kiến trúc CDNA 5 mới nhất và một CPU EPYC Venice thế hệ thứ sáu.

AMD Helios: Hệ thống rack-scale AI với 72 GPU MI455X

Thông số kỹ thuật ấn tượng

Để hiểu rõ sức mạnh của Helios, chúng ta cần nhìn vào các con số kỹ thuật cốt lõi được AMD công bố:

Thông số Giá trị Ghi chú
Số lượng GPU 72 x Instinct MI455X Kiến trúc CDNA 5
Tổng dung lượng HBM4 31 TB Băng thông cực cao
Hiệu năng inference 2.9 exaflops Định dạng FP4
Băng thông scale-up 260 TB/s Kết nối nội bộ rack
Băng thông scale-out 43 TB/s Kết nối liên rack

Đặt cược vào tiêu chuẩn mở thay vì độc quyền

Khác với cách tiếp cận của Nvidia với NVLink độc quyền, AMD đang đặt cược vào sự linh hoạt của các tiêu chuẩn mở. Điều này cực kỳ quan trọng đối với các đơn vị vận hành trung tâm dữ liệu, những người không muốn bị khóa chặt vào hệ sinh thái của một nhà cung cấp duy nhất. Khi bạn đang xây dựng hệ thống giám sát cho AI Agent, việc sở hữu một hạ tầng mở sẽ giúp giảm thiểu rủi ro phụ thuộc vào vendor.

Helios sử dụng:

  • UALink cho kết nối scale-up giữa các GPU.
  • Ultra Ethernet Consortium cho kết nối scale-out.
  • OCP Open Rack Wide form factor cho thiết kế vật lý.

Lưu ý: Việc sử dụng các tiêu chuẩn mở giúp giảm thiểu chi phí vận hành lâu dài, nhưng đòi hỏi sự tương thích cao giữa các thành phần phần cứng khác nhau trong hệ thống.

Hệ sinh thái phần mềm: Thách thức lớn nhất

Mặc dù phần cứng của Helios rất ấn tượng, nhưng câu hỏi lớn nhất vẫn nằm ở phần mềm. AMD đang nỗ lực thúc đẩy ROCm để hỗ trợ PyTorch, TensorFlow và JAX, nhằm giúp các nhà phát triển không cần phải viết lại mã nguồn khi chuyển dịch từ hệ sinh thái CUDA. Điều này tương tự như cách các lập trình viên đang nỗ lực tối ưu hóa quy trình báo cáo để đạt hiệu suất cao nhất trên hạ tầng hiện có.

Hình minh họa hạ tầng công nghệ

Đánh giá & Lời khuyên Thực tiễn

Từ góc nhìn của một kỹ sư cấp cao, Helios là một bước đi táo bạo.

  • Ưu điểm: Dung lượng HBM4 khổng lồ (31TB) là chìa khóa cho các mô hình AI thế hệ mới với ngữ cảnh dài. Khả năng không bị khóa vendor (vendor lock-in) là điểm cộng lớn cho các hyperscalers.
  • Nhược điểm: Hệ sinh thái phần mềm của AMD vẫn còn khoảng cách so với CUDA của Nvidia. Thời gian chờ đợi đến Q2 2027 là khá dài trong thế giới AI biến động nhanh.
  • Phạm vi ứng dụng: Phù hợp cho các trung tâm dữ liệu lớn, các dự án huấn luyện mô hình AI quy mô frontier, nơi mà băng thông bộ nhớ là nút thắt cổ chai chính.

Mẹo hay: Nếu bạn đang cân nhắc đầu tư hạ tầng AI, hãy đánh giá kỹ khả năng hỗ trợ của các framework hiện tại trên ROCm trước khi quyết định chuyển đổi hoàn toàn.

Câu hỏi thường gặp (FAQ)

Helios có tương thích với mã nguồn viết cho Nvidia CUDA không?

AMD đang nỗ lực thu hẹp khoảng cách thông qua ROCm, nhưng việc chuyển đổi vẫn đòi hỏi kiểm thử kỹ lưỡng. Không có sự tương thích 100% tự động.

Tại sao 31TB HBM4 lại quan trọng?

Trong huấn luyện mô hình AI lớn, nút thắt không chỉ nằm ở tính toán mà còn ở khả năng chứa và di chuyển dữ liệu. 31TB HBM4 giúp xử lý các mô hình có tham số khổng lồ mà không cần truy xuất liên tục vào bộ nhớ ngoài.

Khi nào Helios sẽ khả dụng?

Các mẫu kỹ thuật (engineering samples) sẽ bắt đầu được gửi đi vào nửa cuối năm 2026, và sản xuất hàng loạt dự kiến vào quý 2 năm 2027.

Kết luận

AMD Helios đánh dấu một cột mốc quan trọng trong cuộc chiến hạ tầng AI. Với sự kết hợp giữa phần cứng mạnh mẽ và cam kết về tiêu chuẩn mở, AMD đang tạo ra một áp lực thực sự lên thị trường. Dù phần mềm vẫn là một bài toán khó, nhưng Helios cung cấp một lựa chọn chiến lược cho những ai muốn tự chủ hạ tầng. Hãy theo dõi hi_dev để cập nhật những diễn biến mới nhất về cuộc đua hạ tầng AI này.

Discussion (0)

You need to log in to post comments. Log In

No comments yet. Start the discussion!