Back to Explore
Infinity và tham vọng phá vỡ thế độc quyền CUDA của Nvidia trong kỷ nguyên AI Inference

Infinity và tham vọng phá vỡ thế độc quyền CUDA của Nvidia trong kỷ nguyên AI Inference

Startup Infinity huy động thành công 15 triệu USD với mục tiêu xóa bỏ rào cản phần mềm CUDA, cho phép các mô hình AI chạy tối ưu trên mọi loại chip xử lý thay vì phụ thuộc vào hệ sinh thái Nvidia.

Website
Upvote this postSign in to upvote this article.

Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.

Điểm tin nhanh:

  • Infinity huy động 15 triệu USD để phát triển giải pháp AI giúp chạy inference trên mọi loại chip, không chỉ riêng Nvidia.
  • Công cụ Ignition của hãng tự động hóa việc tạo và tối ưu hóa kernel, giúp giảm bớt gánh nặng kỹ thuật cho các kỹ sư.
  • Kết quả thử nghiệm cho thấy hiệu suất tăng vọt, thách thức vị thế độc tôn của CUDA trong thị trường AI accelerator.

Sự thống trị của Nvidia trong lĩnh vực AI không chỉ nằm ở sức mạnh phần cứng thô, mà còn nằm ở bức tường thành mang tên CUDA. Trong gần hai thập kỷ, hệ sinh thái phần mềm này đã trở thành tiêu chuẩn mặc định, khiến việc chuyển dịch sang các kiến trúc chip khác từ AMD, Qualcomm hay AWS trở thành một cơn ác mộng về kỹ thuật. Tuy nhiên, sự xuất hiện của Infinity với vòng gọi vốn 15 triệu USD đang đặt ra một dấu hỏi lớn cho vị thế này.

Giải mã bài toán CUDA và sự phụ thuộc phần mềm

Nvidia hiện nắm giữ khoảng 80% thị trường chip tăng tốc AI cho trung tâm dữ liệu. Lý do không nằm ở việc các đối thủ không thể chế tạo chip mạnh mẽ, mà nằm ở sự thiếu hụt lớp phần mềm trung gian. Các framework phổ biến như PyTorch hay TensorFlow được tối ưu hóa sâu sắc trên CUDA. Khi một kỹ sư muốn chuyển mô hình sang phần cứng mới, họ phải đối mặt với việc viết lại các kernel - những đoạn mã cấp thấp điều khiển chip - một công việc đòi hỏi chi phí và nhân lực khổng lồ.

Việc tối ưu hóa hiệu năng trên các nền tảng khác nhau là một thách thức lớn, tương tự như cách chúng ta phải tối ưu hóa Data Science Workflow khi chuyển dịch từ CPU sang GPU để đạt được kết quả tốt nhất. Infinity đang cố gắng giải quyết nút thắt này bằng cách tự động hóa hoàn toàn quy trình viết kernel.

Ảnh bìa bài viết

Ignition: AI Agent thay thế kỹ sư viết code cho chip

Infinity giới thiệu Ignition, một AI Agent có khả năng tự động tạo, kiểm thử và tinh chỉnh các kernel cho chip. Thay vì để con người làm việc thủ công, Ignition sẽ đảm nhận phần việc nặng nhọc, cho phép các kỹ sư tập trung vào tư duy chiến lược. Dưới đây là bảng so sánh hiệu suất được Infinity công bố trong các thử nghiệm ban đầu:

Chỉ số Kết quả trước khi tối ưu Kết quả sau khi dùng Ignition Ghi chú
Hiệu suất chip d-Matrix Thấp 92% peak performance Sau 10 giờ
Tốc độ inference (tokens/s) 1,400 > 20,000 Tăng gấp 14 lần

Mẹo hay: Việc tự động hóa các quy trình kỹ thuật phức tạp không chỉ giúp tiết kiệm thời gian mà còn giảm thiểu rủi ro sai sót con người, giống như cách chúng ta giải quyết triệt để rò rỉ bộ nhớ Puppeteer trên Production bằng các giải pháp tự động hóa.

Tầm nhìn về tự động hóa sáng tạo

Jeremy Nixon, người sáng lập Infinity và cựu nghiên cứu viên tại Google Brain, tin rằng AI có thể tự định nghĩa và tối ưu hóa chính nó. Trước đây, ông từng phát triển thuật toán Omega có khả năng tự tạo ra các thuật toán học máy khác. Ignition chính là sự kế thừa tư duy đó, áp dụng vào tầng phần cứng. Điều này mở ra khả năng cho các tổ chức không cần phải phụ thuộc vào một nhà cung cấp duy nhất, tương tự như việc xây dựng hệ thống 17 công cụ tính toán 100% Client-Side để giảm sự phụ thuộc vào hạ tầng Backend phức tạp.

Cristian Dina

Đánh giá & Lời khuyên Thực tiễn

Từ góc độ kỹ thuật, giải pháp của Infinity rất hứa hẹn nhưng vẫn còn những rủi ro cần cân nhắc:

  • Ưu điểm: Giảm đáng kể rào cản gia nhập cho các nhà sản xuất chip mới, tăng tính cạnh tranh và giảm chi phí vận hành AI inference.
  • Nhược điểm: Các kết quả benchmark hiện tại chủ yếu do công ty tự công bố. Việc triển khai trên quy mô lớn (production-grade) với độ ổn định cao vẫn cần thời gian kiểm chứng.
  • Phạm vi ứng dụng: Phù hợp cho các doanh nghiệp muốn đa dạng hóa hạ tầng phần cứng, tránh tình trạng bị khóa chặt vào hệ sinh thái Nvidia (vendor lock-in).

Lưu ý: Khi áp dụng các công cụ tự động hóa kernel mới, hãy luôn chạy các bài kiểm tra stress-test kỹ lưỡng. Đừng quên rằng việc quản trị thực nghiệm cũng quan trọng như việc tối ưu hóa, hãy tham khảo cách chấm dứt sự hỗn loạn trong Machine Learning với MLflow để đảm bảo tính nhất quán.

Câu hỏi thường gặp (FAQ)

Ignition có thay thế hoàn toàn kỹ sư phần mềm không?

Không, Ignition đóng vai trò là một AI Agent hỗ trợ, giúp tự động hóa các tác vụ lặp lại như viết kernel, trong khi kỹ sư vẫn giữ vai trò định hướng và kiểm soát chất lượng.

Giải pháp của Infinity có hỗ trợ mọi loại chip không?

Infinity đang tập trung vào việc làm cho bất kỳ chip nào cũng có thể sẵn sàng cho inference, tuy nhiên mức độ hỗ trợ sẽ phụ thuộc vào khả năng tương thích của kiến trúc chip đó với các công cụ của họ.

Tại sao việc phá vỡ CUDA lại quan trọng?

Việc phá vỡ sự độc quyền của CUDA giúp giảm chi phí hạ tầng, tăng tính linh hoạt trong việc lựa chọn phần cứng và thúc đẩy sự đổi mới sáng tạo trong ngành bán dẫn AI.

Kết luận

Infinity đang đi những bước đi táo bạo để thay đổi cuộc chơi trong lĩnh vực AI hạ tầng. Nếu Ignition thực sự hoạt động hiệu quả như những gì đã công bố, chúng ta có thể sớm thấy một kỷ nguyên mà phần mềm không còn là rào cản cho sự phát triển của phần cứng. Hãy tiếp tục theo dõi hi_dev để cập nhật những bước tiến mới nhất của công nghệ này và đừng quên chia sẻ quan điểm của bạn về tương lai của AI inference dưới phần bình luận.

Discussion (0)

You need to log in to post comments. Log In

No comments yet. Start the discussion!