Một startup 26 người với 15 triệu USD vừa huy động đang tuyên bố sẽ thay thế CUDA của NVIDIA bằng AI agent tự động viết mã kernel cho mọi loại chip. Infinity, công ty do cựu nhà nghiên cứu Google Brain Jeremy Nixon sáng lập, không bán phần mềm trả phí trước mà thu phí dựa trên hiệu suất - tức là chỉ kiếm tiền khi khiến chip của khách hàng chạy nhanh hơn.
Nhưng liệu một đội ngũ chỉ vỏn vẹn 26 kỹ sư có thể đối đầu với đế chế CUDA đã tồn tại hơn 30 năm? Phân tích dưới đây sẽ mổ xẻ từng khía cạnh kỹ thuật, thương mại và tác động thị trường của Infinity, đồng thời chỉ ra những rủi ro ẩn giấu mà báo chí ít khi đề cập.
Bối cảnh: Tại sao lại là bây giờ?
Ngành công nghiệp AI đang sống trong nỗi ám ảnh CUDA. NVIDIA kiểm soát gần như toàn bộ phần mềm chạy AI, buộc mọi chip cạnh tranh (AMD, Intel, Google TPU, các startup) phải tốn hàng chục nghìn giờ công để viết thư viện tối ưu. Infinity nhắm vào nỗi đau đó: dùng AI để tự động viết các kernel - những đoạn code cấp thấp điều khiển trực tiếp phần cứng. Công nghệ lõi là Ignition, một AI research agent có thể viết, test, debug và tối ưu kernel cho nhiều kiến trúc chip khác nhau: GPU, SRAM, chip di động, thậm chí cả systolic array.
Đây không phải là compiler truyền thống (như TVM hay MLIR) mà là một hệ thống học tăng cường hoặc tiến hóa - nó tự sinh ra code và chọn lọc dựa trên hiệu năng thực tế. Nếu thành công, bất kỳ startup chip nào cũng có thể có ngay một software stack mạnh mà không cần đội ngũ hàng chục kỹ sư phần mềm. Nhưng nếu thất bại, như phần lớn các dự án dạng này trước đây, thì đây chỉ là một bài PR đắt giá.
Công nghệ: AI agent viết kernel - thiên tài hay ngây thơ?
Về mặt kỹ thuật, Infinity có một lợi thế rõ ràng: họ không cố gắng viết compiler tĩnh cho mọi kiến trúc, mà dùng AI để sinh code động. Điều này cho phép tận dụng sức mạnh học máy để khám phá các không gian tối ưu khổng lồ. Tuy nhiên, thách thức cũng khổng lồ không kém:
- Tính khái quát hóa: Liệu Ignition có thể tạo ra kernel hiệu quả cho đa dạng mô hình (Transformer, MoE, SSM…) và các toán tử phức tạp (FlashAttention, Grouped Query Attention)? Hiện chưa có bất kỳ bằng chứng công khai nào.
- Chi phí huấn luyện chính AI agent: Để Ignition tự tối ưu cho mỗi chip, mỗi mô hình, thậm chí mỗi batch size, cần một lượng lớn tài nguyên tính toán. Chi phí năng lượng và thời gian này có thể trở thành gánh nặng, đặc biệt với các startup chip có vòng đời sản phẩm ngắn.
- Chỉ tập trung inference: Infinity mới chỉ nhắm đến suy luận (inference), không phải huấn luyện (training). Điều này hạn chế phạm vi tối ưu hóa, vì nhiều cải tiến phụ thuộc vào hiểu biết đồ thị tính toán trong quá trình huấn luyện.
Mô hình kinh doanh: Trả tiền theo hiệu suất - con dao hai lưỡi
Không thu phí trước, chỉ chia sẻ lợi ích từ hiệu năng tăng thêm. Đây là một ý tưởng tuyệt vời để thuyết phục khách hàng dùng thử, nhưng ẩn chứa rủi ro:
- Làm sao đo lường công bằng? Không có benchmark thống nhất cho mọi chip, mọi workload. Việc định nghĩa “tăng hiệu suất” và “tiết kiệm chi phí” rất dễ gây tranh chấp.
- Khó mở rộng: Mỗi khách hàng mới đòi hỏi Ignition phải học lại từ đầu trên kiến trúc chip khác nhau. Chi phí biên dịch vụ cao, trái ngược với mô hình phần mềm truyền thống (lợi nhuận gộp cao, chi phí biên thấp).
- Khách hàng duy nhất: Infinity mới chỉ công bố một khách hàng sản xuất là D-Matrix. Con số đó là quá ít để khẳng định thương mại hóa thành công.
Tác động ngành: Đe dọa thực sự hay chỉ là gió?
Trong ngắn hạn (0-18 tháng), tác động của Infinity gần như bằng không. NVIDIA không chỉ có CUDA mà còn cả hệ sinh thái đồ sộ: cuDNN, TensorRT, NeMo, hàng triệu nhà phát triển. Một startup 26 người không thể lay chuyển nó.
Nhưng về dài hạn, nếu Infinity thành công, hậu quả có thể rất sâu rộng: - Các startup chip AI sẽ có phần mềm ngay lập tức, giảm rào cản gia nhập thị trường. - Các nhà cung cấp đám mây (AWS, Azure, GCP) sẽ có thêm đòn bẩy để đàm phán với NVIDIA, sẵn sàng mua chip AMD, Intel hoặc chip tự thiết kế. - Người dùng cuối có thể được hưởng dịch vụ inference giá rẻ hơn nhờ cạnh tranh.
Tuy nhiên, để đạt được điều đó, Infinity cần vượt qua bài toán “con gà và quả trứng”: càng nhiều khách hàng dùng thử, họ càng có nhiều dữ liệu để cải thiện Ignition; nhưng nếu không có khách hàng, thuật toán sẽ mãi dậm chân tại chỗ.
Cạnh tranh: Cuộc chiến với những gã khổng lồ
Infinity không chỉ đối đầu với NVIDIA, mà còn với cả hệ thống compiler mã nguồn mở (MLIR, TVM, XLA) và các startup cùng mục tiêu (Modular AI với ngôn ngữ MoJO). Lợi thế khác biệt duy nhất của họ là “AI agent tự sinh kernel” - nhưng chính xác đó cũng là điểm yếu: không ai biết nó hoạt động thực sự ra sao.
Đội ngũ Infinity (gồm cựu Google Brain) có trình độ cao, nhưng so với đội ngũ hàng nghìn kỹ sư CUDA của NVIDIA hay đội Modular AI do Chris Lattner dẫn dắt, họ vẫn ở thế yếu hơn nhiều.
Định giá và đầu tư: Cược lớn vào niềm tin
Định giá 100 triệu USD cho một công ty chưa có doanh thu đáng kể, 26 người, một khách hàng? Điều này chỉ có thể lý giải bằng kỳ vọng “thay thế CUDA” - một thị trường lên tới hàng chục tỷ USD. Các nhà đầu tư (Touring Capital, cùng các nhà nghiên cứu OpenAI & Anthropic) đặt cược vào tầm nhìn và đội ngũ, chứ không phải số liệu.
Với 15 triệu USD, Infinity có thể sống sót khoảng 18-24 tháng. Nếu trong thời gian đó họ không ký được thêm nhiều khách hàng lớn (AMD, Intel, Google, AWS…) và công bố benchmark ấn tượng, vòng gọi vốn tiếp theo sẽ rất khó khăn.
Rủi ro chính cần theo dõi
- Thất bại kỹ thuật: Ignition không tạo ra kernel đủ nhanh cho phần lớn mô hình phổ biến. Xác suất cao.
- Cạn tiền: Không kịp chứng minh doanh thu, phải bán rẻ hoặc đóng cửa.
- Bị đối thủ lớn đè bẹp: NVIDIA hoặc AMD ra mắt sản phẩm AI compiler tương tự với nguồn lực khổng lồ.
Tín hiệu cần quan sát
- 3 tháng tới: Infinity có tham gia MLPerf Inference không? Có benchmark công khai so với CUDA không?
- 6 tháng tới: Có hợp tác với các hãng chip lớn (AMD, Intel, Google) không?
- 12 tháng tới: Tuyển dụng - họ có thuê thêm kỹ sư compiler (không chỉ AI researcher) không?
- 18 tháng tới: Thông tin về giá trị hợp đồng trung bình (ACV) có được tiết lộ không?
Kết luận
Infinity là một canh bạc táo bạo vào một trong những vấn đề khó nhất của ngành AI hiện tại: làm sao để chip không phải của NVIDIA cũng có thể chạy được AI một cách hiệu quả. Ý tưởng tuy đẹp, công nghệ có cơ sở, nhưng khoảng cách giữa demo và sản phẩm đại trà là vô cùng lớn. Nếu bạn là nhà đầu tư mạo hiểm, đây có thể là cơ hội 100x; nếu bạn là người dùng, hãy chờ cho đến khi thấy kết quả trên MLPerf. Còn với NVIDIA, có lẽ họ chưa cần lo lắng - ít nhất là trong 2 năm tới.