Hook: Ngày 7 tháng 7 năm 2026, một thông báo từ Alibaba Cloud đã làm rung chuyển giới AI infrastructure: họ chính thức ra mắt siêu nút AI computing đầu tiên trên nền tảng công cộng – Lingjun Zhenwu M890 Super Node Instance. Nhưng đừng để cái tên hoành tráng đánh lừa bạn. Điều thực sự đáng chú ý không phải là 'super' hay 'node', mà là con số 64 và 800 GB/s. 64 GPU kết nối trong một node duy nhất với băng thông 800 GB/s giữa các card. Đây là bước tiến đưa khả năng suy luận mô hình nghìn tỷ tham số từ phòng thí nghiệm vào tay các doanh nghiệp.
Context: Tại sao là lúc này? Khi các mô hình ngôn ngữ lớn (LLM) chạm đến quy mô nghìn tỷ tham số, việc suy luận trở thành bài toán hạ tầng đau đầu nhất. Một mô hình MoE (Mixture of Experts) với hàng nghìn expert cần phân tán các expert khác nhau trên nhiều GPU, đồng thời đồng bộ hóa thông tin qua lại. Giải pháp truyền thống là xây dựng cluster riêng với InfiniBand hoặc NVLink, nhưng chi phí và độ phức tạp kỹ thuật là rào cản lớn. Alibaba Cloud giải quyết vấn đề bằng cách đóng gói 64 GPU – được kết nối qua chip ICNSwitch 1.0 tự phát triển – thành một instance cloud có sẵn, hỗ trợ cả FP8 và FP4. Đây là lần đầu tiên một siêu nút với băng thông cỡ này được cung cấp dưới dạng dịch vụ công cộng, thay vì chỉ dành cho các siêu máy tính nội bộ.
Core: Trọng tâm kỹ thuật nằm ở chip ICNSwitch 1.0. Theo thông tin từ bài viết phân tích, con chip này cho phép kết nối 64 card với băng thông 800 GB/s mỗi card, vượt xa các giải pháp hiện tại như NVLink của NVIDIA (600 GB/s cho H100) hay EFA của AWS (400 Gbps per node). Điều này giải quyết bottleneck chính trong suy luận MoE: giao tiếp giữa các expert. – Root: Kinh nghiệm phát hiện: khi audit các hệ thống phân tán, tôi nhận thấy rằng tắc nghẽn thường đến từ mạng, không phải từ compute. Alibaba Cloud đã chọn cách tấn công trực diện vào điểm yếu đó bằng chip tự phát triển. Ngoài ra, hỗ trợ FP8 và FP4 cho thấy instance này được tối ưu cho kỹ thuật lượng tử hóa, giảm tải bộ nhớ và tăng throughput. Mỗi mùa hè DeFi đều có một bài học về việc đánh giá thấp băng thông; lần này, bài học đến từ AI infrastructure. Instance hiện chỉ có sẵn dưới dạng invited test tại trung tâm dữ liệu Ulanqab (Nội Mông), nơi có khí hậu mát mẻ và giá điện thấp – một lựa chọn chiến lược để kiểm soát chi phí vận hành.
Contrarian: Góc nhìn phản trực giác: mặc dù được quảng bá là 'siêu nút cho suy luận MoE nghìn tỷ tham số', thực tế thị trường cho các mô hình cỡ này cực kỳ hạn hẹp. Chỉ có vài công ty trên thế giới (ví dụ Anthropic, Google DeepMind, một số lab Trung Quốc) đang vận hành mô hình trên 1 nghìn tỷ tham số. Nếu Alibaba Cloud không mở rộng hỗ trợ xuống các mô hình 100-500 tỷ tham số (vốn phổ biến hơn), instance này có nguy cơ trở thành 'cỗ máy đắt tiền ít người dùng'. Hơn nữa, sự phụ thuộc vào GPU thế hệ mới nhất (có thể là NVIDIA H200 hoặc AMD MI400) khiến nó dễ bị tổn thương trước các lệnh cấm xuất khẩu. Cuộc chơi thực sự nằm ở việc Alibaba Cloud có thể thuyết phục được bao nhiêu khách hàng rằng họ thực sự cần 64 GPU trong một node, thay vì chạy inference trên 8 GPU với pipeline parallelism.
Takeaway: Điều tôi sẽ theo dõi sát nhất trong 3 tháng tới: liệu có khách hàng lớn nào (như Zhipu AI, Baichuan) công bố sử dụng M890 cho suy luận production không? Nếu không, instance này có thể chỉ là một bản proof-of-concept để Alibaba Cloud thử nghiệm công nghệ ICNSwitch, chờ ngày giá thành giảm và phần mềm tối ưu hơn. Còn nếu có, chúng ta sẽ chứng kiến sự khởi đầu của một cuộc đua mới: ai là người đầu tiên mang siêu máy tính AI lên cloud với giá phải chăng.