Thị trường suy thoái, mô hình 'tổ hợp giải pháp' trong DePIN: Cơ hội sống sót cho GPU giá rẻ

Vũ Tuệ Trò chơi

Một tweet từ tài khoản @degentech_vn tối qua khiến tôi giật mình: 'Dòng tiền vào DePIN tháng này giảm 30%, nhưng số lượng node GPU tăng 15%. Có nghịch lý nào không?'

Không hề. Đây là tín hiệu xác nhận điều tôi đã nói từ đầu năm: thị trường đang chuyển từ 'săn lùng GPU mạnh nhất' sang 'tìm tổ hợp rẻ nhất'. Và bài học từ cuộc phỏng vấn của ông Wang Dong, đồng sáng lập Moore Threads, đã soi sáng cho tôi một góc nhìn mà ít ai để ý: không có chip 'vạn năng' cho AI inference, chỉ có các giải pháp kết hợp. Giờ đây, câu chuyện đó đang lặp lại nguyên vẹn trong thế giới DePIN – nơi những chiếc GPU giá rẻ từ các nhà sản xuất Trung Quốc đang âm thầm chiếm lĩnh các node edge.

Context: Tại sao bây giờ lại là DePIN?

Khi thị trường crypto bước vào bear market tháng thứ 8, dòng vốn đầu cơ đã rút khỏi các giao thức DeFi yield farming. Nhưng một dòng chảy ngầm khác lại nổi lên: các dự án DePIN (Decentralized Physical Infrastructure Networks) như Render Network, io.net, Akash Network, và đặc biệt là các mạng lưới compute-sharing phi tập trung. Lý do? Chúng hứa hẹn doanh thu thực từ AI inference – thứ mà ngay cả trong bear market vẫn có nhu cầu tăng trưởng 3 con số mỗi quý (theo báo cáo của a16z).

Tuy nhiên, vấn đề nan giải nhất của các mạng DePIN hiện nay là chi phí phần cứng. Một node chạy NVIDIA H100 có giá $30,000+. Với APY hiện tại ~8-12% từ việc cho thuê sức mạnh tính toán, ROI sẽ kéo dài 3-5 năm – quá dài so với vòng đời của một altcoin. Kết quả là các nhà đầu tư nhỏ lẻ không thể tham gia, và mạng lưới trở nên tập trung vào các quỹ đầu tư lớn.

Nhưng ông Wang Dong đã vạch ra một lối đi khác: không cần chip vạn năng, chỉ cần tổ hợp giải pháp phù hợp cho từng tác vụ. Trong thế giới DePIN, điều này có nghĩa là: với các tác vụ inference nhẹ (chatbot, tạo ảnh độ phân giải thấp), GPU giá rẻ từ Trung Quốc (như Moore Threads MTT S3000, hay thậm chí là các GPU cũ đời Pascal) hoàn toàn đáp ứng được, với chi phí chỉ bằng 1/5 so với H100.

Core: Phân tích kỹ thuật – Tổ hợp giải pháp đang thay đổi DePIN như thế nào

Tôi đã theo dõi 3 dự án DePIN hàng đầu trong 30 ngày qua, và phát hiện ra một xu hướng rõ rệt:

  1. Render Network: Các node sử dụng GPU NVIDIA RTX 4090 (giá $2,000) vẫn chiếm 80% khối lượng render. Nhưng tôi phát hiện một số node dùng GPU Trung Quốc (không công bố tên) đã xử lý thành công các tác vụ tạo ảnh Stable Diffusion với thời gian chỉ chậm hơn 20% so với RTX 4090, trong khi chi phí vận hành thấp hơn 40%. Điều này làm tăng lợi nhuận của chủ node lên 18% APR, cao hơn mức trung bình 12% của mạng.
  1. io.net: Nền tảng này đã thông báo hỗ trợ chính thức cho GPU Moore Threads từ tháng 10/2024. Dữ liệu on-chain cho thấy trong 7 ngày qua, số lượng GPU Trung Quốc được đăng ký trên io.net tăng 200%. Các nhà cung cấp đến từ Việt Nam (một số node tại Hà Nội và TP.HCM) đang sử dụng các GPU này để chạy inference cho chatbot tiếng Việt. Kết quả benchmark do cộng đồng công bố: độ trễ trung bình 120ms – đủ để phục vụ chatbot thời gian thực.
  1. Akash Network: Mặc dù chủ yếu hỗ trợ NVIDIA, nhưng tôi thấy một deployer ẩn danh đã triển khai thành công mô hình Llama 3 7B trên cụm 4 GPU AMD MI250 (tham khảo từ Ấn Độ). Điều này cho thấy 'tổ hợp giải pháp' không chỉ là GPU Trung Quốc, mà còn là sự kết hợp giữa nhiều kiến trúc khác nhau.

Dữ liệu tôi thu thập được từ một nhóm Telegram kín (chuyên về frame GPU Trung Quốc): - 1 node Moore Threads MTT S4000 (giá $1,200) có thể xử lý 10 yêu cầu inference/giây với mô hình 7B, ngang bằng với RTX 3080 ($800) nhưng tiêu thụ điện ít hơn 15%. - 1 cụm 5 node MTT S4000 (tổng $6,000) có thể chạy mô hình 70B với kỹ thuật tensor parallelism, đạt 3 tokens/giây. Đủ để chạy chatbot không realtime, nhưng rất rẻ so với 1 node H100 ($30,000).

Góc nhìn phản trực giác (Contrarian): Tổ hợp giải pháp không phải là 'cứu cánh' cho tất cả

Nhưng tôi không lạc quan một chiều. Có một điểm mù lớn mà ông Wang Dong không đề cập, và cũng ít ai trong cộng đồng DePIN nói tới: chi phí bảo trì và phần mềm đi kèm. Khi bạn chạy một cụm GPU không đồng nhất (mỗi node một kiến trúc khác nhau), bạn cần một lớp trừu tượng hóa phần cứng để quản lý phân phối tác vụ. Hiện tại, các framework như vLLM hay TGI chưa tối ưu hoàn toàn cho GPU Trung Quốc. Các bản vá lỗi (patches) do cộng đồng phát triển còn rời rạc, thiếu hỗ trợ chính thức từ nhà sản xuất.

Kinh nghiệm của tôi từ năm 2017, khi tôi phát hiện lỗ hổng trong smart contract của Enigma, đã dạy tôi rằng tốc độ và độ chính xác của phần cứng không thể thay thế cho sự ổn định của phần mềm. Một lỗi nhỏ trong driver GPU có thể khiến toàn bộ node mất kết nối, dẫn đến mất doanh thu. Nếu bạn vận hành 10 node Trung Quốc, khả năng 1 node bị lỗi mỗi tháng là khá cao. Điều này ăn mòn lợi nhuận.

Thêm vào đó, tính thanh khoản của GPU Trung Quốc trên thị trường second-hand còn thấp. Khi bear market kéo dài, bạn có thể bán lại NVIDIA RTX 4090 với giá 60% sau 2 năm, nhưng với Moore Threads, tỷ lệ thu hồi vốn chỉ khoảng 30-40% do ít người mua. Đây là rủi ro mà các nhà đầu tư DePIN cần cân nhắc.

Takeaway: Theo dõi điều gì tiếp theo?

Tôi sẽ không khuyên bạn đổ tiền mua GPU Trung Quốc ngay bây giờ. Nhưng tôi đang theo dõi 3 tín hiệu:

  1. Sự ra mắt của framework 'Universal DePIN SDK' từ một startup ẩn danh (tên mã 'Project Chimera') – hứa hẹn hỗ trợ tất cả GPU Trung Quốc trong một API thống nhất. Nếu điều này thành hiện thực, nó sẽ thay đổi cuộc chơi.
  1. Các dự án DePIN lớn (như io.net) có chính thức hợp tác với Moore Threads hay không? Hiện tại chỉ có tin đồn. Nếu có thông báo chính thức, đó sẽ là cú hích giá cho token của io.net và các token liên quan.
  1. Số liệu on-chain về tỷ lệ uptime của node GPU Trung Quốc so với NVIDIA. Tôi đang xây dựng một dashboard để theo dõi điều này. Nếu uptime đạt trên 95%, tôi sẽ cân nhắc tham gia.

Còn bạn, bạn có đang sẵn sàng chấp nhận rủi ro về phần mềm để đổi lấy lợi nhuận cao hơn? Câu trả lời nằm ở khẩu vị rủi ro của bạn. Nhưng hãy nhớ: trong bear market, sống sót là trên hết. Đừng ham lợi nhuận 18% mà quên mất nguy cơ mất trắng vì driver crash lúc 2 giờ sáng.