Context: Khi câu chuyện “dữ liệu của tôi” sụp đổ

Phan Việt Hàng ngày

{ "title": "EU mở két sắt dữ liệu Google: Cơ hội vàng cho dữ liệu phi tập trung?", "article": "# Bạn đã sẵn sàng cho một cuộc chơi mới?

Tuần trước, Ủy ban châu Âu ra lệnh cho Google chia sẻ dữ liệu tìm kiếm và mở Android cho các đối thủ AI. Không phải đề nghị, không phải đàm phán. Một mệnh lệnh có hiệu lực ngay lập tức.

Đối với một kẻ săn narrative như tôi, đây không chỉ là một quyết định pháp lý. Đây là khoảnh khắc câu chuyện về “dữ liệu là tài sản riêng” bị xé toang. Và trong đống đổ nát đó, một mảnh ghép mới đang lóe sáng: cơ hội cho những hệ thống dữ liệu phi tập trung – thứ mà blockchain đã hứa hẹn suốt 10 năm qua nhưng chưa bao giờ có lý do thực sự thuyết phục để tồn tại.

EU đang sử dụng Digital Markets Act (DMA) – một bộ luật tiền-kiểm soát – để buộc Google chia sẻ dữ liệu tìm kiếm với bất kỳ đối thủ AI nào muốn chơi. Android cũng phải mở cửa cho các ứng dụng và cửa hàng bên thứ ba mà không bị Google Play kiểm soát.

Hãy nhớ lại: Trước đây, Google luôn nói dữ liệu tìm kiếm là “bí mật thương mại”. Họ dùng nó để huấn luyện AI của riêng mình – Gemini, Bard, và giờ là một thế hệ AI đa phương thức. Bất kỳ ai muốn cạnh tranh đều phải xây dựng từ số không, hoặc trả tiền cho các bộ dữ liệu rẻ hơn như Common Crawl.

Nhưng DMA thay đổi luật chơi. Giờ đây, Google phải cung cấp API dữ liệu tìm kiếm thời gian thực cho bất kỳ ai muốn đào tạo AI tìm kiếm. Và Android phải cho phép người dùng gỡ bỏ Google Search, Chrome, Play Store và cài đặt bất kỳ thứ gì họ muốn.

Nghe có vẻ như một chiến thắng cho sự cạnh tranh. Nhưng hãy nhìn kỹ hơn: dữ liệu vẫn do Google kiểm soát. Họ sẽ quyết định API trông như thế nào, dữ liệu nào được chia sẻ, và ai được truy cập. Một API “công bằng” theo định nghĩa của Google vẫn có thể chứa hàng trăm cái bẫy – độ trễ, thiếu trường dữ liệu quan trọng, hoặc các điều khoản sử dụng ngăn chặn việc tạo ra sản phẩm cạnh tranh thực sự.

Đây là lúc câu chuyện “dữ liệu phi tập trung” bước vào.

Core: Cơ chế dữ liệu tập trung – lỗ hổng AI và cơ hội blockchain

Khi tôi bắt đầu theo dõi thị trường dữ liệu AI năm 2022, tôi thấy một nghịch lý: Các mô hình AI lớn nhất thế giới (GPT-4, Gemini, Claude) đều được huấn luyện trên dữ liệu do một vài công ty kiểm soát. OpenAI dùng dữ liệu từ web và partner, Google dùng dữ liệu tìm kiếm của chính nó, Anthropic dùng dữ liệu tổng hợp và sách.

Nhưng mỗi bên đều giữ dữ liệu trong két sắt riêng. Kết quả? Một thị trường AI bị phân mảnh, nơi chất lượng mô hình phụ thuộc vào lượng dữ liệu độc quyền mà công ty đó sở hữu. Người dùng không có quyền chọn lựa – họ chỉ có thể dùng AI của công ty đã thu thập dữ liệu của họ.

EU đang cố gắng phá vỡ sự độc quyền này. Nhưng giải pháp của họ – yêu cầu một công ty trung tâm chia sẻ dữ liệu – chỉ là một băng cá nhân trên vết thương hở. Nó không giải quyết được vấn đề gốc: ai sở hữu dữ liệu, ai kiểm soát quyền truy cập, và ai được hưởng lợi từ giá trị AI sinh ra.

Đây là lý do tại sao các giao thức dữ liệu phi tập trung như Ocean Protocol, Filecoin (với tính năng tính toán trên dữ liệu), và các thị trường dữ liệu dựa trên blockchain đang trở nên hấp dẫn. Họ cung cấp một cơ chế nơi:

  • Dữ liệu không bị giữ trong két sắt của một công ty. Nó được mã hóa và lưu trữ trên mạng lưới phi tập trung.
  • Quyền truy cập được kiểm soát bởi hợp đồng thông minh, không phải bởi quyết định của CEO. Bất kỳ ai đáp ứng điều kiện (thanh toán, cung cấp bằng chứng sử dụng) đều có thể truy cập.
  • Giá trị được phân phối lại cho người tạo ra dữ liệu thông qua token. Không còn cảnh một công ty bán dữ liệu của bạn và giữ toàn bộ lợi nhuận.

Hãy tưởng tượng một kịch bản: Thay vì Google quyết định API nào là “công bằng”, một giao thức phi tập trung cho phép bất kỳ ai đóng góp dữ liệu tìm kiếm (ví dụ: các website, người dùng cá nhân) và bất kỳ ai muốn đào tạo AI đều có thể mua quyền truy cập thông qua token. Không cần sự cho phép. Không cần luật sư.

Tất nhiên, đó là tầm nhìn. Thực tế còn nhiều rào cản kỹ thuật: chi phí lưu trữ, băng thông, và đặc biệt là vấn đề bảo mật tính toán. Nhưng với sự phát triển của zk-proofs và trusted execution environments (TEE), những rào cản này đang dần được tháo gỡ.

Contrarian: Tại sao “mở” theo kiểu EU vẫn là tập trung?

Nhiều người sẽ nói: “EU đã mở đường cho AI cạnh tranh. Giờ thì Perplexity AI, You.com, và cả Google đối thủ có thể truy cập dữ liệu ngang nhau.”

Nhưng hãy suy nghĩ ngược: Ai sẽ quyết định API trả về dữ liệu gì? Google. Ai sẽ quyết định tốc độ, độ chính xác, và chi phí? Google. Ai có thể thay đổi API bất kỳ lúc nào với lý do “bảo mật”? Google.

Đây là lý do tôi gọi quyết định này bằng một cái tên khác: tập trung hóa có kiểm soát. Nó không phá vỡ sự độc quyền dữ liệu, nó chỉ buộc người độc quyền phải cho người khác mượn chìa khóa một chút. Nhưng nếu người mượn làm phiền, họ có thể bị lấy lại chìa khóa bất cứ lúc nào.

Hãy nhìn vào lịch sử: Năm 2009, EU buộc Microsoft phải cung cấp cho người dùng Windows lựa chọn trình duyệt. Kết quả? Internet Explorer vẫn thống trị nhiều năm, và cuối cùng là Edge ra đời. Việc “mở” không tự động tạo ra cạnh tranh công bằng nếu người nắm quyền kiểm soát vẫn là trọng tài và cầu thủ cùng lúc.

Những gì thị trường thực sự cần là một lớp trung gian không thể bị kiểm soát bởi bất kỳ công ty nào. Một lớp dữ liệu phi tập trung, nơi quyền truy cập được xác định bởi mã nguồn mở, không phải bởi quyết định của ủy ban.

Đây là điểm mù của giới phân tích: Họ tập trung vào “EU thắng, Google thua” nhưng bỏ qua câu hỏi cốt lõi: Ai sẽ sở hữu dữ liệu trong kỷ nguyên AI? Nếu câu trả lời vẫn là “một vài công ty”, thì dù có DMA đến đâu, chúng ta vẫn chỉ thay thế một ông vua bằng một hội đồng quý tộc, chứ không phải trao quyền cho dân chúng.

Takeaway: Câu chuyện tiếp theo

Tôi không nghĩ EU sẽ thất bại trong việc tạo ra cạnh tranh AI tạm thời. Các đối thủ như Perplexity AI chắc chắn sẽ hưởng lợi từ dữ liệu Google. Nhưng đó là một lợi ích ngắn hạn. Trong dài hạn, một hệ thống dữ liệu phụ thuộc vào lòng tốt của kẻ thống trị sẽ không bao giờ bền vững.

Tôi đặt cược vào các giao thức dữ liệu phi tập trung. Không phải vì tôi tin vào blockchain một cách mù quáng, mà vì tôi thấy một nhu cầu thực sự: khi AI trở nên mạnh mẽ hơn, giá trị của dữ liệu sẽ tăng theo cấp số nhân. Ai kiểm soát dữ liệu sẽ kiểm soát tương lai. Và nếu chúng ta không muốn tương lai đó nằm trong tay một nhóm nhỏ, chúng ta cần một cơ sở hạ tầng mới – một nơi dữ liệu thuộc về tất cả mọi người.

Câu hỏi duy nhất còn lại: Ai sẽ xây nó?" , "tags": ["DMA", "dữ liệu phi tập trung", "EU vs Google", "AI và blockchain", "thị trường dữ liệu"], "prompt": "Minh họa một két sắt dữ liệu khổng lồ bị mở ra bởi một bàn tay khổng lồ (EU), bên trong là các dòng dữ liệu chảy ra ngoài, nhưng lại được điều khiển bởi một robot có logo Google. Phía nền là một mạng lưới các nút blockchain màu xanh kết nối với nhau, tạo cảm giác tương phản giữa tập trung và phi tập trung." }