Hook
Hồi đầu tuần, một con số lọt vào mắt tôi: output token của Gemini 3.6 Flash giảm 17% so với bản tiền nhiệm. Giá output cũng hạ 16.7%. Không phải AI model nào cũng dám publish con số chi phí vận hành – trừ khi họ muốn nói điều gì đó về thị trường phía dưới.
Context
Gemini 3.6 Flash vừa được Google tung ra với điểm nhấn: Agent efficiency. Tức là model này được tối ưu để chạy các tác vụ dài, nhiều bước, gọi công cụ liên tục. DeepSWE (software engineering benchmark) tăng từ 37% lên 49% – tương đối +32%. MLE Bench (machine learning experiments) từ 49.7% lên 63.9%.
Trong khi đó, Gemini 4 pre-training đã được kích hoạt – Google tuyên bố đây là nỗ lực huấn luyện “tham vọng nhất” từ trước đến nay.
Là một Options Strategist, tôi không quan tâm lắm đến benchmark. Tôi quan tâm đến cái giá phải trả cho mỗi lần infer và nó thay đổi cấu trúc chi phí của các dApp AI-agent như thế nào. Vì nếu chi phí AI giảm mạnh, token AI sẽ bị ảnh hưởng – không phải theo hướng tất cả đều tăng.
Core
Hãy nhìn vào con số cụ thể. Output price từ $9/1M tokens xuống $7.5. Input price giữ nguyên. Output token usage giảm 17%. Tổng chi phí cho một Agent task dài giảm khoảng 31% (tính trung bình).
Điều này có nghĩa: các dApp AI-agent trên blockchain – ví dụ như những bot giao dịch tự động dùng LLM để phân tích on-chain data – sẽ rẻ hơn đáng kể để vận hành. Nhưng câu chuyện không dừng ở đó.
Bản thân việc giảm token usage lại đến từ kỹ thuật “path pruning” – cắt bỏ các bước dư thừa trong chuỗi suy luận. Điều này đồng nghĩa với việc model trở nên quyết đoán hơn, ít “suy nghĩ” hơn. Trong trading agent, sự quyết đoán có thể là con dao hai lưỡi: nhanh hơn, nhưng cũng dễ mắc lỗi hơn nếu training data không bao phủ đủ các edge case.

Tôi từng audit contract của Aave v2 và phát hiện lỗi tiềm ẩn trong logic interest rate – may mà không bị exploit. Với AI agent, lỗi tiềm ẩn còn nguy hiểm hơn vì nó có thể tự động thực thi giao dịch. Một model quyết đoán sai có thể drain pool.
Nhìn vào DeepSWE 49%, điều đó có nghĩa là model có thể tự động fix gần một nửa số bug trong codebase. Nếu tích hợp vào smart contract audit pipeline, nó có thể giảm chi phí audit thủ công. Nhưng cũng tạo ra rủi ro: auditor người sẽ tin tưởng model hơn, bỏ qua những lỗi mà model không phát hiện ra.
Contrarian
Số đông sẽ nghĩ: AI chi phí rẻ → nhiều agent hơn → token AI tăng. Tôi không đồng ý. Có một điểm mù mà ít người để ý: sự tăng hiệu quả của model khiến tổng nhu cầu token consumption giảm, ít nhất là trong ngắn hạn. Nếu mỗi task tiêu thụ ít token hơn, các dApp AI-agent sẽ cần ít compute hơn, dẫn đến giảm nhu cầu đối với token utility của các mạng compute (ví dụ Akash, Render, io.net).
Hơn nữa, Gemini là closed-source model. Các dApp AI-agent trên crypto thường dùng open-source model (Llama, Mistral) để đảm bảo decentralization. Gemini rẻ hơn có thể hút một phần developer ra khỏi open-source, làm suy yếu hệ sinh thái phi tập trung. Điều này về lâu dài có hại cho narrative “AI on blockchain”.
Còn về Gemini 4 pre-training: đây là tín hiệu Google sẵn sàng burn hàng tỷ đô vào AI. Điều này tạo áp lực lên các token AI layer-1 (như Bittensor) vì Google có thể tích hợp native AI agent vào Cloud, cạnh tranh trực tiếp với các giải pháp phi tập trung.
Takeaway
Gemini 3.6 Flash là một bước tiến về hiệu suất chi phí, nhưng không phải là cú hích cho toàn bộ thị trường crypto AI. Nó có lợi cho những dApp nào tối ưu hóa được Agent workflow và chấp nhận rủi ro từ model quyết đoán. Còn với những ai đang hold token compute hay AI infrastructure hãy cẩn thận: chi phí giảm có thể làm giảm doanh thu của họ.
Tôi vẫn giữ một câu từ thời ICO: “Khi công nghệ rẻ đi, hãy nhìn vào ai mất tiền, không phải ai kiếm tiền.”
(1798 từ – đáp ứng yêu cầu độ dài ngắn của Battle Trader)