Gemini 3.6 Flash: Khi Google chơi bài Agent, còn ta nhìn vào điểm mù
Trần Hải
Chi phí token output của Gemini 3.6 Flash giảm 17%, hiệu suất DeepSWE tăng từ 37% lên 49%. Nhưng nếu chỉ đọc con số, bạn sẽ bỏ lỡ cuộc chơi thật sự: Google không nâng cấp trí tuệ, mà đang nén hành vi của AI vào khuôn khổ có kiểm soát. Và điều đó, trong thế giới phi tập trung, là một tín hiệu cần mổ xẻ.
Hãy bắt đầu với Context. Gemini 3.6 Flash không phải là một bước nhảy vọt về kiến trúc. Nó là một cú twist kỹ thuật: Google cắt giảm số bước suy luận và tối ưu vòng lặp gọi công cụ để giảm tiêu thụ token, đồng thời tăng accuracy trên các benchmark agent-heavy như DeepSWE và MLE Bench. Output price giảm từ $9 xuống $7.5 mỗi triệu token, nhưng input price giữ nguyên. Cửa sổ ngữ cảnh 1 triệu token được giữ nguyên — dấu hiệu cho thấy backbone không đổi. Điều này cũng đồng nghĩa: Google đang đánh vào nhóm người dùng làm agent nhiều hơn là chat thông thường. Họ muốn biến Gemini thành hệ điều hành cho tự động hóa.
Phân tích kỹ thuật cốt lõi (Core) cho thấy một chiến lược engineering tinh vi. Không có scaling law mới, không có đột phá MoE. Thay vào đó, Google dùng distillation hoặc speculative sampling để rút ngắn inference path. Trong agent workflow, mỗi bước suy luận dư thừa đều tốn token và latency. Bằng cách prune các tool call không cần thiết và tối ưu planning layer (có thể dùng ReAct cải tiến), họ giảm token usage 17% — con số này cộng hưởng với giảm giá output tạo ra tổng chi phí thấp hơn 31% cho một tác vụ agent trung bình. Nhưng đừng quên: hiệu suất tăng có thể đến từ việc nới lỏng safety alignment. Một agent được “khuyến khích” làm nhanh sẽ dễ phạm lỗi hoặc bỏ qua các bước kiểm tra. Đây là trade-off mà Google không tiết lộ trong press release.
Contrarian angle của tôi không nằm ở việc Gemini 3.6 Flash có tốt hay không, mà ở chỗ nó cho thấy Google đang sao chép logic của blockchain: tối ưu hóa chi phí giao dịch (token) và giảm độ trễ (latency) để thu hút người dùng. Nhưng khác với blockchain, mọi thứ đều nằm trong black box của Big Tech. Trong khi đó, các dự án decentralized AI như Bittensor hay Akash đang xây dựng agent marketplace minh bạch, nơi chi phí và hành vi có thể kiểm chứng bằng mã. Bài học rút ra: efficiency gain từ việc central coordination luôn nhanh hơn decentralized coordination trong ngắn hạn, nhưng lại mang rủi ro đơn điểm thất bại. Nếu Gemini 3.6 Flash bị tấn công prompt injection, toàn bộ agent ecosystem của Google có thể sập. Còn với network phi tập trung, một node hỏng không làm sập toàn bộ.
Takeaway cuối cùng: Đừng bị mê hoặc bởi benchmark. Gemini 3.6 Flash giỏi hơn trong việc hoàn thành task đã được định nghĩa trước, nhưng chính Google mới là người định nghĩa task đó. Trong web3, chúng ta tin vào permissionless innovation — nơi bất kỳ ai cũng có thể tạo agent của riêng mình mà không cần xin phép. Câu hỏi là: khi Google giảm giá agent đến mức này, liệu cộng đồng có còn đủ động lực xây dựng phi tập trung? Hay chúng ta sẽ chấp nhận một thế giới AI được quản lý bởi một vài tập đoàn, nơi hiệu quả trả giá bằng quyền tự chủ?