Thị trường blockchain chứng kiến một cuộc cạnh tranh âm thầm nhưng quyết liệt khi hai nền tảng AI hàng đầu – Claude Cowork và OpenAI Codex – đồng loạt ra mắt tính năng "Ghi kỹ năng" (Record a Skill). Đây không phải là một đột phá về kiến trúc mô hình, mà là một sự kết hợp kỹ thuật ở cấp độ sản phẩm: tích hợp ghi màn hình, nhận diện giọng nói, theo dõi thao tác chuột và bàn phím, sau đó chuyển đổi thành các quy trình làm việc có thể tái sử dụng. Trong bối cảnh blockchain đang tìm kiếm các công cụ phi tập trung hóa quy trình vận hành, động thái này mở ra một hướng đi mới: AI Agent có thể trở thành lớp trung gian "không cần tin tưởng" giữa con người và smart contract.
Context — Giao thức và bối cảnh phi tập trung hóa tự động hóa
Trước đây, việc tạo ra một tác nhân tự động trên blockchain (ví dụ: bot giao dịch DeFi, trình thu thập dữ liệu NFT, hoặc quy trình kiểm toán tự động) yêu cầu kỹ năng lập trình solidity hoặc Python, cùng với hiểu biết sâu về API của các giao thức. Những công cụ như Ethers.js, Web3.py, hay các nền tảng low-code như Tenderly vẫn đòi hỏi người dùng phải viết script hoặc cấu hình phức tạp. Tính năng "Ghi kỹ năng" thay đổi điều đó: người dùng chỉ cần thực hiện một quy trình trên màn hình (ví dụ: kết nối ví MetaMask, swap trên Uniswap, kiểm tra số dư trên Etherscan) trong khi Claude ghi lại toàn bộ thao tác, giọng nói và kết quả. Kết quả là một "Kỹ năng" – thực chất là một prompt có cấu trúc chứa mã script, selector UI, và hướng dẫn bằng ngôn ngữ tự nhiên – có thể được tái sử dụng với một cú nhấp chuột.
Core — Phân tích kỹ thuật và giá trị: Từ hành vi sao chép đến chiến lược có điều kiện

Về mặt kỹ thuật, đây là ứng dụng của "Học bắt chước hành vi" (Behavioral Cloning) trong lĩnh vực AI Agent desktop. Mô hình đa phương thức (như Claude 3.5 hoặc GPT-4o) nhận đầu vào video, âm thanh, và dữ liệu đầu vào/đầu ra, sau đó học một chính sách (policy) có điều kiện để tái tạo hành động trong môi trường giao diện người dùng cụ thể. Đối với blockchain, điều này có nghĩa là AI có thể tự động thực hiện các tác vụ lặp đi lặp lại như: đọc dữ liệu on-chain trên các block explorer, ký giao dịch qua ví phần cứng, hoặc tương tác với nhiều dApp mà không cần lập trình.
Tuy nhiên, thách thức lớn nhất là tính mạnh mẽ khi môi trường thay đổi. Trong blockchain, giao diện của các dApp thay đổi thường xuyên (do nâng cấp UI, thay đổi contract address, hoặc hard fork). Một kỹ năng được ghi trên Uniswap v2 sẽ không thể chạy trên Uniswap v3 nếu bố cục nút khác nhau. Giải pháp tiềm năng là sử dụng ngữ nghĩa hóa – AI dựa vào ý nghĩa của các thành phần giao diện (ví dụ: tìm nút có chữ "Swap" thay vì tọa độ pixel) – nhưng điều này đòi hỏi khả năng hiểu hình ảnh rất cao. Các nhóm phát triển như Anthropic và OpenAI đang đầu tư mạnh vào lĩnh vực này, nhưng độ tin cậy vẫn chưa được công bố chính thức.
Một điểm thú vị khác là chi phí suy luận. Khi chạy một kỹ năng, AI phải liên tục xử lý ảnh chụp màn hình, hiểu ngữ cảnh, và quyết định hành động tiếp theo. Điều này tiêu tốn tài nguyên GPU gấp 10-100 lần so với ghi lại. Đối với các tác vụ blockchain phức tạp (ví dụ: chạy bot thanh lý trên Aave hoặc theo dõi mempool), chi phí này có thể vượt quá lợi nhuận thu được, đặc biệt trong thị trường giảm hiện tại. Các operator cần cân nhắc kỹ lưỡng về kinh tế học đơn vị trước khi triển khai AI Agent deskto cho DeFi tự động.

Contrarian — Góc nhìn ngược: "Phân mảnh thanh khoản" không phải vấn đề thực, nhưng AI Agent mới là vấn đề
Nhiều người cho rằng tính năng này sẽ "dân chủ hóa" việc tạo bot giao dịch và giảm sự phụ thuộc vào các nhà phát triển. Tuy nhiên, tôi cho rằng điều này có thể tạo ra một lớp rủi ro mới: sự gia tăng của các tác nhân tự động không được kiểm toán. Trong quá khứ, các bot được viết bởi lập trình viên thường có kiểm tra biên, xử lý lỗi và giới hạn rủi ro. Một kỹ năng được ghi lại từ người dùng không chuyên có thể bỏ qua các bước quan trọng như kiểm tra slippage, xác nhận gas price, hoặc ký giao dịch an toàn. Hậu quả có thể là mất tài sản do trượt giá hoặc tấn công sandwich.
Hơn nữa, "phân mảnh thanh khoản" – một narrative được các VC thổi phồng – thực ra không phải là vấn đề cốt lõi. Các giao thức như Uniswap v3 đã chứng minh thanh khoản tập trung hiệu quả. Vấn đề thực sự là sự thiếu tin cậy trong tương tác cross-chain và multi-protocol. AI Agent có khả năng ghi lại quy trình trên nhiều nền tảng và tái tạo nó, nhưng nếu không có cơ chế xác thực phi tập trung (ví dụ: sử dụng oracle để xác minh hành động), thì kết quả vẫn chỉ là "tự động hóa có kiểm soát" chứ không phải "không cần tin tưởng". Điều này làm suy yếu tuyên bố về tính phi tập trung mà blockchain hướng tới.

Takeaway — Tầm nhìn tiến bộ: Cần một lớp trừu tượng hóa mới cho blockchain
Cuộc đua "Ghi kỹ năng" này sẽ định hình cách chúng ta tương tác với blockchain trong 2–3 năm tới. Thay vì viết hợp đồng thông minh, người dùng có thể "dạy" AI cách thực hiện các quy trình phức tạp thông qua trình diễn. Nhưng để điều này trở nên an toàn và hiệu quả, chúng ta cần một tiêu chuẩn mới: một định dạng kỹ năng có thể kiểm toán, phi tập trung và lưu trữ on-chain dưới dạng NFT hoặc tài sản số. Hãy tưởng tượng một thị trường kỹ năng nơi người dùng có thể mua bán các quy trình đã được kiểm chứng, với cam kết thực thi thông qua mạng lưới oracle và tính toán tin cậy. Đó mới là tầm nhìn xứng đáng với triết lý phi tập trung – nơi AI không chỉ là trợ lý, mà còn là cầu nối đưa con người đến gần hơn với quyền tự chủ tài chính. Câu hỏi đặt ra: liệu Anthropic và OpenAI có đủ kiên nhẫn để xây dựng tầng hạ tầng đó, hay họ sẽ chỉ dừng lại ở công cụ tăng năng suất cho cá nhân?