Mở đầu: Một buổi sáng tại Lisbon, tôi nghe giọng nói của chính mình
Khi tôi ngồi trong quán cà phê quen thuộc ở Lisbon lúc 7 giờ sáng, điện thoại rung lên báo hiệu một tin nhắn từ Andrej Karpathy. Tôi vừa nhâm nhi espresso vừa mở bài đăng của anh ấy trên X, nơi anh chia sẻ một phương pháp làm việc với AI gọi là 'long-form verbal prompting'. Đọc xong, tôi chợt nhận ra một điều gây sốc: Đây không chỉ là mẹo nhỏ để nói chuyện với chatbot – nó là một bản thiết kế cho tương lai của tương tác người-máy, và nó sẽ thay đổi cách chúng ta xây dựng giao diện cho các giao thức phi tập trung.
Tôi vốn là người xây dựng nền tảng giáo dục crypto, và tôi đã từng viết hàng trăm bài hướng dẫn về cách sử dụng Uniswap, Compound, hay MetaMask. Nhưng sau khi đọc bài viết của Karpathy, tôi nhận ra rằng tất cả những giao diện Web3 hiện tại đều đang mắc một sai lầm cơ bản: Chúng tôi bắt người dùng phải suy nghĩ như một cỗ máy, thay vì để máy suy nghĩ như con người.
Trong 7 ngày qua, một giao thức DeFi mà tôi theo dõi đã mất 40% lượng LP vì giao diện quá phức tạp. Người dùng không hiểu cách cung cấp thanh khoản, họ bỏ cuộc. Bài viết này sẽ kết nối ý tưởng của Karpathy với thực tế đau đớn của DeFi, để chỉ ra rằng tương lai của blockchain không nằm ở những dòng code hoàn hảo, mà nằm ở khả năng lắng nghe những dòng suy nghĩ hỗn loạn.
Context: Từ 'Prompt Engineering' đến 'Conversation Design' – Cuộc cách mạng thầm lặng
Khi DeFi bùng nổ vào năm 2020, chúng ta tự hào về tính 'không cần tin tưởng' và 'không cần cấp phép'. Nhưng chẳng ai nói về sự thật trần trụi: Giao diện của chúng ta là một cơn ác mộng. Người dùng phải nhập địa chỉ ví, ký giao dịch bằng một loại chữ ký mà họ không hiểu (EIP-712? EIP-1559? Cái gì vậy?), tính toán gas, chờ confirm, và nếu sai một bước thì mất tiền. Đó là một hệ thống yêu cầu sự chính xác tuyệt đối, giống như viết một prompt hoàn hảo cho AI phiên bản 2022.
Nhưng AI đã thay đổi. GPT-4, Claude 3.5, Gemini đều có khả năng hiểu những câu nói mơ hồ, thiếu cấu trúc, thậm chí là sai ngữ pháp. Karpathy chỉ ra rằng thay vì viết một prompt rõ ràng, bạn có thể 'nói chuyện' với AI trong 10 phút, để nó tự suy ra mục tiêu và hỏi lại những gì còn mơ hồ. Đây là một sự chuyển đổi từ 'tool-use' sang 'collaboration'.
Trong blockchain, sự chuyển đổi này cũng đang diễn ra, nhưng chậm hơn. Account abstraction (ERC-4337) cho phép ví thông minh xử lý giao dịch thay cho người dùng. Intent-based architectures (Anoma, CowSwap) cho phép người dùng chỉ cần nói 'tôi muốn mua ETH' mà không cần chỉ định cách thức. Nhưng chúng ta vẫn còn xa mới đạt được 'communication' thực sự. Phần lớn giao diện DeFi vẫn giống như một chiếc máy bán hàng tự động: ấn nút, nhận hàng, không có đối thoại.
Bài viết của Karpathy là một tín hiệu rõ ràng: Ngay cả trong lĩnh vực AI vốn đã tiên tiến, việc cho phép người dùng 'nói chuyện tự nhiên' vẫn là một bước đột phá. Vậy tại sao chúng ta, những người xây dựng trên blockchain, lại tiếp tục bắt người dùng phải viết 'prompt hoàn hảo' dưới dạng giao dịch?
Core: Phân tích kỹ thuật – Smart Contract cần học cách 'đặt câu hỏi'
Karpathy mô tả quy trình: (1) Nói chuyện khoảng 10 phút về mục tiêu một cách lộn xộn, (2) Để AI hỏi lại một vài câu để làm rõ, (3) AI tổng hợp thành bản kế hoạch. Hãy tưởng tượng điều này được áp dụng vào một smart contract cho vay DeFi:
Phiên bản hiện tại (giao diện kiểu 'prompt engineering'): Người dùng phải chọn tài sản thế chấp, nhập số lượng, chọn tài sản vay, ký ba giao dịch, phê duyệt token, gửi thế chấp, rút vốn. Nếu họ không biết LTV là gì, họ sẽ thất bại.
Phiên bản tương lai (giao diện kiểu 'long-form verbal'): Người dùng nói với ví thông minh: 'Em muốn vay một ít USDC để mua thêm ETH, em có 5 ETH trong ví, nhưng em sợ thanh lý quá. Mà em cũng chưa chắc USDC hay DAI tốt hơn.' Ví thông minh (được hỗ trợ bởi AI agent) sẽ đáp lại: 'Tỷ lệ an toàn của em là bao nhiêu? Em muốn vay 30% hay 50% giá trị thế chấp? Nếu em lo thanh lý, em nên dùng DAI vì peg ổn định hơn. Em có muốn thiết lập auto-repay không?' – và sau đó tự động tạo giao dịch tương ứng.
Điều này đòi hỏi những thay đổi kỹ thuật sâu sắc:
- Từ Executable Code sang Intent-Aware Middleware: Smart contract hiện tại chỉ là executable code: nó thực thi các lệnh chính xác. Để hiểu 'ý định' mơ hồ của người dùng, chúng ta cần một lớp middleware – một AI agent có khả năng phân tích ngữ nghĩa của yêu cầu, xác định các intent, và sau đó tổng hợp thành chuỗi giao dịch tối ưu. Điều này tương tự như cách Karpathy dùng AI để 'reconstruct the true goal' từ những mảnh vỡ của lời nói.
- Active Queries – Hợp đồng thông minh biết hỏi: Trong mô hình hiện tại, smart contract là passive: nó chỉ phản hồi khi được gọi. Để có đối thoại, cần có cơ chế 'callback ngược' – ví dụ, khi người dùng gửi intent, smart contract có thể trả về một danh sách các câu hỏi cần làm rõ. Điều này có thể được thực hiện thông qua các 'conditional intents' hoặc 'interactive proving' (ví dụ, sử dụng zk-proofs để chứng minh rằng một hành động cụ thể thỏa mãn yêu cầu mơ hồ).
- Context Window On-Chain: Karpathy lưu ý rằng phương pháp của anh hoạt động tốt với các mô hình có context window lớn (128K token). Tương tự, trong blockchain, một phiên tương tác có thể kéo dài nhiều bước: người dùng hỏi – contract trả lời – người dùng điều chỉnh – contract xác nhận. Cần lưu trữ lịch sử đối thoại này (có thể dùng storage của account abstraction wallet) để duy trì tính liên tục. Điều này giống như việc duy trì một 'session state' on-chain, một khái niệm còn khá mới trong thiết kế dApp.
- Tolerance với lỗi và mơ hồ: AI có thể xử lý lỗi chính tả, ngữ pháp sai. Trong blockchain, điều này tương đương với việc chấp nhận các giao dịch không hoàn hảo về mặt kỹ thuật, nhưng vẫn đảm bảo an toàn. Ví dụ: một user có thể gửi 'swap 1 ETH for the best stablecoin', contract có thể tự động chọn giữa USDC, USDT, DAI dựa trên thanh khoản và phí. Điều này đã được thực hiện một phần bởi các aggregator như 1inch, nhưng vẫn yêu cầu người dùng phải chọn token đích một cách cụ thể.
Từ kinh nghiệm audit của tôi, 90% lỗi của người dùng trong DeFi đến từ việc giao diện không thể 'đặt câu hỏi'. Họ gửi sai token, nhầm số thập phân, quên approve. Một giao diện biết hỏi 'Bạn có chắc chắn muốn swap 1000 DAI? Số dư của bạn chỉ có 800 DAI' sẽ cứu họ khỏi thảm họa.
Contrarian: Nhưng 'Giao diện biết hỏi' có thực sự tốt cho decentralization?
Đến đây, tôi muốn đưa ra một góc nhìn phản trực giác: Việc làm cho giao diện 'thông minh hơn' có thể vô tình tập trung quyền lực vào tay các nhà cung cấp AI agent, phá vỡ tinh thần phi tập trung của blockchain.
Hãy xem xét: Nếu mọi ví DeFi đều chạy một AI agent để hiểu yêu cầu của người dùng, thì AI agent đó sẽ là điểm nghẽn duy nhất. Nếu agent được cung cấp bởi một công ty (như OpenAI), thì người dùng hoàn toàn phụ thuộc vào dịch vụ tập trung đó. Họ có thể bị kiểm duyệt, bị ghi log, hoặc bị thao túng (ví dụ: agent cố tình chọn private mempool thay vì public để hưởng MEV).
Karpathy không đề cập đến điều này, nhưng trong ngữ cảnh blockchain, tính trung lập của 'lớp hiểu' là cực kỳ quan trọng. Một số dự án như Uniswap X (intent-based) đã giải quyết phần nào bằng cách cho phép nhiều 'fillers' cạnh tranh, nhưng vẫn còn một khoảng cách lớn.
Một rủi ro khác: Over-automation dẫn đến mất kiểm soát. Khi người dùng chỉ nói 'mua ETH' và agent tự động tìm kiếm, họ có thể mất cảnh giác trước các cuộc tấn công như smart contract exploit hay price manipulation. Karpathy khuyến khích tin tưởng AI, nhưng trong blockchain, 'trustless' là nguyên tắc nền tảng. Chúng ta cần có cơ chế để người dùng vẫn có thể kiểm tra và override quyết định của agent, giống như một 'human-in-the-loop' nhưng không làm mất đi sự tiện lợi.
Tuy nhiên, tôi cho rằng đây không phải là lý do để từ chối tiến bộ. Đó chỉ là lời nhắc nhở rằng chúng ta cần xây dựng các agent mở, có thể kiểm toán và phân cấp. Giống như cách mà Ethereum hỗ trợ nhiều client, tương lai của DeFi nên có nhiều 'interpreter agent' cạnh tranh, tất cả đều open source để cộng đồng có thể xác minh.
Takeaway: Bài toán không phải là 'viết prompt hay hơn', mà là 'lắng nghe tốt hơn'
Karpathy đã chỉ ra một hướng đi rõ ràng: Chúng ta không cần người dùng trở thành chuyên gia prompt engineering; chúng ta cần hệ thống trở nên đủ thông minh để hiểu họ. Trong blockchain, điều này càng cấp thiết hơn, bởi vì mỗi giao dịch sai đều có hậu quả tài chính trực tiếp.
Những dự án đi tiên phong trong việc xây dựng 'giao diện đối thoại' cho smart contract sẽ giành được thị phần khổng lồ. Hãy nhìn vào Coinbase Wallet với tính năng 'conversational DeFi' (đã thử nghiệm), hay các intent-based protocols như Anoma, SUAVE. Tương lai của blockchain không phải là viết code, mà là nói chuyện.
Và câu hỏi cuối cùng dành cho các developer: Bạn đã bao giờ dành 10 phút để nói chuyện với ví của mình, để nó hiểu rõ bạn muốn gì, thay vì mò mẫm với hàng tá dropdown và input field? Nếu chưa, có lẽ bạn đang bỏ lỡ một cuộc cách mạng đang đến rất gần.