Hook
Cứ tưởng rằng tự động hóa quy trình phát triển blockchain đòi hỏi phải viết script phức tạp, hóa ra chỉ cần… trình diễn. Anthropic vừa tung ra tính năng “Record a skill” trong Claude Cowork, cho phép người dùng ghi lại màn hình, thao tác chuột, bàn phím và giọng nói để tạo ra một kỹ năng có thể tái sử dụng. Điều trớ trêu: OpenAI cũng ra mắt bản sao y hệt với tên gọi Codex chỉ trong cùng tuần. Hai gã khổng lồ AI đang đua nhau xây dựng “người thợ máy” cho desktop, nhưng liệu nó có thực sự an toàn cho thế giới phi tập trung?
Context
Blockchain vốn là ngành của những dòng lệnh và hợp đồng thông minh bất biến. Nhưng quy trình phát triển — từ viết code, compile, deploy lên testnet, đến kiểm tra bảo mật — vẫn là công việc thủ công, lặp đi lặp lại. Các công cụ RPA (Robotic Process Automation) truyền thống như UiPath từng hứa hẹn tự động hóa, nhưng yêu cầu lập trình viên chuyên nghiệp thiết kế luồng công việc. Giờ đây, Claude và Codex mang đến một cách tiếp cận khác: bắt chước hành vi (behavioral cloning) — ghi lại toàn bộ tương tác GUI, phân tích đa phương thức (hình ảnh, âm thanh, thao tác), và tạo ra một “Skill” có thể thực thi lại bất cứ lúc nào.
Tính năng này hiện có sẵn cho các gói Pro, Max và Team của Claude, còn Codex thì tích hợp trong môi trường phát triển. Cả hai đều hướng đến đối tượng người dùng kỹ thuật và phi kỹ thuật, nhưng sự khác biệt nằm ở cách họ “gói gọn” khả năng của mô hình ngôn ngữ lớn (LLM) vào một sản phẩm cụ thể.
Core
Kỹ thuật: Lột xác từ mô hình thành sản phẩm
Về mặt kỹ thuật, “Record a skill” không phải là đột phá về kiến trúc mô hình. Đó là kỹ thuật kết hợp (combinatorial innovation) giữa các module có sẵn: ghi màn hình → nhận dạng giao diện (OCR + visual grounding) → hiểu giọng nói (ASR) → suy luận ý định (LLM) → sinh hành động (code execution). Từ góc nhìn blockchain, nếu ta áp dụng điều này vào quy trình phát triển smart contract, một lập trình viên có thể ghi lại các bước: mở Remix IDE → kết nối MetaMask → compile → deploy → kiểm tra event log. Kết quả là một Skill có thể tái tạo toàn bộ pipeline đó chỉ bằng một lệnh gọi.
Tuy nhiên, sự tinh tế nằm ở phần “Skill” — nó không đơn thuần là file video lưu lại, mà là một prompt có cấu trúc chứa hướng dẫn tự nhiên, script (Python/Bash), bộ chọn UI element, và các đường dẫn tài nguyên. Khi thực thi, Claude phân tích prompt đó và sinh ra kế hoạch hành động động, thích ứng với trạng thái màn hình hiện tại. Điều này có nghĩa là Skill có khả năng tổng quát hóa — không chỉ replay máy móc, mà còn hiểu ngữ cảnh để điều chỉnh.
Thương mại: Chiến tranh tính năng giữa hai “ông lớn”
Cả Anthropic và OpenAI đều hiểu rằng giá trị thực sự nằm ở việc khóa người dùng vào hệ sinh thái. Bằng cách cho phép tạo Skill miễn phí trong gói trả phí, họ khuyến khích người dùng đầu tư thời gian xây dựng thư viện Skill cá nhân. Một khi đã có hàng trăm Skill ghi lại quy trình làm việc hàng ngày, việc chuyển sang nền tảng khác sẽ trở nên đắt đỏ. Đây là chiến lược tăng trưởng dựa trên chi phí chuyển đổi (switching cost) — một chiến thuật kinh điển trong SaaS.
Đối với thị trường blockchain, các công ty phát triển dApp có thể tạo Skill chuẩn hóa cho quy trình CI/CD (Continuous Integration/Continuous Deployment) của riêng họ. Ví dụ, một Skill “Deploy Uniswap V3 fork” có thể được chia sẻ nội bộ trong đội ngũ, giảm thời gian onboarding từ vài ngày xuống còn vài phút. Điều này biến AI Agent từ công cụ cá nhân thành trung tâm quy trình vận hành doanh nghiệp.
Tác động ngành: RPA và Low-code bị xóa sổ?
Tính năng này đe dọa trực tiếp đến ngành RPA truyền thống. UiPath và Automation Anywhere từng yêu cầu chuyên gia thiết kế flow, nhưng giờ đây bất kỳ nhân viên kinh doanh nào cũng có thể ghi lại quy trình xuất báo cáo tài chính từ sàn DEX. RPA giá rẻ dành cho SMB (doanh nghiệp vừa và nhỏ) sẽ bị thay thế hoàn toàn. Trong lĩnh vực kiểm thử smart contract, các kỹ sư QA có thể ghi lại các ca kiểm thử thủ công và biến chúng thành bộ test tự động mà không cần viết một dòng code.
Thậm chí, vai trò của “người tạo nội dung tự động hóa” cũng thay đổi. Thay vì lập trình viên, sẽ xuất hiện “nhà thiết kế Skill” (Skill Designer) — người hiểu rõ quy trình nghiệp vụ và biết cách trình diễn sao cho AI hiểu đúng ý định. Đây là một nghề mới tương tự như Prompt Engineer trong thế giới Web2.
Contrarian
Tuy nhiên, mặt tối của việc ghi lại mọi thao tác là bảo mật. Khi bạn ghi màn hình để tạo Skill cho quy trình deploy hợp đồng, bạn đang ghi lại toàn bộ: private key (nếu không ẩn), địa chỉ contract, API key, thậm chí cả nội dung cuộc họp. Dữ liệu này được gửi lên server của Anthropic để xử lý và lưu trữ. Nếu Skill đó được chia sẻ (ví dụ trong Skill marketplace), thông tin nhạy cảm có thể lộ ra ngoài.
Thêm vào đó, độ tin cậy của Skill khi giao diện thay đổi là một vấn đề lớn. Giao diện Remix IDE hay MetaMask thường xuyên cập nhật; nếu nút “Deploy” đổi vị trí hoặc đổi màu, Skill có thể thất bại. Anthropic có thể dựa vào ngữ nghĩa (semantic matching) để xử lý, nhưng điều này chưa được chứng minh. Một Skill chỉ hoạt động 80% thời gian là thảm họa với quy trình CI/CD nghiêm ngặt.
Cuối cùng, nguy cơ Skill độc hại xuất hiện. Ai đó có thể tạo Skill “Deploy token an toàn” nhưng thực chất là gọi hàm rút tiền. Nếu không có cơ chế kiểm duyệt và sandbox, việc chạy Skill từ nguồn không tin cậy có thể dẫn đến mất mát tài sản. Blockchain từng dạy chúng ta “Don't trust, verify”, nhưng AI Agent lại khuyến khích “Trust and automate”.
Takeaway
AI Agent ghi lại kỹ năng hứa hẹn một cuộc cách mạng năng suất cho blockchain, nhưng nó chỉ thực sự có giá trị khi đi kèm với bảo mật nhúng sẵn và khả năng thích ứng UI. Thị trường sẽ chứng kiến cuộc đua giữa Anthropic và OpenAI, nhưng người chiến thắng thực sự có thể là những dự án mã nguồn mở như Llama 3.2 kết hợp với OCR cục bộ, mang lại giải pháp không cần upload dữ liệu nhạy cảm lên cloud. Câu hỏi đặt ra: Liệu chúng ta có sẵn sàng giao phó toàn bộ thao tác phát triển cho một “black box” mà không hiểu nó thực sự làm gì? Khi lỗ hổng bảo mật không còn nằm trong code, mà nằm trong chính cách con người trình diễn.