Claude ra mắt tính năng "Ghi kỹ năng": Bước chuyển mình của AI Agent vào tự động hóa văn phòng

Trương Đức Hàng tuần

Tôi nhớ hồi năm 2020, khi DeFi Summer bùng nổ, tôi đã mất gần 70% NAV của quỹ chỉ vì tin vào câu chuyện “tự động hóa lợi nhuận” từ một giao thức yield farming. Đó là bài học đắt giá: một kịch bản tự động được viết đẹp đẽ nhưng thiếu khả năng thích ứng với biến động thị trường. Hôm nay, khi Anthropic vừa công bố tính năng “Record a Skill” cho Claude, tôi lập tức thấy một sự tương đồng đáng sợ.

Hook: “Nếu bạn có thể dạy AI làm việc chỉ bằng cách làm mẫu, bạn có dám giao phó toàn bộ quy trình nhạy cảm cho nó không?” Câu hỏi này không chỉ dành cho người dùng, mà còn là bài toán tồn tại cho toàn bộ ngành RPA và low-code.

Context: Tính năng này cho phép Claude ghi lại toàn bộ tương tác của người dùng: màn hình, chuột, bàn phím, giọng nói. Sau đó, nó chuyển đổi chuỗi hành động đó thành một “Skill” có thể tái sử dụng. Trước đây, để tạo một Skill, bạn phải tự viết file SKILL.md – một quy trình thủ công, chỉ dành cho người có kỹ thuật. Giờ đây, bất kỳ ai cũng có thể tạo kịch bản tự động hóa chỉ bằng cách thực hiện tác vụ một lần. Đây là bước ngoặt từ “công cụ cho lập trình viên” sang “công cụ cho nhân viên văn phòng”.

Core Insight: Kỹ thuật đằng sau tính năng này là sự kết hợp giữa behavioral cloning (học bắt chước hành vi)multi-modal LLM. Claude không chỉ ghi lại tọa độ pixel, nó hiểu ý định của bạn thông qua giọng nói và ngữ cảnh màn hình. Khi bạn nói “Lưu file này vào thư mục báo cáo”, nó biết bạn muốn nhấn nút nào, nhập tên gì, và chọn đường dẫn ra sao. Đây là sự tiến hóa từ “record and replay” cứng nhắc của RPA truyền thống (như UiPath) sang “record and generalize” linh hoạt. Tuy nhiên, điều khiến tôi cảnh giác là sự thiếu minh bạch về độ ổn định. Khi giao diện thay đổi – một nút “Save” bị đổi vị trí – Skill của bạn có còn hoạt động không? Claude dựa vào semantic understanding (hiểu ngữ nghĩa) để tìm nút, nhưng nếu không có đủ dữ liệu huấn luyện, nó có thể nhấn nhầm.

Contrarian Angle: Ngược với sự hào hứng của cộng đồng, tôi cho rằng đây là “cạm bẫy năng suất”. Người dùng dễ dàng tạo ra hàng trăm Skill cho các tác vụ đơn giản, nhưng không ai kiểm tra độ chính xác của chúng trong các tình huống ngoại lệ. Một Skill ghi lương nhân viên có thể vô tình gửi bảng lương sai địa chỉ email nếu hộp thoại xác nhận bị dịch chuyển. Không chỉ vậy, vấn đề quyền riêng tư là một quả bom hẹn giờ: Claude ghi lại mọi thứ, bao gồm mật khẩu xuất hiện trên màn hình (dù có thể bị hệ điều hành che), các file nội bộ, và cả giọng nói của đồng nghiệp. Nếu dữ liệu này được dùng để huấn luyện mô hình, doanh nghiệp có thể vô tình rò rỉ quy trình độc quyền.

Takeaway: Cluade Cowork không chỉ là một tính năng – nó là tuyên chiến với toàn bộ ngành tự động hóa truyền thống và đồng thời là một bài toán về lòng tin. Liệu chúng ta có sẵn sàng giao quyền điều khiển bàn phím cho một AI có thể hiểu lầm ý định của chúng ta không? Câu trả lời sẽ quyết định ai là người chiến thắng trong cuộc đua Agent này.