Skip to main content

Một năm Agent AI; một thập kỷ loài người

Hiện tại, giới AI đang tranh luận: đây là “năm” hay “thập kỷ” của AI Agents?

Câu trả lời hợp lý nhất có lẽ là: cả hai đều đúng, nhưng ở hai tầng kỳ vọng khác nhau. Năm 2025–2026 có thể là bước ngoặt cho những agent xử lý các tác vụ hẹp, rõ ràng; còn một thập kỷ tới sẽ là hành trình để biến agent thành “lao động tri thức” trong thế giới đầy ngoại lệ.

Bối cảnh: Cơn sốt AI Agents

Trong vài năm gần đây, mô hình nền tảng (foundation model) đã đủ mạnh để không chỉ trả lời câu hỏi mà biết hành động”: mở ứng dụng, thao tác trên UI, gọi API, đọc–viết file, tự chia nhỏ và sắp xếp công việc. Điều này làm bùng nổ khái niệm AI agent – những “trợ lý tự chủ” có thể thay con người làm nhiều việc tri thức, từ viết code, đặt vé máy bay đến hỗ trợ IT.

Tuy nhiên, như Andrej Karpathy và nhiều chuyên gia khác cảnh báo, kỳ vọng đang bị thổi phồng: agent vẫn rất mong manh khi bước ra thế giới thực lộn xộn, nhiều luật ngầm và ngoại lệ. Khoảng cách giữa demo đẹp và hệ thống vận hành ổn định vẫn còn rất lớn.

4 trụ cột năng lực của AI Agent

Để hiểu vì sao có chỗ agent làm rất tốt và có chỗ lại “đuối”, cần nhìn vào 4 trụ cột năng lực chính:

  • Intelligence (mức thông minh): Khả năng hiểu yêu cầu, suy luận, chia nhỏ và lên kế hoạch cho chuỗi hành động.
  • Computer use (sử dụng máy tính): Từ gọi API, chạy script đến thao tác chuột–bàn phím trên giao diện người dùng, điền form, bấm nút, điều hướng giữa nhiều ứng dụng.
  • Multimodal (đa phương thức): Hiểu và xử lý nhiều kiểu dữ liệu như văn bản, hình ảnh, video, file, màn hình chụp.
  • Continual learning (học liên tục): Rút kinh nghiệm từ các lần tương tác trước, sử dụng feedback để ngày càng chính xác và phù hợp hơn với bối cảnh.

Hầu hết các hệ agent hiện nay tương đối mạnh ở trụ cột “intelligence” trên văn bản, nhưng còn yếu khi đụng đến computer use thực sự, đa phương thức phức tạp và khả năng học dài hạn, ổn định.

Nơi AI Agent đã rất mạnh: Coding Assistant

Nếu có một usecase điển hình cho “năm của AI agent” đó chính là coding assistant. Lập trình là môi trường gần như lý tưởng cho agent.

 - Mã nguồn có cấu trúc chặt, ngữ pháp rõ ràng, quy tắc cụ thể.

- Feedback nhanh và rõ: compile lỗi, test fail/pass, benchmark cụ thể.

- Môi trường làm việc tương đối ổn định: IDE, terminal, repository, CI/CD… đều là những công cụ quen thuộc.

 Vì vậy, agent có thể:

 - Viết chức năng mới dựa trên mô tả yêu cầu. 

- Gợi ý chỉnh sửa, refactor code, tối ưu hiệu năng.

- Tự động tạo test, viết tài liệu, review pull request.

Không ít developer để agent “tự chạy” phần lớn quy trình, con người chuyển vai từ người trực tiếp code sang người review, ra quyết định và xử lý các trường hợp khó. Đây là vùng mà AI agent đã thực sự bước vào đời sống hàng ngày, chứ không còn là bản demo.

Nơi AI Agent mới “tạm ổn”: Travel Agent

Hãy tưởng tượng một agent có thể lo trọn chuyến đi: từ tìm ý tưởng điểm đến, so sánh giá vé, đặt vé máy bay và khách sạn, cho đến gợi ý lịch trình chi tiết, tối ưu chi phí. Về lý thuyết, tất cả đều có vẻ rất phù hợp: nhiều dữ liệu công khai, thao tác web, form, API, một chuỗi nhiệm vụ có thể tự động hóa.

Nhưng thực tế, bài toán du lịch lại đầy rẫy ngoại lệ:

- Giao diện web mỗi hãng một kiểu, thay đổi thường xuyên, đôi khi có captcha, popup, điều khoản ẩn trong fine print.

- Các ràng buộc phức tạp như transit cần visa, hành lý đặc biệt, đi cùng em bé, người lớn tuổi hay người khuyết tật.

- Sở thích cá nhân thay đổi theo thời gian: lần này tối ưu giá, lần sau ưu tiên giờ bay; lần khác lại muốn nghỉ dưỡng cao cấp.

Hiện tại, agent có thể hỗ trợ khá tốt ở mức:

- Gợi ý hành trình, gợi ý hãng/tầm giá, so sánh lựa chọn. 

- Chuẩn bị checklist, bản nháp lịch trình để con người quyết định và thao tác bước cuối.

Nhưng để “giao trọn” việc đặt, thanh toán, xử lý sự cố hoàn toàn cho agent thì vẫn quá mạo hiểm. Đây là minh chứng rằng dù mô hình ngôn ngữ hiểu khá tốt, phần “hành động” trong môi trường phức tạp vẫn còn hạn chế.

Đích đến dài hạn: Support IT tự động

Một tầm nhìn tham vọng hơn là dùng AI agent cho IT support: thay vì chỉ trả lời FAQ hoặc hướng dẫn click từng bước, agent có thể tự:

- Kết nối từ xa vào máy người dùng. 

- Chẩn đoán nguyên nhân lỗi dựa trên log, cấu hình, tình trạng hệ thống.

- Thực hiện thao tác sửa chữa: cài driver, đổi cấu hình, restart dịch vụ, rollback phiên bản.

Vấn đề là môi trường IT trong thực tế cực kỳ bừa bộn:

- Mỗi máy là một tổ hợp phần mềm–phần cứng, policy, cấu hình khác nhau.

- Vô số edge case: lỗi hiếm, tương tác khó đoán giữa các ứng dụng, hạn chế quyền truy cập, mạng nội bộ phức tạp.

- Yêu cầu độ tin cậy rất cao, vì bất kỳ thao tác sai nào cũng có thể làm gián đoạn hệ thống.

Để agent hoạt động tốt ở đây, cần:

- Khả năng hiểu sâu môi trường hệ thống, không chỉ văn bản mà cả log, màn hình, thông số kỹ thuật.

- Computer use ở mức “thợ lành nghề”: thao tác thành thục trên nhiều OS, tool, script, kịch bản khác nhau.

- Cơ chế học liên tục từ hàng nghìn case support, nhưng vẫn giữ an toàn và khả năng kiểm soát.

Đây chính là loại bài toán mà có lẽ phải mất một thập kỷ để agent thực sự trưởng thành.

Vậy: Năm hay thập kỷ của AI Agents?

Nếu nhìn vào những gì đã sẵn sàng để triển khai rộng rãi, có thể coi hiện tại là “năm” của AI agent cho các tác vụ hẹp, có cấu trúc, môi trường tương đối ổn định, ví dụ coding assistant. Trong không gian này, agent đủ tốt để mang lại hiệu suất vượt trội, con người có thể đóng vai trò giám sát, hiệu chỉnh.

Nhưng nếu nói về tầm nhìn: agent có thể xử lý thế giới thực hỗn loạn như con người – tự sử dụng máy tính, hiểu đa phương thức, xử lý vô số ngoại lệ và học dần từ kinh nghiệm – thì đây mới là “thập kỷ” của AI agent. Những ứng dụng như travel agent toàn diện hay IT support tự động end-to-end nhiều khả năng sẽ cần cả một chặng đường dài về mô hình, hạ tầng, kỹ thuật an toàn và thiết kế sản phẩm.

Điều quan trọng là giữ kỳ vọng ở đúng mức: tận dụng tối đa sức mạnh agent ở những nơi “đã chín”, như lập trình hay các quy trình nội bộ rõ ràng; đồng thời đầu tư dài hạn cho những mảng đầy hứa hẹn nhưng rủi ro cao, nơi agent vẫn còn là thực tập sinh. Đây chính là lý do có thể nói: chúng ta đang sống trong năm – và cũng là khởi đầu của thập kỷ – của AI Agents.