Skip to main content

Nghiên cứu sâu có thể không còn đòi hỏi nguồn ngân sách dồi dào nữa. Mô hình Tongyi DeepResearch mới của gã khổng lồ công nghệ Trung Quốc Alibaba đã vươn lên dẫn đầu danh sách mô hình được tải xuống nhiều nhất của Hugging Face tuần trước.

Tongyi là agent nghiên cứu chuyên sâu tự động, hoạt động nhanh hơn, tiết kiệm chi phí hơn so với các agent có khả năng nghiên cứu phức tạp. Tin vui hơn nữa: Tongyi còn là mã nguồn mở.

"Tôi nghĩ đây là bước tiến thực sự tuyệt vời", Gabe Goodhart, Kiến trúc sư trưởng về Sáng tạo Mở AI tại IBM, chia sẻ trong tập gần đây của podcast Mixture of Experts. Ông hoan nghênh tin tức Alibaba phát triển LLM mở "mà bạn có thể chạy trên máy trạm cá nhân, ngang tầm với một hệ thống nghiên cứu tiên tiến".

Các agent nghiên cứu chuyên sâu tự động thu thập, tổng hợp, phân tích thông tin từ nhiều nguồn. Thông thường, chúng chạy trên LLM lớn, yêu cầu hàng trăm tỷ tham số, mất nhiều thời gian để suy luận (đôi khi lên đến 30 phút cho mỗi truy vấn) vì chúng tham khảo nhiều nguồn hơn so với các agent phản hồi ngay lập tức.

Mặc dù Tongyi DeepResearch có 30 tỷ tham số, nó chỉ kích hoạt 3 tỷ mã thông báo cùng một lúc. Điều này cho phép suy luận nhanh hơn, chi phí thấp hơn so với các agent nghiên cứu sâu đang phổ biến, đồng thời vẫn duy trì hiệu suất tương đương.

Ngoài các tiêu chuẩn chung, Tongyi DeepResearch rất thành thạo trong một số task vụ thực tế, ví dụ có thể "tự động thực hiện các nhiệm vụ nghiên cứu phức tạp, nhiều bước, tương tự quy trình làm việc của một luật sư mới vào nghề", nhóm DeepResearch của Tongyi Lab đã viết trong bài đăng trên blog GitHub. Theo bài đăng này, agent nghiên cứu pháp lý Tongyi FaRui đạt điểm chính xác cao hơn agent Deep Research của OpenAI và Claude của Anthropic khi trích dẫn các điều luật và vụ án pháp lý.

Mihai Criveti, Kỹ sư Xuất sắc tại IBM, nhấn mạnh các mô hình nhỏ nhưng mạnh mẽ, có thể hoàn thành nhiệm vụ nghiên cứu chuyên sâu được nhắm mục tiêu, đặc biệt hấp dẫn đối với các doanh nghiệp. "Có rất nhiều tổ chức đang tìm kiếm các mô hình rẻ hơn, nhanh hơn, nhỏ hơn - đặc biệt nếu mô hình hoạt động tốt với dữ liệu tài chính, dữ liệu nhân sự hoặc dữ liệu nội bộ".

Sự hợp tác giữa Scuderia Ferrari HP và IBM tập trung vào ứng dụng trí tuệ nhân tạo (AI) để nâng cao trải nghiệm cho cộng đồng người hâm mộ Ferrari toàn cầu. Đại diện Ferrari chia sẻ về đặc điểm đặc biệt của fan Ferrari: họ không chỉ ủng hộ cá nhân từng tay đua mà coi đội đua như bản sắc dân tộc – giống như cổ vũ đội tuyển bóng đá quốc gia. Điều này tạo nên sự kết nối tự hào và gắn bó sâu sắc, biến Ferrari thành biểu tượng quốc gia trong lòng người dân Italy.

Trước khi IBM tham gia, Ferrari app đã là sản phẩm số chất lượng, nhưng chỉ dừng lại ở vai trò phục vụ thông tin cho fan. IBM cùng Ferrari bắt đầu quá trình nghiên cứu sâu về nhu cầu thực sự của người hâm mộ: họ không đơn thuần muốn cập nhật tin tức, mà muốn “thuộc về” một phần của cộng đồng chiến thắng. Phân tích này đặt ra mục tiêu mới: tăng cường chiều sâu kết nối với cộng đồng Tifosi – biệt danh của fan Ferrari.

IBM sử dụng sức mạnh của nền tảng AI “watsonx” để phát triển các nhóm “persona”, giúp nhận diện, phân loại đa dạng các kiểu fan: từ fan cuồng, thường xuyên theo dõi từng chi tiết về đội Ferrari, đến các nhóm fan mới xuất hiện qua loạt phim “Drive to Survive” của Netflix; thậm chí có cả những nhóm fan đặc biệt với sở thích riêng biệt. Dựa vào sự thấu hiểu này, mỗi tính năng, thiết kế và kiến trúc của app được điều chỉnh để cá nhân hóa theo thói quen và tâm trạng người dùng từng thời điểm cụ thể.

IBM có truyền thống xử lý dữ liệu thể thao khổng lồ trong nhiều thập kỷ, từ tennis, boxing đến bóng rổ và đua xe. Sức mạnh AI giúp Ferrari không chỉ biết ai là fan mà hiểu fan mong muốn điều gì: nội dung nào, lúc nào, trên thiết bị nào – từ đó tạo ra trải nghiệm vượt trội, đáp ứng chính xác kỳ vọng của từng đối tượng.

Người hâm mộ giờ đây không nhất thiết phải gặp nhau ngoài đời ở sân vận động hay quán bar như trước, mà có thể tụ họp ngay trên app. Sự kết hợp giữa tốc độ, dữ liệu, cảm xúc đã và đang định hình lại cách tạo dựng fandom cho một trong những thương hiệu nổi tiếng nhất thế giới thể thao.

Với tất cả những phép màu mà binh đoàn AI agent có thể giúp cuộc sống dễ dàng hơn, từ săn vé xem buổi biểu diễn của ban nhạc yêu thích ngay khi chúng được mở bán cho đến tự động thu thập, gửi và hoàn trả chi phí sau chuyến công tác, việc mong đợi những kịch bản này khả thi là điều dễ hiểu.

Nhưng chúng không khả thi - vì một lý do: AI agent chưa thể xử lý thanh toán. Chưa.

Giao thức Agent Payments Protocol (AP2) mới của Google được thiết kế để giải quyết mảnh ghép cuối cùng này bằng cách cho phép các AI agent thực hiện thanh toán thay mặt con người. Cụ thể, Google đang nỗ lực phát triển giao dịch thương mại an toàn bao gồm xác thực bảo mật, cơ chế ủy quyền, quản lý dữ liệu và nhiều yếu tố quan trọng khác để đảm bảo thanh toán an toàn.

“Tôi nghĩ đây là bước đi sáng suốt”, Mihai Criveti, Kỹ sư Xuất sắc tại IBM, chia sẻ trong tập phát sóng của chương trình Mixture of Experts. Bằng cách giải quyết vấn đề xử lý thanh toán, AP2 “giải được vấn đề mà cả A2A lẫn MCP hiện nay đều bó tay”.

AP2 có thể được sử dụng như một phần mở rộng giao thức MCP của Anthropicgiao thức Agent2Agent (A2A) của Google. Các công ty và nhà phát triển đã áp dụng tiêu chuẩn mở này để AI agent tương tác với nhau, cho LLM kết nối với các công cụ và dữ liệu bên ngoài, bất kể nhà cung cấp hoặc nguồn phát triển chúng.

Để thực hiện được kỳ tích này, Google đang hợp tác với hơn 60 công ty trong lĩnh vực thanh toán và công nghệ, từ American Express, PayPal đến Salesforce.

Criveti cho biết, giải bài toán thanh toán giúp Google tiếp cận người dùng mới và tạo ra các nguồn doanh thu mới trong tương lai. Ví dụ, ngày càng nhiều người đang mua hàng từ KOL trên TikTok. Với AP2, người mua có thể chỉ định cho agent mua hàng của KOL nào, số tiền tối đa bao nhiêu, sau đó đi ngủ. AI agent tự động tìm & mua mặt hàng đang thịnh hành, tất cả đều được bảo mật. Người mua chỉ cần ngồi chờ đơn hàng tới, rồi ting-ting", Criveti nói.

Liệu có thể chuyển đổi doanh nghiệp của bạn bằng AI mà vẫn giữ nguyên quy trình làm việc truyền thống? Đối với Armon Dadgar, Giám đốc Công nghệ, Đồng sáng lập HaschiCorp, câu trả lời đơn giản thẳng thắn là "không".

"Nếu quy trình của bạn là gửi email cho hàng nghìn người, AI không thể giải quyết được vấn đề đó", ông nói trong cuộc phỏng vấn với IBM Think tại hội nghị HashiConf tuần này ở San Francisco.

Một số doanh nghiệp hiện nay có thể thiếu hệ thống lưu trữ thống nhất về cơ sở hạ tầng và bảo mật để thực sự vận hành AI. Đó là lúc dự án mới nhất của HashiCorp, công ty phần mềm cơ sở hạ tầng đám mây được IBM mua lại đầu năm nay, ra đời.

Dự án Infragraph giúp tổng hợp dữ liệu từ nhiều nguồn khác nhau để tạo ra biểu đồ cơ sở hạ tầng theo thời gian thực. Về cơ bản, đây là hệ thống lưu trữ thống nhất kết nối cơ sở hạ tầng, ứng dụng, dịch vụ, quyền sở hữu và chính sách.

“Chúng tôi không cố gắng giải quyết mọi tầng AI,” Dadgar nói. “Nhưng đối với tầng quản lý cơ sở hạ tầng, câu hỏi đặt ra là: làm thế nào để chúng ta kết hợp tất cả lại với nhau và có một cái nhìn thống nhất về mọi thứ? Bởi vì nếu không có điều đó, xây dựng quy trình làm việc dựa trên AI trở nên vô nghĩa”

Bruno Aziza, Phó Chủ tịch Tiếp thị Sản phẩm Phần mềm tại IBM, phát biểu tại sự kiện: "Các tổ chức ngày nay thường hoạt động trên nhiều nền tảng đám mây, điều này có thể gây khó khăn khi đưa AI vào vận hành thực tế. Không có hệ thống hiệu quả nào có thể cung cấp cho bạn hiểu biết rõ ràng, ở cấp độ cơ bản về cách mọi thứ kết nối với nhau - cách cơ sở hạ tầng, dịch vụ và chính sách liên quan đến nhau. Đó là lý do tại sao tôi thích dự án infragraph."

Nhưng khả năng hiển thị thôi là chưa đủ. Aziza chỉ ra nhu cầu về trí tuệ nhân tạo được xếp chồng lên biểu đồ đó - những hệ thống không chỉ hiển thị những gì đang diễn ra mà dự đoán những gì có thể xảy ra.

Theo Dadgar, trước khi doanh nghiệp theo đuổi kế hoạch chuyển đổi AI, họ cần tự hỏi mình câu hỏi đơn giản: "Bạn đã có nền tảng vững chắc chưa? Để triển khai AI đúng cách, bạn phải bắt đầu bằng việc triển khai lớp đám mây và lớp tự động hóa một cách chính xác."

Chúng ta đều biết LLM có thể giải các phương trình toán học phức tạp, nhảy múa trên những dòng code. Nhưng nếu đặt LLM vào một hầm ngục chỉ toàn chữ, nơi mọi hành động đều được quyết định bằng prompt-văn bản, chúng sẽ xoay xở thế nào?

Đó là ý tưởng của TextQuests, một chuẩn mực mới do Trung tâm An toàn AI tại San Francisco phát triển. Nhóm nghiên cứu đã “hồi sinh” 25 trò chơi văn bản kinh điển, trong đó có huyền thoại Zork, để kiểm tra khả năng lập kế hoạch, ghi nhớ và thích ứng của các mô hình AI.

Một chút lịch sử: vào cuối thập niên 1970, game thủ tương tác với máy tính hoàn toàn qua những dòng chữ. Người chơi gõ những câu lệnh đơn giản như “GO NORTH” hay “GET LAMP”, máy tính phản hồi bằng đoạn mô tả ngắn. Nhóm sinh viên MIT yêu khoa học đã biến hình thức này thành game Zork (1979), sau đó sáng lập công ty Infocom, nơi khai sinh nhiều game văn bản kinh điển của thập niên 1980.

Theo báo cáo TextQuests, dù giao diện tưởng chừng thô sơ, trò chơi kiểu này có thể ngốn hơn 30 giờ chơi và yêu cầu hàng trăm hành động chính xác. Chúng trở thành môi trường giàu thách thức để đánh giá AI agent trong các nhiệm vụ phức tạp.

Josh Spurgin, Chuyên gia Kỹ thuật AI Cấp cao tại IBM (đồng thời là game thủ kỳ cựu) cho rằng những chuẩn mực như TextQuests có thể phơi bày những hành vi bất ngờ ở AI. “Nếu một mô hình đang chơi game kiểu Zork mà lại rất tự tin với một quyết định sai, tôi muốn biết vì sao nó nghĩ đó là lựa chọn đúng. Lý do là gì?” - ông chia sẻ với IBM Think.

Nhà phê bình game Cara Ellison cho rằng TextQuests thiên về kiểm tra trí nhớ hơn khả năng lý luận. “Đưa LLM vào trò chơi văn bản không có nghĩa bắt nó ‘suy nghĩ’ hay ‘giải quyết vấn đề’. Thực chất, bạn chỉ đang kiểm tra xem nó đã từng bắt gặp ngôn ngữ này trước đây chưa,” bà nói.

Câu hỏi đặt ra là: nghiên cứu tương lai sẽ hé lộ điều gì? Liệu những trò chơi cổ điển này có thật sự là thước đo trí thông minh, hay chỉ là bài tập nhận diện mẫu tinh vi? Và chuyện gì xảy ra khi một bộ não nhân tạo khổng lồ đối mặt với thử thách tưởng chừng đơn giản: “GO NORTH - TIẾN VỀ PHÍA BẮC”?

Nhân bản giọng nói, sản xuất video, chuốt content quảng cáo (như BUTCHI.AI) không còn là thử nghiệm: chúng đang thúc đẩy các chiến dịch sáng tạo thực sự và thậm chí cả các bộ phim sắp ra mắt. Ví dụ, OpenAI gần đây công bố họ đang hỗ trợ Critterz, một trong những phim hoạt hình đầu tiên sử dụng nhiều công cụ AI.

Tuy nhiên, áp dụng AI tạo sinh trong doanh nghiệp vẫn còn chậm. Kết quả nghiên cứu của Viện IBM về Giá trị Doanh nghiệp cho thấy 60% các tổ chức chưa xây dựng được phương pháp tiếp cận công nghệ nhất quán trên toàn công ty. Các yếu tố góp phần gây ra sự chậm trễ này bao gồm vấn đề về bản quyền, nguồn gốc dữ liệu và kiểm soát sáng tạo.

"Chúng tôi vẫn đang trong giai đoạn thăm dò, trong đó các doanh nghiệp nói chung đang tìm hiểu giá trị và các trường hợp sử dụng mà AI tạo sinh có thể mang lại giá trị", Todd Cramer, Trưởng nhóm Thiết kế tại IBM, cho biết trong cuộc phỏng vấn với IBM Think.

Cramer cho biết: “Trong các trường hợp sử dụng thực tế của doanh nghiệp, mọi thứ phức tạp hơn nhiều so với việc chỉ dùng AI. Có nhiều tầng phức tạp cần được giải quyết trước khi tích hợp hoàn toàn.”

Nik Kleverov, giám đốc Critterz, người đứng đầu Native Foreign, studio đứng sau TVC cho hãng Toys“R”Us do AI tạo ra nhìn thấy tiềm năng sáng tạo nhưng cũng thấy cả những thách thức.

“Các thương hiệu có yêu cầu rất cụ thể. Và độ chính xác trong kiểm soát cảnh quay và bối cảnh có lẽ vẫn chưa đạt đến mức đó [bằng các công cụ AI]”, ông nói trong cuộc phỏng vấn với IBM Think. “Mọi người đang sử dụng AI trong sản xuất hình ảnh TVC nhưng có lẽ chưa nhiều vì nó vẫn còn thiếu một chút ma thuật để điều chỉnh mọi thứ.”

Tuy nhiên, xu hướng tích hợp - thậm chí áp dụng - những công cụ này vẫn đang được triển khai. "Hai năm nữa, AI sẽ không còn mang lại cảm giác khác biệt quá mức", Kleverov nói. "Theo một cách nào đó, trọng tâm sẽ chuyển trở lại yếu tố sáng tạo nguyên bản: tầm nhìn và thông điệp. Nhưng chúng ta cũng sẽ thấy những câu chuyện mới trở thành hiện thực, điều trước đây không thể thực hiện khi chưa có AI."

Một nghiên cứu mới từ Anthropic đã tiết lộ sự phân chia rõ rệt về tỉ lệ sử dụng AI trên toàn cầu. Các quốc gia giàu có đang vượt xa quốc gia đang phát triển về mức độ sử dụng Claude, đặt ra câu hỏi liệu AI có thể làm gia tăng bất bình đẳng kinh tế quốc tế hay không.

Báo cáo The Anthropic Economic Index report đã phân tích hơn 1 triệu cuộc trò chuyện Claude tại hơn 150 quốc gia. Singapore dẫn đầu về tỷ lệ áp dụng bình quân đầu người, đạt mức cao gấp 4,6 lần so với mức dự kiến dựa trên dân số. Trong khi đó, Nigeria (0,2 lần) và Ấn Độ (0,27 lần) lại tụt hậu đáng kể.

Báo cáo nêu rõ: "Nếu mức tăng năng suất lớn hơn đối với các nền kinh tế áp dụng công nghệ cao, thì mô hình sử dụng hiện tại cho thấy lợi ích của AI có thể tập trung ở các khu vực vốn đã giàu có - có khả năng làm gia tăng bất bình đẳng kinh tế toàn cầu và đảo ngược sự hội tụ tăng trưởng đã thấy trong những thập kỷ gần đây".

Mối tương quan giữa Tổng sản phẩm quốc nội (GDP) và áp dụng AI có thể rất mạnh, nhưng các trường hợp ngoại lệ cũng cho thấy nhiều điều đáng chú ý. Theo Martin Keen, Nhà phát minh bậc thầy của IBM. "Tôi thấy hứng thú khi tìm hiểu xem điều gì không tương quan với đường thẳng đó", ông nói.

Tại Ấn Độ, mặc dù tỷ lệ sử dụng Claude trên đầu người thấp nhưng đứng thứ hai toàn cầu về mức độ sử dụng Claude, một nửa trong số đó dành cho tác vụ lập trình, điều này cho thấy cùng một công cụ có thể đảm nhiệm những vai trò rất khác nhau tùy thuộc vào nhu cầu của từng địa phương.

Nhà phát minh và nghiên cứu viên chính của IBM, Aaron Baughman, lưu ý rằng ngay cả ở những khu vực ít sử dụng, mọi người vẫn có thể học từ xa, thử nghiệm các công cụ và xây dựng cộng đồng thực hành. "Địa lý không nhất thiết là định mệnh", ông nói, đồng thời cho biết mọi người có thể đưa AI vào các ngành công nghiệp ngách ở quốc gia của họ. "Có nhiều cách khác nhau để thu hẹp khoảng cách.”

Bài kiểm tra thực sự sẽ là liệu các công ty công nghệ AI có thể tăng cường khả năng tiếp cận theo cách "làm điều này một cách tử tế vì mục đích phục vụ cộng đồng mà [AI] hướng đến hay không", Lauren McHugh Olende, Giám đốc Chương trình Sáng tạo Mở AI của IBM, cho biết. Bà đi thẳng vào vấn đề cốt lõi: "Giờ đây, khi khoảng cách tiếp cận đã được xác định, chúng ta cần làm gì để giải quyết nó?"

Nền tảng BeeAI của IBM mang đến một cấp độ tin cậy mới cho hệ sinh thái AI agent, đã được tích hợp sẵn cho môi trường ứng dụng. Sandi Besen, Kỹ sư Nghiên cứu AI kiêm Trưởng nhóm Hệ sinh thái tại IBM Research, muốn các agent trở nên đáng tin cậy hơn, một bước quan trọng trong triển khai và mở rộng hệ thống đa tác nhân trong doanh nghiệp.

“Chúng ta hiện đã tiến đến giai đoạn mà hầu hết các công ty ít nhất đã từng thử nghiệm tạo ra các AI agent, ngay cả khi chúng chưa được đưa vào môi trường ứng dụng”, Besen cho biết trong cuộc phỏng vấn gần đây với IBM Think. “Và thường thì, một trong những lý do khiến các agent chưa hoàn toàn được đưa vào ứng dụng vì doanh nghiệp lo ngại về độ tin cậy của chúng.”

Mối lo ngại đó chính xác là điều BeeAI và RequirementAgent ra đời để giải quyết. "Điểm khác biệt của chúng tôi là, không giống các framework agent khác, khiến các nhà phát triển phải viết toàn bộ logic nghiệp vụ để kiểm soát hành vi của agent, BeeAI cho phép thực hiện điều đó chỉ trong vài dòng mã", Besen nói. "Bản thân framework xử lý logic ở phía sau, giúp các nhà phát triển dễ dàng tạo ra các agent đáng tin cậy và có trách nhiệm hơn mà không cần tự mình mày mò tìm hiểu cách triển khai."

RequirementAgent giới thiệu một hệ thống quy tắc linh hoạt, xác định các ràng buộc thực thi trong khi vẫn duy trì khả năng giải quyết vấn đề một cách đa nhiệm của agent. Nó cho phép các nhà phát triển "định hình hành vi của agent theo cách vừa có thể dự đoán vừa có thể thích ứng".

Doanh nghiệp có thể cấu hình agent tuân theo các quy trình nghiêm ngặt, từng bước hoặc hoạt động với các ràng buộc tối thiểu, tùy thuộc vào tác vụ hoặc trường hợp sử dụng. Dù quy tắc là gì, chúng dễ dàng được điều chỉnh nhanh chóng khi nhu cầu kinh doanh thay đổi.

Với BeeAI, các kỹ sư như Besen không chỉ bổ sung thêm một công cụ vào thị trường agent vốn đã chật chội, mà cố gắng giải quyết một trong những rào cản lớn nhất trong môi trường thực tế: Liệu agent AI có đáng tin cậy hay không?

RequirementAgent đang nỗ lực để cân bằng cán cân.

AI agent là bước tiến mới sau tự động hóa, giúp tái định hình quy trình kinh doanh và hiệu quả vận hành, nhưng quá trình triển khai gặp nhiều thách thức không nhỏ. Ba vấn đề then chốt khi doanh nghiệp muốn ứng dụng AI agent:

  1. Sẵn sàng cho doanh nghiệp

    • Cần tích hợp AI vào môi trường CNTT hiện tại, và điều phối các agent AI trên nhiều hệ thống.
    • Tận dụng đầu tư hiện có vào nền tảng dữ liệu & AI (như Azure, AWS, Google Cloud).
    • Đánh giá các quy trình để xác định đâu là lĩnh vực phù hợp nhất cho AI agent, xây dựng kiến trúc mở rộng, hỗ trợ nhiều agent hoạt động phối hợp.
  2. Đảm bảo độ tin cậy

    • Đảm bảo chất lượng, độ sẵn sàng của dữ liệu cho AI, quản lý cả dữ liệu có cấu trúc và phi cấu trúc.
    • Thực hiện kiểm soát nghiêm ngặt, có quy trình giám sát, nhận diện rủi ro, audit rõ ràng về hành vi AI agent.
    • Siết chặt bảo mật theo đúng chuẩn bảo vệ dữ liệu trên môi trường đa đám mây.
  3. Đẩy nhanh thời gian ra thị trường

    • Ưu tiên các dự án thử nghiệm (pilot) có thể mang lại giá trị nhanh chóng (thường từ 8-12 tuần).
    • Xây dựng các lớp điều phối AI agent giúp phân chia nhiệm vụ hiệu quả, dùng công cụ tối ưu hóa hiệu suất.
    • Tối ưu hóa tốc độ, độ tin cậy và chi phí để tối đa lợi ích đầu tư.

Để triển khai thành công AI agent đòi hỏi doanh nghiệp phải giải quyết đồng thời cả ba vấn đề: tích hợp, kiểm soát tin cậy và triển khai thần tốc. Khi vượt qua được các thách thức này, doanh nghiệp sẽ tận dụng tối ưu tiềm năng AI để nâng cao hiệu quả và đổi mới sáng tạo.

Các hệ thống AI vốn không có ý định nói dối. Tuy nhiên, một nghiên cứu mới cho thấy chính cách kiểm tra và đánh giá hiện nay lại có thể vô tình khuyến khích chúng che giấu sự không chắc chắn bằng cách… “nói dối”.

Đây là kết luận trong bài báo của OpenAI về hiện tượng “ảo giác” - khi các mô hình ngôn ngữ lớn (LLM) đưa ra câu trả lời nghe có vẻ hợp lý nhưng thực tế lại sai. Theo các tác giả, quá tập trung vào thước đo độ chính xác khiến mô hình ưu tiên đoán mò thay vì thừa nhận “không biết”. Điều này có thể tạo ra rủi ro trong bối cảnh doanh nghiệp, nơi giá trị tin cậy đóng vai trò then chốt.

Ayhan Sebin, Giám đốc Phát triển Quan hệ Đối tác và Hệ sinh thái AI tại IBM, nhận định trong cuộc phỏng vấn với IBM Think: “Cách đánh giá mới thực sự là gốc rễ của vấn đề, không khác gì con người được thúc đẩy bởi KPI.”

Theo các nhà nghiên cứu OpenAI, cách chấm điểm hiện tại vô tình “ưu ái” những câu trả lời sai hơn là câu trả lời “tôi không biết”. Hệ quả là mô hình học cách né tránh. Ngược lại, các phiên bản GPT-5 mới hơn, thường xuyên thừa nhận “không biết”, lại mắc ít sai sót hơn về tổng thể.

Santosh Vempala, giáo sư tại Georgia Tech, đồng tác giả nghiên cứu, chia sẻ: “Chỉ cần thay đổi đơn giản trong cách chấm điểm - thưởng cho câu trả lời ‘tôi không biết’ nhiều hơn so với câu trả lời sai - mô hình sẽ thể hiện sự thận trọng và trung thực hơn.”

Ở một góc nhìn khác, Kate Soule, Giám đốc Quản lý Sản phẩm Kỹ thuật các mô hình Granite của IBM, gọi đây là vấn đề hiệu chuẩn. Theo bà, các tiêu chuẩn hiện nay khuyến khích mô hình phải đưa ra câu trả lời, dù đôi khi là mạo hiểm. Nhưng nếu đi ngược lại, liên tục nói “không biết” - mô hình lúc này cũng chẳng còn hữu ích.

“Hiện tại chúng ta đang nghiêng hẳn về phía ưu tiên độ chính xác. Nếu đi sang phía ngược lại, nơi mô hình từ chối trả lời mọi thứ, thì cũng vô dụng. Cần những hàm phần thưởng tốt hơn, hệ thống đánh giá tốt hơn để định vị mô hình ở điểm cân bằng,” bà chia sẻ trong podcast Mixture of Experts.

Song song đó, các nhà nghiên cứu IBM đang thử hướng tiếp cận khác để xử lý vấn đề ảo giác bằng cách xây dựng Larimar, hệ thống bổ sung bộ nhớ ngắn hạn có thể chỉnh sửa cho AI. Ý tưởng là cho phép mô hình xem xét lại hoặc quên đi một số thông tin trong thời gian thực, giúp cải thiện độ chính xác mà không cần đào tạo lại toàn bộ.