Skip to main content

Sẽ ra sao nếu thay vì tranh giành dữ liệu huấn luyện, các chủ sở hữu quyền sở hữu trí tuệ và các nhà phát triển AI thực sự hợp tác để tạo ra kết quả đầu ra?

Đó chính xác là những gì đang xảy ra với Disney và OpenAI. Hai công ty đã công bố hợp tác, đưa một số nhân vật nổi tiếng nhất thế giới vào trí tuệ nhân tạo (AI).

Bắt đầu từ năm 2026, người dùng có thể tạo video với hơn 200 nhân vật từ Disney, Pixar, Marvel và Star Wars bằng mô hình video Sora của OpenAI. Thỏa thuận ba năm mang lại cho Disney 1 tỷ USD cổ phần trong OpenAI bên cạnh quyền truy cập vào API và ChatGPT để sử dụng nội bộ. Nhất cử lưỡng tiện.

Động thái này diễn ra trong bối cảnh căng thẳng leo thang giữa Hollywood và các nhà phát triển trí tuệ nhân tạo về vấn đề sở hữu trí tuệ. Hãng phim Disney từ lâu đã rất quyết liệt bảo vệ sở hữu trí tuệ, và hiện đang kiện các công ty AI khác vi phạm bản quyền, điều này khiến thỏa thuận cấp phép với OpenAI thoạt nhìn có vẻ bất thường.

Nhưng nếu nhìn vấn đề một cách khách quan, sự hợp tác này lại rất hợp lý. Điều làm nên sự khác biệt so với các thỏa thuận cấp phép AI khác chính là việc quyền sở hữu trí tuệ của Disney thực sự được đưa vào như thế nào.

“Đây là thỏa thuận rất thú vị” Martin Keen, nhà phát minh bậc thầy của IBM cho biết trên podcast Mixture of Experts. “Theo truyền thống, các thỏa thuận về trí tuệ nhân tạo chúng ta từng thấy thường dành cho mục đích đào tạo và định hình. Nhưng đây không phải vậy. Đây là khía cạnh khác: lấy mô hình hoàn chỉnh và chính thức tích hợp các nhân vật có bản quyền vào sản phẩm đầu ra”. Sự khác biệt đó rất quan trọng, Martin lưu ý, đặc biệt khi một số người dùng nhanh chóng cố gắng tạo ra các nội dung có bản quyền mỗi khi một mô hình mới ra đời.

“Như Bob Iger đã nói, điều này đằng nào cũng sẽ xảy ra, vì vậy Disney đang cố gắng đón đầu xu hướng”, Marina Danilevsky, nhà khoa học nghiên cứu cấp cao của IBM, cho biết trong tập podcast. “Thay vì để nội dung do người hâm mộ tạo ra tràn lan không thể kiểm soát trên các nền tảng mạng xã hội, họ đang thu hút nó trở lại hệ sinh thái của riêng mình, có thể phát trực tuyến các video này trên Disney+ và duy trì sự tích hợp chặt chẽ hơn với nền tảng”.

Đối với các chủ sở hữu quyền sở hữu trí tuệ khác, những tác động này khó có thể bỏ qua. “Nó thực sự đảo ngược tình thế” Keen nói. “Giờ đây, nếu bạn có quyền sở hữu trí tuệ, nhưng không thể tạo ra nó trong Sora, liệu bạn có đang bỏ lỡ điều gì không?”.

AI (machine learning và các công cụ như chatbot, robot, trợ lý AI, gen AI) được dùng để xử lý lượng dữ liệu rất lớn trong chuỗi cung ứng, dự báo xu hướng, tự động hóa tác vụ phức tạp theo thời gian thực để hỗ trợ ra quyết định dựa trên dữ liệu.

Trong vận hành, AI được ứng dụng vào dự báo nhu cầu, tối ưu lộ trình vận chuyển, giảm tiêu hao nhiên liệu, theo dõi tồn kho, tự động hóa tài liệu và nâng cao khả năng “nhìn xuyên suốt” chuỗi cung ứng. AI agent (agentic AI) có thể nhận yêu cầu ngôn ngữ tự nhiên, phân tích dữ liệu nội bộ và bên ngoài để đưa ra đề xuất trong các mảng như mua hàng, lập kế hoạch và logistics.

Lợi ích chính của AI trong chuỗi cung ứng

  • Giảm chi phí vận hành: AI học và tự động hóa các nhiệm vụ lặp lại (như theo dõi tồn kho), phát hiện điểm nghẽn, phân tích hiệu suất nhà cung cấp, so sánh giá và đề xuất nhà cung cấp thay thế để tối ưu chi tiêu.
  • Quyết định thời gian thực: AI sử dụng dữ liệu lịch sử và thời gian thực (kể cả yếu tố bên ngoài như thời tiết) để dự báo biến động nhu cầu, tránh thiếu hàng hoặc tồn kho dư và giảm nhu cầu nhập liệu thủ công.
  • Giảm lỗi và lãng phí: thuật toán có thể phát hiện sớm lỗi nhân sự, lỗi sản phẩm, hỗ trợ tăng cường quản trị rủi ro và tích hợp trực tiếp vào hệ thống ERP để ngăn lỗi trước khi xảy ra.

AI còn giúp quản lý tồn kho tinh gọn hơn (giảm chi phí lưu kho, đảm bảo sẵn hàng), nâng cao độ chính xác đơn hàng và cập nhật trạng thái giao hàng cho khách hàng, qua đó tăng năng suất và trải nghiệm.

Về tính bền vững, AI tối ưu lộ trình giao hàng, giảm lãng phí sản phẩm, đồng thời dùng mô phỏng để dự báo và kiểm tra kịch bản gián đoạn vận hành.

Thách thức và rủi ro khi ứng dụng

Việc triển khai AI đòi hỏi thời gian đào tạo nhân sự, gây ra khoảng thời gian “downtime” cần được lập kế hoạch trước để không làm gián đoạn hoạt động. Chi phí khởi động bao gồm phần mềm, mô hình ML (dùng sẵn hoặc xây mới) và yêu cầu dữ liệu lịch sử sạch để huấn luyện.

Hệ thống AI quy mô toàn cầu phức tạp, cần đội ngũ lập kế hoạch chuỗi cung ứng thường xuyên giám sát và tinh chỉnh. Ba nhóm rủi ro lớn.

  • Dữ liệu không chính xác hoặc thiên lệch (dẫn đến kết quả sai, cần con người kiểm tra)
  • Nguy cơ phụ thuộc quá mức vào AI (AI chỉ nên bổ trợ, không thay thế chuyên môn con người)
  • Các vấn đề an ninh, quyền riêng tư do thu thập, sử dụng dữ liệu khách hàng ở quy mô lớn.

6 bước chuẩn bị chuỗi cung ứng cho AI

  1. Đánh giá hiện trạng mạng lưới logistics: nhận diện điểm nghẽn, vấn đề từ đầu đến cuối, làm sạch dữ liệu và phân loại dữ liệu có cấu trúc/phi cấu trúc.
  2. Lập lộ trình (roadmap): ưu tiên vấn đề cần giải quyết trước, phân loại theo mức độ quan trọng và tác động.
  3. Thiết kế và chọn giải pháp: so sánh các hệ thống, cân nhắc mục tiêu quản trị chuỗi cung ứng và có thể thuê chuyên gia tư vấn.
  4. Triển khai: phối hợp nhà tích hợp hệ thống, đội IT nội bộ và nhà cung cấp giải pháp; chuẩn bị tinh thần cho lỗi và trục trặc.
  5. Chuẩn bị nhân viên: xây dựng kế hoạch truyền thông nội bộ, lịch đào tạo và quản lý downtime trong quá trình chuyển đổi.
  6. Giám sát liên tục: thường xuyên kiểm thử, theo dõi kết quả điều chỉnh và lưu lại để tinh chỉnh định kỳ.

Trợ lý mã hóa (Coding assistants) hứa hẹn mang đến cho nhà phát triển khả năng ra mắt sản phẩm nhanh hơn, đồng thời cải thiện quy trình làm việc. Tuy nhiên, khi lập trình cho doanh nghiệp, họ cần công cụ có thể thích ứng với môi trường và công việc của mình. IBM Bob, nền tảng năng suất dành cho nhà phát triển ưu tiên AI của IBM, đã được giới thiệu đầu năm nay tại hội nghị TechXchange.

“Chúng tôi gọi đó là tự động hóa những việc hiển nhiên, tự động hóa những việc tầm thường”, Neel Sundaresan, Tổng Giám đốc Tự động hóa và AI tại IBM, cho biết trong cuộc phỏng vấn với IBM Think. “Có rất nhiều công việc ở mỗi giai đoạn đều rất tầm thường: làm thế nào để tự động hóa chúng? Rồi những công việc phức tạp: làm thế nào để tăng cường công việc của tôi?”.

Bob được kỳ vọng sẽ là đồng đội đáng tin cậy cho nhà phát triển - một cặp lập trình viên cho thời đại AI. Nó sử dụng ngôn ngữ tự nhiên, đơn giản hóa cách các kỹ sư phần mềm viết hoặc hiện đại hóa mã. Bob không chỉ giao tiếp với con người mà trò chuyện tự nhiên với các agent khác.

Sundaresan cho biết: "Khi chúng ta bước vào thời đại mà tôi gọi là 'Phần mềm 4.0', các agent ngày càng tự động giao tiếp với agent khác bằng ngôn ngữ của con người. Đột nhiên, máy tính nói chuyện với nhau bằng ngôn ngữ của con người thay vì con người nói chuyện với nhau bằng ngôn ngữ máy tính”.

Bob cũng được tối ưu chi phí và tự động chọn mô hình phù hợp cho từng trải nghiệm. "Nếu ai đó xây dựng hệ thống phần mềm và liên hệ trực tiếp với một trong những nhà cung cấp mô hình tiên tiến, giả sử bạn phải trả một đô", Sundaresan nói. "Với Bob, chi phí sẽ vào khoảng 40, 45 xu”.

Ban đầu, Bob ra mắt như dự án nội bộ vào tháng 4, với một trăm người dùng. Hiện nay, nó được 10.000 nhà phát triển IBM sử dụng trên khắp các lĩnh vực phần mềm, tư vấn và cơ sở hạ tầng. Sundaresan báo cáo rằng năng suất của người dùng Bob đã tăng 45% và nhận được rất nhiều phản hồi tích cực.

Bob dự kiến ra mắt công chúng vào năm sau. Hãy theo dõi Bút Chì Community để cập nhật thông tin.

Theo nghiên cứu từ Viện Giá trị Doanh nghiệp (IBV) của IBM, các Giám đốc Dữ liệu (CDO) hiện đối mặt với nhiệm vụ rõ ràng: sử dụng dữ liệu doanh nghiệp để hỗ trợ AI và thúc đẩy kết quả kinh doanh có thể đo lường được, hoặc bị bỏ lại phía sau.

Nghiên cứu của IBV khảo sát 1.700 CDO trên toàn cầu, cho thấy thực tế khắc nghiệt: trong khi 81% cho biết chiến lược dữ liệu là một phần trong lộ trình công nghệ, chỉ có 26% tin tưởng năng lực dữ liệu của họ đã sẵn sàng để hỗ trợ các nguồn doanh thu mới được hỗ trợ bởi AI.

Theo Haynes Cooney, Giám đốc Nghiên cứu về Lãnh đạo Tư duy tại IBV, một trong những đồng tác giả của nghiên cứu, hầu hết các CDO đều coi các kho dữ liệu riêng biệt là một thách thức, với 83% cho biết chúng cản trở đổi mới, cản trở khả năng phân tích thời gian thực cũng như ra quyết định của tổ chức.

"Nhiều tổ chức ban đầu xây dựng các kho dữ liệu riêng biệt vì những lý do rất chính đáng, bao gồm cả mục đích quản lý và chức năng", ông nói trong cuộc phỏng vấn với IBM Think. "Tin tốt là các kiến trúc dữ liệu hiện đại cho phép truy cập, quản lý và quản trị theo thời gian thực mà không cần phải di chuyển dữ liệu”.

78% CDO cho biết tận dụng dữ liệu độc quyền sẽ giúp tổ chức nổi bật trên thị trường. Tuy nhiên, sở hữu dữ liệu giá trị / khai thác giá trị từ dữ liệu là hai chuyện khác nhau.

Vậy con đường phía trước là gì?

“Không có giải pháp nào phù hợp cho tất cả, nhưng thật khó để tưởng tượng một tổ chức có thể thành công nếu không thay đổi tư duy, coi dữ liệu là tài sản chiến lược xuyên suốt”, Cooney nói. “Tập trung vào quản lý dữ liệu, thay vì sở hữu dữ liệu, nhân viên sẽ tạo ra giá trị mới từ dữ liệu, thay vì bơi trong bể thông tin mơ hồ”.

Prompt tuning là kỹ thuật tinh chỉnh hiệu quả thông số (PEFT) cho các mô hình AI lớn mà không cần cập nhật hàng tỷ tham số. Thay vào đó, nó học một nhóm nhỏ các vector huấn luyện gọi là "soft prompts" (vector ảo) được chèn vào không gian đầu vào của mô hình, dẫn dắt mô hình hướng đến hành vi mong muốn mà không làm thay đổi backbone.

Khác biệt giữa "prompting" và "fine-tuning"

- Prompt engineering sử dụng các câu lệnh dạng văn bản (hard prompts), dễ bị ảnh hưởng bởi thay đổi nhỏ về ngôn từ, khó tối ưu ở quy mô lớn.

- Fine-tuning cập nhật toàn bộ tham số mô hình, rất tốn tài nguyên tính toán và lưu trữ mỗi lần thực hiện.

- Prompt tuning cân bằng cả hai, chỉ huấn luyện các embedding liên tục, đạt hiệu năng gần như fine-tuning mà tiết kiệm tài nguyên.

Các thành phần chính của prompt tuning

  • Mô hình tiền huấn luyện được đóng băng (frozen backbone).
  • Embedded soft prompt: vector huấn luyện thêm vào đầu vào.
  • Dataset gán nhãn cho từng tác vụ.
  • Chỉ tham số soft prompt và (nếu có) head nhẹ được tối ưu, không ảnh hưởng backbone.

So sánh với các phương pháp PEFT khác

  • Deep prompt tuning thêm vector vào mọi lớp.
  • LoRA thêm ma trận low-rank vào các lớp attention.
  • Adapter thêm module mạng nhỏ vào các lớp Transformer.

Ưu điểm: Tiết kiệm tham số và chi phí, giữ nguyên kiến thức đã học ban đầu của model, dễ điều chỉnh và quản lý, phù hợp với môi trường tài nguyên hạn chế.

Giới hạn: Sức diễn đạt kém hơn LoRA/fine-tuning hoàn toàn, khó tối ưu hyperparameter, thiếu khả năng giải thích (black box), phụ thuộc vào quy mô backbone.

Ứng dụng: Dễ dàng tùy biến cho NLP, mô hình kết hợp thị giác-ngôn ngữ (VLM), xử lý tiếng nói, học nhiều nhiệm vụ/ngôn ngữ.

Prompt tuning là phương pháp hiệu quả, tiết kiệm, dễ mở rộng, tùy chỉnh các mô hình AI lớn hiện nay.

Chạy các agent cục bộ trên máy chủ riêng là bình thường. Nhưng bỗng một ngày, bạn muốn cho phép người khác truy cập hoặc triển khai chúng thì sao? Lẽ nào bó tay!

Để đáp ứng nhu cầu này, IBM giới thiệu Agent Stack, một cơ sở hạ tầng mở, tự lưu trữ để triển khai các agent AI được xây dựng với bất kỳ nền tảng nào, tại Hội nghị thượng đỉnh A2A của Linux ở New York.

Sandi Besen, Kỹ sư nghiên cứu AI và Trưởng nhóm hệ sinh thái tại IBM Research, cho biết trong cuộc phỏng vấn với IBM Think: "Agent Stack thu hẹp khoảng cách mà bạn cần lấp đầy giữa việc chạy các agent trên laptop và triển khai chúng ở đâu đó để người khác có thể sử dụng chung".

Được xây dựng trên giao thức Agent2Agent (A2A), Agent Stack hoàn toàn là mã nguồn mở, không phụ thuộc vào nhà cung cấp. "Agent Stack cung cấp một điểm đến triển khai duy nhất, giúp các dev có thể chia sẻ và khám phá các agent, bất kể họ sử dụng tool hay công nghệ nào để xây dựng", Kate Blair, Giám đốc Ươm tạo và Trải nghiệm Công nghệ tại IBM, chia sẻ với IBM Think.

Besen cho biết: “Agent Stack, trước đây là BeeAI Platform. Nếu bạn là nhóm nhỏ, tổ chức nghiên cứu, công ty khởi nghiệp muốn tự lưu trữ các nội dung mã nguồn mở, Agent Stack là bước đi đúng đắn vì nó minh bạch và tự quản lý”.

Các nhà nghiên cứu AI cho biết làn sóng nâng cấp bộ nhớ mới nhất đang đưa khả năng nhớ lại của máy móc tiến gần hơn một chút đến cách bộ não con người học hỏi và thích nghi.

Tháng này, các nhà nghiên cứu Google đã công bố một phương pháp đào tạo mới mang tên "Học tập lồng ghép" có thể giúp trí tuệ nhân tạo lưu giữ kiến thức cũ trong khi học các nhiệm vụ mới. Nghiên cứu này nhằm giải quyết xu hướng ghi đè kiến thức đã biết của mô hình bằng cách chuyển đổi bộ nhớ thành quy trình phân lớp, trong đó các phần khác nhau của mô hình thích ứng với tốc độ khác nhau.

“Mô hình học tập lồng ghép mô phỏng quá trình đào tạo giống với não người hơn. Con người học chậm và lặp đi lặp lại, trong khi học sâu dễ mở rộng, tốc độ nhanh hơn”, Gabe Goodhart, Kiến trúc sư trưởng AI Open Innovation tại IBM, cho biết trong cuộc phỏng vấn với IBM Think.

Goodhart gọi khái niệm Học tập lồng ghép là tinh tế, nhưng không phải không có rủi ro. "AI hiện đại dựa vào trọng số tĩnh để xây dựng niềm tin - nếu nó đã hiệu quả hôm qua, thì hôm nay nó cũng sẽ hiệu quả", ông nói. "Một mô hình học tập liên tục có thể hoạt động khác nhau đối với người dùng khác nhau, điều này làm phát sinh các vấn đề về bảo mật và tính nhất quán”.

Ý tưởng này hướng đến một tương lai trong đó các hệ thống AI sẽ phản hồi theo sự phát triển của người dùng thay vì bị giới hạn ở trạng thái ban đầu, Goodhart cho biết. "Nếu được triển khai cẩn thận, nó có thể dẫn đến những mô hình được cá nhân hóa thực sự, học hỏi cùng bạn thay vì bị đóng băng theo thời gian", ông nói thêm.

Liệu AI nguồn mở có thể vượt trội hơn hệ thống đóng? Nhờ mô hình mới nhất từ phòng nghiên cứu AI Moonshot AI của Trung Quốc, câu trả lời cho câu hỏi gây tranh cãi này cuối cùng có thể là có.

Theo Moonshot AI, Kimi K2 Thinking là agent nguồn mở, đang cho thấy vượt trội hơn các mô hình tiên phong từ OpenAI và xAI trên các tiêu chuẩn quan trọng như Bài kiểm tra cuối cùng của Humanity và BrowseComp.

“Đây thực sự là cột mốc nguồn mở lớn và là thách thức đối với toàn bộ nền kinh tế AI khép kín”, Nhà khoa học Nghiên cứu Chính của IBM, Kaoutar El Maghraoui, phát biểu trong tập gần đây của podcast Mixture of Experts. “Đối với doanh nghiệp, sự thống trị của giải pháp mở này có nghĩa là cuối cùng bạn cũng có thể đưa công nghệ lập trình hàng đầu vào nội bộ với chi phí thấp hơn".

Nhưng năng lực và hiệu quả có lẽ không còn đủ để phân biệt một mô hình, xét theo thông điệp trong bản phát hành mô hình biên giới (đóng) mới nhất của OpenAI, GPT-5.1, ngay sau Kimi K2 Thinking.

Thay vì tập trung vào sức mạnh cốt lõi, OpenAI lấy cảm hứng từ người dùng: "Chúng tôi đã lắng nghe người dùng rằng một AI tuyệt vời không chỉ cần thông minh mà phải dễ trò chuyện nữa", công ty tuyên bố trong bài đăng trên blog khi giới thiệu GPT-5.1. Chính vì vậy, agent mới nhất của OpenAI trở nên thân thiện hơn, thậm chí vui vẻ hơn khi trò chuyện với người dùng với nhiều tính cách khác nhau.

El Maghraoui cho biết: “Chúng tôi bắt đầu nhận thấy phân khúc thị trường đang phân mảnh giữa mô hình tập trung vào hiệu quả thuần túy và mô hình đang cố gắng giành chiến thắng bằng trải nghiệm người dùng. Hay nói cách khác, đó là cuộc chiến giữa chỉ số IQ và EQ của mô hình".

Các công ty AI đang đặt cược vào trình duyệt, nhưng các chuyên gia bảo mật khuyến cáo khoan từ từ.

Trình duyệt web đã có những bước tiến đáng kể từ khi ra đời vào thập niên 1990, từ những cửa sổ văn bản trên chiếc máy tính cồng kềnh trở thành một phần thiết yếu trong cuộc sống hàng ngày. Đó là lý do tại sao các công ty AI đang cố gắng nhảy vào lĩnh vực này với các ứng dụng hỗ trợ agent, cho phép người khác (hoặc thứ gì đó) duyệt web thay bạn, chẳng hạn như Atlas của OpenAI và Comet của Perplexity.

Các agent có thể hữu ích cho đặt lịch hẹn hoặc lên kế hoạch sự kiện. Tuy nhiên, các chuyên gia từ IBM khuyến cáo người dùng và doanh nghiệp nên thận trọng khi sử dụng trình duyệt AI chạy bằng agent.

“Những trình duyệt AI chưa sẵn sàng cho mục đích sử dụng trong doanh nghiệp”, JR Rao, thành viên IBM và Giám đốc Công nghệ (CTO) của Security Research, phát biểu. “Chúng chưa sẵn sàng cho những rủi ro lớn, đặc biệt khi bạn có dữ liệu nhạy cảm”.

Microsoft và Google đã giới thiệu các phiên bản trợ lý duyệt web AI, không chỉ tóm tắt kết quả tìm kiếm mà có thể tự động hóa các tác vụ như mua hàng hoặc lên lịch. Tuy nhiên, để hoạt động hiệu quả, các trợ lý AI cần có quyền truy cập vào dữ liệu cá nhân của người dùng.

Đối với các doanh nghiệp, rủi ro an ninh mạng liên quan đến trình duyệt AI ở giai đoạn đầu này có thể lớn hơn lợi ích. Các nhà nghiên cứu từ công ty Internet Brave Software đã phát hiện ra lỗ hổng mã độc nhanh chóng trong trình duyệt AI, khiến chúng có thể bị lợi dụng cho mục đích xấu sau khi vô tình tiếp nhận các lệnh ẩn của kẻ tấn công.

"Lời hứa đã có rồi, chúng ta chỉ hơi sớm một chút thôi", Dave McGinnis, Đối tác Toàn cầu của IBM Cyber Threat Management, cho biết. "Chúng quá dễ bị bẻ khóa trong ba nốt nhạc”.

Nhưng nếu bạn tò mò muốn thử công nghệ này thì sao? "Tôi thực sự muốn sử dụng nó trong một cỗ máy mà tôi chưa từng lưu trữ bất kỳ [thông tin cá nhân] nào", Suja Viswesan, Phó Chủ tịch Sản phẩm Bảo mật tại IBM, cho biết.

Sử dụng kỹ thuật mới để cải thiện khả năng ghi nhớ của AI bằng cách mô phỏng trí nhớ con người. DeepSeek-OCR đạt 4.000 sao trên GitHub chỉ trong vòng 24 giờ, giữ vững vị trí dẫn đầu danh sách mô hình phổ biến nhất của Hugging Face trong hơn một tuần.

Thay vì đưa văn bản vào mô hình dưới dạng token như hầu hết các mô hình khác, DeepSeek-OCR chuyển đổi tài liệu thành hình ảnh, một phương pháp mà nghiên cứu của công ty cho thấy có thể hiệu quả hơn token văn bản trong đào tạo các LLM.

Trong cuộc phỏng vấn với IBM Think, Kaoutar El Maghraoui, Nhà khoa học Nghiên cứu chính tại IBM, đã ca ngợi phương pháp này là "sáng tạo". Bà cho biết, "sử dụng công nghệ nén token thị giác để chuyển đổi hình ảnh tài liệu thành token nhỏ gọn giúp giảm đáng kể độ dài ngữ cảnh và chi phí".

Theo bài báo kỹ thuật kèm theo bản phát hành mô hình, cứ 10 mã thông báo văn bản, DeepSeek-OCR chỉ cần một "mã thông báo thị giác" để biểu diễn cùng một thông tin với độ chính xác 97%. Một con số rất cao, đạt được 4.000 sao là đương nhiên.

Các nhà nghiên cứu viết rằng, mô hình đạt được hiệu quả này bằng cách mô phỏng trí nhớ con người, và auto "quên" đi một số chi tiết nhất định theo thời gian. "Phương pháp nén quang học cho phép một dạng suy giảm trí nhớ phản ánh quá trình quên lãng sinh học... Thông tin gần đây vẫn duy trì độ trung thực cao, trong khi những ký ức xa xưa mờ dần khi tỷ lệ nén tăng lên." Hay nói một cách ngắn gọn: đừng cố nhớ những gì đáng quên.

El Maghraoui cho biết DeepSeek không phải công ty duy nhất chuyển sang mô hình nguồn mở. Docling của IBM ra mắt một năm trước, giải quyết thách thức này bằng phương pháp khác. "Trong khi DeepSeek-OCR nổi bật về thông lượng OCR thô và hiệu quả với mã thông báo, Docling vượt trội về khả năng chuyển đổi và cấu trúc đầu cuối".

Trên thực tế, DeepSeek-OCR và Docling có thể "bổ sung" cho nhau, bà nói. "DeepSeek-OCR có thể đóng vai trò là giao diện trích xuất văn bản tốc độ cao, độ chính xác cao, trong khi Docling tiếp nhận kết quả đầu ra, làm phong phú chúng bằng định dạng, bảng biểu và cấu trúc ngữ nghĩa cho các nhu cầu cần phân tích sâu hơn trong môi trường doanh nghiệp".