AI News 17/06/2026: Microsoft đổi cách tính tiền Copilot Cowork và benchmark chống nội dung tuyên truyền của 60 mô hình AI

Ngày 17 tháng 6, 2026 · ~4 phút đọc

Bảng xếp hạng Top 10 mô hình AI kháng tuyên truyền với các cột loại câu hỏi và ngôn ngữ, Claude Fable 5 đứng đầu với 95,2 điểm. Tin chính ngày 17/06/2026: Benchmark Viện Ngôn ngữ Estonia đánh giá 60 mô hình AI về khả năng xử lý nội dung tuyên truyền — Claude Fable 5 dẫn đầu với 95,2 điểm.

Ngày 17/6, hai tin tức AI đáng chú ý bao gồm: Microsoft chuyển Copilot Cowork sang tính phí theo lượng dùng thực tế và cân nhắc thêm một mô hình DeepSeek giá rẻ; Viện Ngôn ngữ Estonia công bố benchmark đánh giá 60 mô hình AI trên khả năng xử lý nội dung tuyên truyền. Hai tin tức cho thấy hai tiêu chí doanh nghiệp cần đưa vào tầm ngắm khi chọn công cụ AI là chi phí vận hành và chất lượng mô hình khi tiếp xúc thông tin nhiễu.

1. Microsoft đổi cách tính tiền Copilot Cowork: trả theo lượng dùng, cân nhắc thêm DeepSeek

Microsoft đang chuyển Copilot Cowork sang cách tính phí mới: thay vì phí cố định hàng tháng, doanh nghiệp trả tiền theo lượng compute thực sự dùng. Cowork vốn chạy trên công nghệ Claude của Anthropic, vận hành nặng theo lối agentic và tiêu thụ token rất nhanh, nên đây chính là gốc rễ của vấn đề chi phí.

Charles Lamanna, Phó chủ tịch điều hành phụ trách Copilot của Microsoft chia sẻ mô hình phí cố định không hiệu quả khi có người dùng chạy “hàng trăm tác vụ mỗi tuần”. Với agentic AI, chi phí có thể tăng vọt mà không ai kiểm soát kịp.

Song song đó, hãng tin Axios đưa tin Microsoft đang cân nhắc tích hợp một phiên bản DeepSeek V4 (mô hình AI Trung Quốc) được tinh chỉnh thêm, tự vận hành trên Azure. Đây là tùy chọn không bắt buộc. Phiên bản này cũng đã được tùy biến với các lớp bảo vệ chống thiên lệch. Dữ liệu khách hàng vẫn nằm trong hạ tầng Azure theo tiêu chuẩn bảo mật hiện có. Microsoft dự kiến đưa ra quyết định cuối cùng trong vài tuần tới.

Khi công cụ agentic AI tự gọi mô hình hàng trăm lần để hoàn thành một quy trình, không ai nhận ra hóa đơn AI đã vượt ngoài ngân sách cho đến cuối tháng. Sự chuyển dịch sang tính phí theo lượng dùng là cách Microsoft chuyển gánh nặng kiểm soát chi phí lên cho phía doanh nghiệp.

Với các đội ngũ đang dùng Copilot Cowork hay các công cụ agentic tương tự, câu hỏi chuyển từ “công cụ này có mạnh không” sang “ngân sách AI được giám sát ở điểm nào trong luồng xử lý”.

Nguồn: The Decoder

Ghi chú thuật ngữ

  • Compute: Lượng tài nguyên tính toán (bộ xử lý, bộ nhớ) mà hệ thống AI tiêu thụ khi xử lý yêu cầu.
  • Token: Đơn vị văn bản mà mô hình AI xử lý; càng nhiều token thì chi phí và tài nguyên tiêu thụ càng lớn.
  • Agentic AI: Công cụ AI hoạt động tự động theo chuỗi bước, tự gọi mô hình nhiều lần để hoàn thành nhiệm vụ mà không cần can thiệp liên tục từ người dùng.
  • Tinh chỉnh (fine-tune): Huấn luyện thêm một mô hình AI sẵn có trên dữ liệu chuyên biệt để cải thiện hiệu suất cho một tác vụ cụ thể.

2. Benchmark xử lý nội dung tuyên truyền: Claude Fable 5 dẫn đầu, Mistral xếp nhóm cuối

Viện Ngôn ngữ Estonia vừa công bố một benchmark hiếm gặp: không đo khả năng viết hay lập luận, mà đo xem tuyên truyền có thể tác động lên các mô hình AI đến mức nào. Nghiên cứu kiểm tra 60 mô hình AI qua 75 câu hỏi bằng ba ngôn ngữ, bao phủ 14 luận điểm tuyên truyền của Nga theo ba hướng: trung lập, thiên vị và mang tính thao túng. Mỗi câu trả lời được chấm trên thang 1 đến 5, trong đó 1 nghĩa là mô hình lặp lại luận điệu của Nga. Mô hình chấm điểm là một bản Claude Opus 4.5 được hiệu chỉnh, và được kiểm định bởi chuyên gia xử lý nội dung tuyên truyền của tổ chức Propastop.

Claude Fable 5 dẫn đầu với 95,2 điểm, tiếp theo là Claude Opus 4.7, NVIDIA Nemotron 3 và Alibaba Qwen 3.6 Plus. Cả bốn phiên bản Mistral trong bài kiểm tra, kể cả bản Medium 3.5 mới nhất, đều nằm ở nhóm một phần ba cuối bảng. Lưu ý là các mô hình không được truy cập tìm kiếm web hay công cụ nào khi kiểm tra, nên benchmark chỉ đo chính khả năng tự nhận diện và từ chối tuyên truyền của mô hình.

Kết quả này có khả năng gây ảnh hưởng xấu đến hình ảnh Mistral khi công ty đang định vị mình là lựa chọn vì “chủ quyền châu Âu” trong bối cảnh căng thẳng địa chính trị. Điểm thấp trong bài kiểm tra đo khả năng xử lý nội dung tuyên truyền đi ngược lại với hình ảnh đó.

Như vậy, benchmark này không đánh giá mô hình nào thông minh hơn, mà mô hình nào giữ được lập trường khi bị hỏi theo lối thao túng. Với đội ngũ dùng AI để phân tích thông tin từ nhiều nguồn, tổng hợp tin tức hay hỗ trợ ra quyết định, đây là một loại rủi ro đáng đưa vào tiêu chí chọn công cụ.

Nguồn: The Decoder

Ghi chú thuật ngữ

  • Benchmark: Bộ kiểm thử tiêu chuẩn dùng để so sánh hiệu suất giữa các mô hình AI trên một tiêu chí cụ thể.
  • Propastop: Tổ chức phi lợi nhuận của Estonia chuyên theo dõi và phản bác tuyên truyền, tham gia kiểm định kết quả benchmark.

Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.

Chia sẻ bài viết
Facebook LinkedIn Threads