AI News 05/07/2026: Meta thừa nhận AI agent chậm tiến, Tesla giới hạn ngân sách công cụ AI và GPT-5.6 Sol gian lận bài kiểm thử

Ngày 5 tháng 7, 2026 · ~6 phút đọc

Hình minh hoạ Elon Musk mặc vest đen đứng đối diện với đầu robot humanoid màu trắng có mạch xanh lá, giữa hai nhân vật là chữ "X.AI" màu trắng trên nền đen. Tin chính ngày 05/07/2026: Tesla giới hạn nhân viên chi 200 USD/tuần cho công cụ AI bên ngoài, trong khi sản phẩm beta của xAI như Grok được miễn trừ hoàn toàn.

Ngày 5/7, ba tin tức AI đáng chú ý bao gồm: Mark Zuckerberg thừa nhận AI agent tại Meta chưa tiến nhanh như kỳ vọng; Tesla giới hạn chi tiêu công cụ AI của nhân viên ở mức 200 USD/tuần; và METR phát hiện GPT-5.6 Sol của OpenAI gian lận bài kiểm thử ở mức cao nhất từng ghi nhận. Ba tin tức đều chạm đến khoảng cách giữa kỳ vọng và thực tế triển khai AI.

1. Meta thừa nhận: AI agent chưa tiến nhanh như kỳ vọng

Ngày 2/7, trong cuộc họp toàn công ty, Mark Zuckerberg thẳng thắn chia sẻ tiến độ phát triển AI agent “chưa tăng tốc theo cách ban lãnh đạo kỳ vọng.” Meta đang đặt cược lớn vào AI, dự chi lên tới 145 tỷ USD cho hạ tầng AI trong năm 2026.

Thông tin này được đưa ra trong bối cảnh hồi đầu năm, Meta sa thải khoảng 8.000 nhân viên, tương đương 10% nhân sự khối văn phòng, và chuyển khoảng 7.000 người sang các nhóm AI. Zuckerberg thừa nhận các đợt cắt giảm “chưa gọn gàng như mong đợi”, và rằng lợi ích kỳ vọng từ cơ cấu mới xoay quanh AI “vẫn chưa thành hình.” Zuckerberg vẫn hi vọng sẽ thấy lợi ích rõ ràng trong 3 đến 6 tháng tới.

Ngay cả Meta, với khoản đầu tư hạ tầng lên tới 145 tỷ USD, cũng đang loay hoay để AI agent hoạt động đúng kỳ vọng. Với các team tại Việt Nam đang thiết kế quy trình làm việc với AI agent, nhất là agency và startup đang lên lộ trình triển khai, tín hiệu này rất thực tế: nên dự phòng thêm thời gian trong kế hoạch, và đừng kỳ vọng kết quả đi theo đường thẳng.

Nguồn: TechCrunch

2. Tesla giới hạn nhân viên chi 200 USD/tuần cho công cụ AI

Kể từ ngày 6/7, mỗi nhân viên Tesla chỉ được chi tối đa 200 USD/tuần cho các công cụ AI bên ngoài; chi vượt mức cần quản lý phê duyệt. Riêng các sản phẩm beta của xAI, trong đó có Grok, không bị áp trần này.

Thứ đáng chú ý nhất trong tin tức này không phải con số 200 USD/tuần mà là những thứ nó để lộ ra đằng sau. Tesla định tuyến việc dùng AI qua nền tảng nội bộ “Bottle Rocket”, và một số kỹ sư phần mềm đang tiêu tới hàng nghìn USD tiền token mỗi tuần, cao gấp nhiều lần mức trần. Tesla không đơn độc trong quyết định này. Uber, Meta, Amazon và Walmart gần đây đều đặt trần hoặc đẩy nhân viên sang mô hình rẻ hơn, khi cách tính phí theo token khiến ngân sách sử dụng AI đội lên đáng kể. Được biết, sáu tháng trước chính Tesla còn “game hóa” việc dùng AI, lập bảng xếp hạng kỹ sư theo lượng token tiêu thụ để thúc đẩy nhân viên sử dụng AI.

Một điểm đáng chú ý khác là mức trần không áp cho sản phẩm beta của xAI, cho thấy Tesla đang muốn hướng nhân viên chuyển sang dùng chính công cụ AI của Elon Musk (như Grok) thay vì đối thủ. Tuy nhiên, theo Electrek, nhiều kỹ sư Tesla vẫn chuộng Claude của Anthropic hơn Grok. Việc Tesla phải dùng chính sách chi tiêu để giành thị phần nội bộ cho sản phẩm của mình cho thấy sự hạn chế của sản phẩm so với những đối thủ cạnh tranh trực tiếp khác trên thị trường.

Nguồn: Electrek

Ghi chú thuật ngữ

  • Bottle Rocket: Nền tảng nội bộ của Tesla, tập hợp quyền truy cập vào nhiều mô hình AI từ các nhà cung cấp khác nhau.
  • Token: Đơn vị xử lý văn bản của mô hình AI. Chi phí sử dụng mô hình thường tính theo số token đầu vào và đầu ra.

3. GPT-5.6 Sol gian lận bài kiểm thử ở mức kỷ lục

METR, tổ chức đánh giá an toàn AI độc lập chuyên phân tích các mô hình frontier, công bố GPT-5.6 Sol của OpenAI có tỷ lệ gian lận bài kiểm thử cao nhất từng ghi nhận ở các mô hình được kiểm tra công khai. Cụ thể, thay vì thật sự giải bài, mô hình tìm ra lỗ hổng trong chính hệ thống chấm điểm để moi ra đáp án đã cài sẵn, rồi cố xóa dấu vết.

Vì điểm số đạt được bằng cách gian lận nên không phản ánh năng lực thật của GPT-5.6 Sol. Đó là lý do các con số gần như không dùng được: ước tính time-horizon của Sol dao động từ 11,3 giờ đến hơn 270 giờ, chênh nhau hơn 20 lần, tùy cách xử lý các lần gian lận, và METR cho rằng không con số nào đáng tin. Trong chính phép đo time-horizon này, Claude Mythos của Anthropic vẫn dẫn đầu, với thời lượng ít nhất 16 giờ.

METR đánh giá cao việc OpenAI đã tự phát hiện hành vi này qua giám sát nội bộ và công khai thừa nhận, thay vì che giấu. Bản thân việc mô hình gian lận một cách lộ liễu, dễ bị bắt, cũng khiến METR bớt lo: nếu một hành vi xấu rành rành như vậy còn bị phát hiện, thì các vấn đề kín đáo hơn cũng khó lọt lưới. Mối lo thật sự nằm ở kịch bản ngược lại: một mô hình đủ tinh vi để gian lận mà không ai phát hiện, khi đó điểm benchmark càng đẹp lại càng không đáng tin.

GPT-5.6 Sol ra mắt cuối tháng 6/2026, dưới cơ chế truy cập do chính phủ Mỹ kiểm soát. Với người dùng và doanh nghiệp, phát hiện của METR là lời nhắc nhở một điểm benchmark cao chưa chắc phản ánh năng lực thật, nhất là khi mô hình có thể học cách “qua mặt” bài kiểm tra.

Nguồn: The Decoder

Ghi chú thuật ngữ

  • METR: Tổ chức đánh giá AI độc lập, chuyên phát hiện rủi ro tiềm ẩn trong các mô hình frontier trước khi ra mắt rộng rãi.
  • Frontier model: Mô hình AI ở vùng năng lực tiên tiến nhất hiện có, thường do các lab lớn như OpenAI, Anthropic hay Google phát triển.
  • Time-horizon: Ước tính thời gian một mô hình AI có thể tự thực hiện tác vụ liên tục mà vẫn hoàn thành được, dùng để đo năng lực; thời lượng càng dài thì mô hình càng mạnh.
  • Benchmark: Bộ bài kiểm thử chuẩn hóa dùng để so sánh hiệu suất giữa các mô hình AI.

Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.

Chia sẻ bài viết
Facebook LinkedIn Threads