Ngày 16/7, ba tin tức AI đáng chú ý bao gồm: OpenAI công bố GPT-Red, một mô hình chuyên đi tấn công các AI agent khác để vá lỗ hổng trước khi tin tặc khai thác; Apple mở Siri AI thế hệ mới cho người dùng phổ thông qua bản beta iOS 27; và Trung Quốc thi hành luật buộc các nền tảng lớn tắt tính năng AI nhân cách hóa. Ba câu chuyện, từ ba góc khác nhau, cùng chạm đến một câu hỏi: khi AI ngày càng mạnh, ai kiểm soát rủi ro và bảo vệ người dùng?
1. OpenAI dùng AI để tấn công AI trước khi tin tặc làm điều đó
OpenAI vừa giới thiệu GPT-Red, một mô hình được huấn luyện chuyên biệt để tấn công các AI agent nhằm phát hiện lỗ hổng trước khi chúng bị khai thác ngoài thực tế. Thay vì dựa chủ yếu vào các nhóm red team là con người, GPT-Red tự động mô phỏng nhiều kiểu tấn công để giúp tăng độ an toàn của các mô hình mới. Theo OpenAI, phương pháp này đã góp phần cải thiện khả năng phòng thủ của GPT-5.6.
GPT-Red được huấn luyện theo cơ chế self-play: một mô hình đóng vai kẻ tấn công, các mô hình khác đóng vai phòng thủ và liên tục đối đầu trong môi trường mô phỏng các tác vụ như duyệt web, đọc email hay chỉnh sửa mã nguồn. Qua nhiều vòng lặp, cả khả năng tấn công lẫn phòng thủ đều được cải thiện.
Một trong những trọng tâm là prompt injection – kỹ thuật chèn chỉ dẫn độc hại vào dữ liệu mà AI đọc để khiến mô hình thực hiện những hành động ngoài ý muốn. OpenAI cho biết GPT-Red không chỉ khai thác các kỹ thuật đã biết mà còn phát hiện một dạng tấn công mới, trong đó mô hình bị đánh lừa bằng các thông tin giả xuất hiện trong quá trình suy luận.
Theo kết quả thử nghiệm của OpenAI, hơn 90% các đòn tấn công của GPT-Red thành công trên GPT-5, nhưng tỷ lệ này giảm xuống dưới 23% với GPT-5.6 sau khi áp dụng huấn luyện đối kháng. Trong một thử nghiệm minh họa, GPT-Red tấn công Vendy, một AI agent quản lý máy bán hàng tự động, và đã đổi được bảng giá lẫn hủy đơn của khách. Ở một phép thử khác, khi lặp lại một thí nghiệm năm 2025, GPT-Red tìm ra các đòn tấn công hiệu quả nhiều hơn hẳn so với nhóm kiểm thử là con người.
OpenAI cho biết GPT-Red không nhằm thay thế các chuyên gia bảo mật mà bổ sung cho quy trình kiểm thử hiện có. Khi AI agent ngày càng được triển khai trong môi trường thực tế, việc dùng AI để tự động tìm kiếm lỗ hổng có thể sẽ trở thành một phần quan trọng trong quy trình phát triển.
Nguồn: MIT Technology Review
Ghi chú thuật ngữ
- Red-team: Nhóm hoặc công cụ chuyên cố tình tấn công một hệ thống để tìm điểm yếu trước khi kẻ xấu tìm ra.
- Self-play (tự đấu): Cách huấn luyện trong đó các mô hình đấu với nhau qua nhiều vòng, mỗi bên buộc bên kia phải mạnh lên.
- Prompt injection: Kỹ thuật tấn công nhúng lệnh ẩn vào dữ liệu mà AI đọc, khiến mô hình thực thi hành động ngoài ý muốn của người dùng hoặc nhà phát triển.
2. Apple mở bản beta Siri AI thế hệ mới cho người dùng phổ thông
Ngày 14/7, Apple phát hành bản beta công khai của iOS 27, lần đầu tiên cho phép người dùng phổ thông trải nghiệm Siri AI thế hệ mới trước khi hệ điều hành chính thức ra mắt vào mùa thu, dự kiến trong tháng 9.
Khác với Siri trước đây, phiên bản mới có thể hiểu ngữ cảnh trên thiết bị như email, tin nhắn, ảnh và nội dung đang hiển thị trên màn hình, đồng thời kết hợp khả năng trả lời kiến thức chung của các trợ lý AI hiện đại. Apple cho biết Siri sử dụng các Foundation Models chạy trực tiếp trên thiết bị, kết hợp với Private Cloud Compute. Trợ lý này cũng được tích hợp sâu hơn vào hệ điều hành và kết nối chặt chẽ với Spotlight.
Với khoảng 2,5 tỷ thiết bị Apple đang hoạt động, đây sẽ là đợt thử nghiệm thực tế lớn nhất từ trước đến nay đối với một trợ lý AI tích hợp sẵn trên hệ điều hành, dù trước mắt mới chỉ dành cho những người cài bản beta.
Tuy vậy, Siri AI vẫn đang trong giai đoạn hoàn thiện. Trong bản beta dành cho lập trình viên, TechCrunch cho biết Siri đôi khi trả lời sai hoặc hiểu nhầm yêu cầu; tuy nhiên các bản beta năm nay nhìn chung khá ổn định. Apple khuyến nghị những người cần thiết bị ổn định nên chờ bản phát hành chính thức.
Nguồn: TechCrunch
Ghi chú thuật ngữ
- Foundation Models: Tên Apple dùng cho các mô hình AI gốc thiết kế riêng cho thiết bị Apple, chạy trực tiếp trên máy mà không cần kết nối internet liên tục.
- Private Cloud Compute: Hạ tầng đám mây riêng của Apple, xử lý dữ liệu nhạy cảm mà không lưu hay để lộ nội dung cho nhân viên Apple.
3. Trung Quốc siết nhân cách hoá AI, các nền tảng lớn đồng loạt gỡ tính năng
Ngày 15/7, Trung Quốc chính thức áp dụng bộ quy định mới đối với các dịch vụ nhân cách hóa AI, được ban hành từ tháng 4. Trước thời điểm luật có hiệu lực, ByteDance đã vô hiệu hóa tính năng này trên Doubao từ ngày 15/7, Alibaba gỡ các tác nhân giống người trên Qwen từ 10/7, còn Tencent đã thực hiện với Yuanbao từ tháng 6.
Động thái này ảnh hưởng đến quy mô người dùng rất lớn. Riêng Doubao hiện có hơn 300 triệu người dùng hoạt động mỗi tháng. Theo quy định mới, các dịch vụ AI phải cảnh báo khi người dùng sử dụng quá mức, can thiệp nếu phát hiện dấu hiệu lệ thuộc, tăng cường bảo vệ trẻ vị thành niên và không được sử dụng dữ liệu hội thoại nhạy cảm để huấn luyện mô hình.
Trung Quốc không phải là quốc gia duy nhất siết quản lý AI đồng hành. Tại Mỹ, bang California đã thông qua quy định yêu cầu các dịch vụ AI chặn các cuộc hội thoại liên quan đến tự tử và tự gây hại, trong khi OpenAI và Character.AI cũng đang đối mặt với các vụ kiện liên quan đến tác động tâm lý của chatbot đối với người dùng.
Diễn biến này cho thấy quản lý AI đang chuyển từ việc ban hành các nguyên tắc chung sang can thiệp trực tiếp vào tính năng của sản phẩm. Với các công ty phát triển AI hướng tới người tiêu dùng, yêu cầu pháp lý ngày càng có thể tác động trực tiếp đến thiết kế và cách vận hành dịch vụ.
Nguồn: The Decoder
Ghi chú thuật ngữ
- Nhân cách hóa AI: Thiết kế AI mô phỏng đặc điểm con người như tên gọi, giọng điệu, cảm xúc và lịch sử quan hệ cá nhân, tạo cảm giác tương tác với một “người” thay vì một công cụ.
Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.
