Ngày 10/7, ba tin tức AI đáng chú ý bao gồm: OpenAI ra GPT-5.6 với ba phiên bản Sol, Terra và Luna, đưa mô hình frontier sang dạng “chọn theo nhu cầu” thay vì dùng một mô hình cho mọi việc; Meta Superintelligence Labs lần đầu bán mô hình sinh ảnh và video qua API với Muse Image và Muse Video; và General Intuition gọi vốn 320 triệu USD cho hướng dùng dữ liệu video game để huấn luyện robot.
1. GPT-5.6: OpenAI ra ba phiên bản, đặt dấu chấm hết cho “một mô hình cho mọi việc”
Ngày 9/7, OpenAI công bố GPT-5.6, họ mô hình mới gồm ba phiên bản: Sol (flagship), Terra (cân bằng), và Luna (tiết kiệm nhất). Cả ba có mặt đồng thời trên ChatGPT, ChatGPT Work, Codex và OpenAI API.
Cơ cấu giá phân tầng rõ ràng: Sol ở mức 5 USD/30 USD mỗi triệu token đầu vào/đầu ra, Terra ở 2,50 USD/15 USD, và Luna ở 1 USD/6 USD. Khoảng cách giá gấp 5 lần giữa Luna và Sol đủ lớn buộc người dùng phải phân loại tác vụ theo độ khó thay vì mặc định chọn mô hình mạnh nhất.
Sol thiết lập SOTA mới trên Artificial Analysis Coding Agent Index với điểm 80, cao hơn 2,8 điểm so với Fable 5. OpenAI cho biết Sol đạt kết quả này trong khi dùng chưa tới một nửa số token đầu ra và chưa tới một nửa thời gian so với Fable 5.
Với đội ngũ xây dựng pipeline AI, cơ cấu Sol/Terra/Luna thay đổi quyết định đầu tiên khi thiết kế workflow: thay vì chọn mô hình mạnh nhất rồi tối ưu prompt, câu hỏi bây giờ là phân loại task theo độ phức tạp trước. Luna cho tác vụ đơn giản khối lượng lớn, Terra cho công việc thường ngày, Sol cho agentic pipeline cần suy luận nhiều bước.
Nguồn: OpenAI Blog / MarkTechPost
Ghi chú thuật ngữ:
- Sol/Terra/Luna: Ba phiên bản của GPT-5.6: Sol là flagship cho tác vụ suy luận sau, Terra cân bằng hiệu năng và chi phí, Luna nhanh và rẻ nhất cho pipeline khối lượng lớn.
- Coding Agent Index: Chỉ số đánh giá khả năng hoàn thành tác vụ lập trình tự động của các mô hình AI, do Artificial Analysis duy trì và cập nhật định kỳ.
2. Meta Muse Image và Muse Video: Superintelligence Labs lần đầu tham chiến thị trường API
Từ ngày 7 đến 9/7, Meta Superintelligence Labs ra liên tiếp ba sản phẩm: Muse Image và Muse Video (ngày 7/7), cùng bản cập nhật Muse Spark 1.1 (ngày 9/7). Muse Image, mô hình sinh ảnh tiên tiến nhất của Meta đến nay, tuân thủ hướng dẫn, chỉnh sửa chính xác, tổng hợp từ nhiều ảnh tham khảo và tích hợp ngữ cảnh từ Instagram. Muse Video, cùng nền tảng pretraining, tạo video chất lượng cao với âm thanh gốc.
Meta cũng cập nhật Muse Spark 1.1, mô hình AI agentic hàng đầu của hãng, giỏi lập trình, chú thích video và suy luận. Muse Spark 1.1 hiện đang mở public preview. Lập trình viên có thể truy cập qua API.
Điểm cốt lõi của đợt ra mắt này không phải là chất lượng nội dung, mà là chiến lược: đây là lần đầu tiên Meta bán mô hình AI qua API tính phí, cạnh tranh trực diện với OpenAI và Anthropic trong phân khúc B2B. Meta nói Muse Spark 1.1 vượt các sản phẩm trước của OpenAI, Anthropic và Google, nhưng không so sánh với các bản mới nhất của các hãng này; trên một số bài kiểm thử lập trình, mô hình vẫn xếp sau các model đầu bảng như Mythos 5, Fable 5 và GPT-5.6.
Với các doanh nghiệp xây dựng ứng dụng sinh nội dung, Muse Image và Muse Video là lựa chọn đầu tiên từ Meta có API đầy đủ, tài liệu, và cam kết phát triển dài hạn, khác với các tính năng trước đây chỉ dùng được trong ứng dụng Meta.
Nguồn: Meta AI Blog / Fortune
Ghi chú thuật ngữ:
- Meta Superintelligence Labs: Đơn vị nghiên cứu AI mới của Meta, dẫn dắt bởi Alexandr Wang (cựu CEO Scale AI), tập trung vào mô hình frontier và cạnh tranh với OpenAI, Anthropic.
- Muse Spark: Mô hình AI agentic hàng đầu của Meta, dùng cho lập trình, xử lý đa phương tiện và suy luận.
3. General Intuition huy động 320 triệu USD: Điểm khác biệt nằm ở tập dữ liệu robot từ video game
Startup robot AI General Intuition (Mỹ) vừa huy động 320 triệu USD ở mức định giá 2,3 tỷ USD. Vòng gọi vốn do Khosla Ventures dẫn dắt, với sự tham gia của Jeff Bezos và Eric Schmidt.
Điểm khác biệt của General Intuition nằm ở cách huấn luyện AI cho robot. Thay vì dựa vào lượng lớn dữ liệu telemetry thu thập từ robot hoạt động ngoài đời thực, công ty sử dụng hàng triệu giờ video gameplay, bao gồm cả thao tác và thời điểm người chơi bấm các nút điều khiển. Cách tiếp cận này đi ngược với hướng phát triển phổ biến của ngành, vốn phụ thuộc vào dữ liệu thực tế vốn rất tốn kém để thu thập.
Theo công bố của công ty, mô hình nền tảng của General Intuition có thể điều khiển robot bốn chân chỉ từ một camera phía trước, sau khi fine-tune với 8 phút dữ liệu thực tế. Trong khi đó, các phương pháp truyền thống thường cần tới hàng trăm nghìn, thậm chí hàng triệu giờ dữ liệu để đạt kết quả tương tự.
Thay vì tự phát triển robot, General Intuition muốn trở thành nhà cung cấp mô hình nền tảng cho các công ty robotics xây dựng sản phẩm. Công ty dự kiến mở rộng API thương mại vào cuối mùa hè năm 2026 và sẽ sử dụng phần lớn khoản vốn mới để tăng năng lực tính toán thông qua thỏa thuận với CoreWeave.
Nguồn: TechCrunch
Ghi chú thuật ngữ:
- Telemetry: Dữ liệu thu thập tự động từ robot hoạt động trong môi trường thực, bao gồm cảm biến, tốc độ, lực và vị trí.
- Fine-tune: Điều chỉnh tinh chỉnh mô hình nền tảng trên dữ liệu chuyên biệt để phục vụ tác vụ cụ thể, cần ít dữ liệu hơn nhiều so với huấn luyện từ đầu.
- Mô hình nền tảng (Foundation model): Mô hình AI quy mô lớn được huấn luyện trên dữ liệu đa dạng, dùng làm cơ sở để fine-tune cho nhiều ứng dụng cụ thể.
- CoreWeave: Nhà cung cấp hạ tầng tính toán GPU chuyên biệt cho các mô hình AI quy mô lớn.
Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.
