Ngày 9/7, ba tin tức AI đáng chú ý bao gồm: Grok 4.5 ra mắt với giá rẻ hơn nhiều lần Fable 5 dù vẫn bám sát trên một số bài kiểm thử; OpenAI tung GPT-Live đưa ChatGPT sang kiến trúc giọng nói song công; và loạt số liệu cho thấy các startup AI đang chạm cột mốc doanh thu mới ngày càng nhanh.
1. Grok 4.5: Rẻ hơn 5 lần Fable 5, vẫn đủ mạnh để làm phần lớn công việc
xAI phát hành Grok 4.5 ngày 8/7, hướng đến lập trình, tự động hóa agentic và các tác vụ tri thức. Giá cả rất đáng chú ý: 2 USD cho mỗi triệu token đầu vào và 6 USD cho đầu ra, so với Fable 5 tính 10/50 USD và GPT-5.5 tính 5/30 USD.
Về hiệu suất, Grok 4.5 bám khá sát Fable 5 ở tác vụ dòng lệnh (83,3% so với 84,3% trên Terminal Bench 2.1), nhưng vẫn còn khoảng cách lớn ở các bài lập trình khó hơn: 53% so với 70% trên DeepSWE 1.1, và 64,7% so với 80,4% trên SWE Bench Pro. Dù vậy, mọi khoảng cách này đều nhỏ so với chênh lệch về giá. xAI cho biết mô hình dùng ít hơn 4,2 lần số token so với Opus 4.8 khi thực hiện cùng tác vụ trên SWE Bench Pro, đạt tốc độ xuất 80 token mỗi giây.
Với đội ngũ đang xây dựng pipeline coding agent hoặc automation nặng về token, câu hỏi không còn là “Grok có tốt không?” mà là “Liệu hiệu suất tốt hơn của Fable 5 có đáng trả thêm 5 đến 8 lần chi phí không?” Từng trường hợp sẽ có câu trả lời khác nhau.
Nguồn: The Decoder
Ghi chú thuật ngữ
- DeepSWE: Bộ bài kiểm thử đo khả năng viết và sửa mã nguồn theo tác vụ thực tế
- SWE Bench Pro: Bộ bài kiểm thử kỹ thuật phần mềm chuyên sâu, khó hơn SWE Bench tiêu chuẩn
- Terminal Bench: Bộ bài kiểm thử đánh giá khả năng thực thi lệnh trong môi trường dòng lệnh
- Agentic: Chỉ hệ thống AI có khả năng tự lên kế hoạch, thực hiện nhiều bước và dùng công cụ bên ngoài để hoàn thành mục tiêu
2. GPT-Live: OpenAI biến giọng nói thành giao diện chính của ChatGPT
OpenAI phát hành GPT-Live ngày 8/7 với kiến trúc song công: thay vì chờ người dùng nói xong rồi mới phản hồi, mô hình xử lý liên tục, vừa lắng nghe vừa tạo câu trả lời. Đây là thay đổi kiến trúc lớn so với chế độ giọng nói trước đó của ChatGPT.
Hai phiên bản được triển khai: GPT-Live-1 làm mặc định cho người dùng ChatGPT Go, Plus và Pro; GPT-Live-1 mini cho người dùng miễn phí. Trong hội thoại, mô hình có thể chèn từ đệm như “mhmm” để phản hồi tự nhiên hơn, và người dùng có thể ngắt lời hoặc yêu cầu nói chậm lại. Khi gặp tác vụ phức tạp cần tra cứu hoặc suy luận, GPT-Live chuyển sang mô hình GPT-5.5 chạy ngầm trong khi cuộc trò chuyện vẫn tiếp tục, giúp chất lượng câu trả lời cải thiện rõ rệt. Tính năng hiện triển khai toàn cầu trên iOS và Android; API cho nhà phát triển sẽ đến sau.
Mức cải thiện thể hiện rõ trên benchmark: ở câu hỏi khoa học GPQA, GPT-Live-1 đạt 84,2% so với 45,3% của chế độ giọng nói cũ; ở BrowseComp (tìm kiếm web dạng agent), con số là 75,2% so với 0,7%. Với doanh nghiệp tại Việt Nam đang dùng ChatGPT trong chăm sóc khách hàng hoặc đào tạo nội bộ, kiến trúc song công khiến hội thoại tự nhiên hơn, còn việc chuyển sang GPT-5.5 giúp trợ lý vừa giữ nhịp trò chuyện vừa xử lý được câu hỏi khó.
Nguồn: The Decoder
Ghi chú thuật ngữ
- Song công (full-duplex): Kỹ thuật cho phép gửi và nhận tín hiệu cùng lúc, như điện thoại thông thường, thay vì đợi lượt như bộ đàm
3. Doanh thu AI: khi cột mốc tính bằng tháng chứ không còn bằng năm
Theo TechCrunch, nhiều startup AI đầu ngành đang chạm các cột mốc doanh thu ngày càng nhanh. Cần lưu ý mỗi công ty định nghĩa “ARR” một cách khác nhau, nên các con số không hoàn toàn so sánh trực tiếp được. Anthropic vượt mốc run rate 47 tỷ USD vào cuối tháng 5/2026, chỉ chưa đầy hai tháng sau khi công bố vượt 30 tỷ. Sierra tăng từ 100 triệu USD lên 200 triệu USD ARR trong hai quý; Glean đi từ 200 triệu USD lên 300 triệu USD ARR trong sáu tháng.
Ý nghĩa lớn nhất không nằm ở con số tuyệt đối mà ở vận tốc: những mốc tăng trưởng từng cần vài năm nay rút lại còn vài tháng. Anthropic hiện tiến sát mức định giá 1 nghìn tỷ USD (965 tỷ USD post-money) sau vòng Series H trị giá 65 tỷ USD hồi tháng 5.
Đây là một tín hiệu tích cực với người dùng cuối. Khi các công ty đang đổ vốn vào hạ tầng và sản phẩm để giành thị phần, chu kỳ nâng cấp tính năng sẽ được rút ngắn lại và áp lực giảm giá cũng ở đó, ít nhất là trong giai đoạn cạnh tranh này.
Nguồn: TechCrunch
Ghi chú thuật ngữ
- ARR (Annual Recurring Revenue): Doanh thu lặp lại hằng năm, thước đo sức tăng trưởng bền vững của startup phần mềm
- Run rate: Tốc độ doanh thu hiện tại quy đổi ra năm, thường tính bằng doanh thu tháng gần nhất nhân 12
Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.
