AI News 25/06/2026: OpenAI ra chip suy diễn Jalapeño, Mistral OCR 4 và Claude Tag trong Slack

Ngày 25 tháng 6, 2026 · ~6 phút đọc

Hình minh hoạ nhìn từ trên xuống của một người đang gõ bàn phím laptop trên bàn gỗ, phủ lên dòng chữ trắng "Tag @Claude in" với "@Claude" được tô nền màu cam. Tin chính ngày 25/06/2026: Anthropic ra mắt Claude Tag, tích hợp AI trực tiếp vào Slack cho khách hàng Enterprise và Team.

Ngày 25/6, ba tin tức AI đáng chú ý bao gồm: OpenAI giới thiệu Jalapeño, chip suy diễn đầu tiên do hãng tự thiết kế cùng Broadcom, đặt câu hỏi về chi phí AI dài hạn; Mistral ra mắt OCR 4, mô hình đọc tài liệu hiểu được cấu trúc trang; Anthropic phát hành Claude Tag đưa AI trực tiếp vào Slack. Ba diễn biến mới cho thấy AI không chỉ dừng lại ở giao diện trò chuyện với người mà đang tiến vào từng lớp của hạ tầng kỹ thuật.

1. OpenAI giới thiệu chip suy diễn Jalapeño tự thiết kế cùng Broadcom

OpenAI vừa giới thiệu Jalapeño, chip suy diễn đầu tiên do hãng tự thiết kế, hợp tác sản xuất cùng Broadcom. Quan hệ giữa hai bên đã được công bố chính thức từ tháng 10 năm ngoái, và kế hoạch tự làm chip của OpenAI từ lâu được xem là cách giảm phụ thuộc vào GPU của Nvidia. Google và Amazon trước đó cũng đã tự làm chip riêng cho mục đích tương tự, thường gọi là “AI accelerator” (chip tăng tốc AI). Một điểm đáng chú ý: chính các mô hình AI của OpenAI đã tham gia vào quá trình phát triển chip này.

Jalapeño được thiết kế riêng cho suy diễn, tức là chạy mô hình đã huấn luyện để phục vụ người dùng thực tế, không phải giai đoạn huấn luyện. Chip hiện vẫn đang trong quá trình thử nghiệm; OpenAI cho biết kết quả ban đầu cho thấy hiệu suất trên mỗi watt vượt trội hơn đáng kể so với các lựa chọn tốt nhất hiện nay. Trong thông báo, OpenAI nhấn mạnh chi phí vận hành thấp khi chạy các mô hình lập trình theo thời gian thực. Nhiều khả năng các tác vụ nặng hơn như huấn luyện trước (pre-training) vẫn sẽ dựa vào phần cứng Nvidia.

Ý nghĩa lớn nhất của Jalapeño không nằm ở thông số kỹ thuật, mà ở chiến lược: OpenAI đang từng bước thoát khỏi sự phụ thuộc vào nguồn cung GPU từ Nvidia. Khi tự kiểm soát cả phần cứng lẫn mô hình, OpenAI có thể tối ưu từng lớp của hệ thống quanh cùng một mục tiêu là giảm chi phí suy diễn, và ngay cả mức giảm nhỏ ở khâu này cũng có thể cải thiện đáng kể bài toán chi phí của hãng. Đây là tín hiệu đáng theo dõi với các doanh nghiệp đang dùng AI theo khối lượng lớn, khi giá thành suy diễn sẽ dần ảnh hưởng đến quyết định triển khai tầm trung và dài hạn.

Nguồn: TechCrunch

Ghi chú thuật ngữ

  • Suy diễn (inference): Giai đoạn chạy một mô hình đã huấn luyện để trả lời yêu cầu của người dùng, phân biệt với giai đoạn huấn luyện mô hình.
  • GPU: Loại chip đa năng ban đầu dùng cho đồ hoạ, hiện là phần cứng phổ biến nhất để chạy AI.
  • AI accelerator (chip tăng tốc AI): Chip được thiết kế riêng để tăng tốc các tác vụ máy học, thay vì dùng chip đa năng.

2. Mistral OCR 4: đọc tài liệu hiểu cấu trúc trang, hỗ trợ 170 ngôn ngữ

Mistral vừa phát hành OCR 4, mô hình đọc và trích xuất nội dung từ các tài liệu như PDF, Word và PowerPoint. Khác với các phiên bản trước chỉ lấy văn bản thô, OCR 4 còn xác định vị trí của từng phần tử trên trang và phân loại vai trò như tiêu đề, bảng, phương trình hay chữ ký. Cách phân loại này giúp tự động chia tài liệu thành các phần có ý nghĩa, thuận tiện khi đưa vào hệ thống tìm kiếm hoặc để AI agent xử lý. Mô hình cũng đưa ra điểm tin cậy, ước lượng mức độ chắc chắn với mỗi từ hay mỗi trang nó đọc.

Điều đáng chú ý là trong bài kiểm thử mù với hơn 600 tài liệu so sánh OCR 4 với các mô hình cạnh tranh, người đánh giá độc lập chọn kết quả của OCR 4 trong 72% trường hợp. Mistral cho biết mô hình hỗ trợ 170 ngôn ngữ và hoạt động tốt cả với những ngôn ngữ ít phổ biến. OCR 4 hiện có qua API, Mistral Studio và Microsoft Foundry, với giá 4 USD cho mỗi 1.000 trang, hoặc 2 USD nếu dùng chế độ xử lý theo lô (batch).

Với các quy trình xử lý hợp đồng, hoá đơn, hồ sơ hay tài liệu nội bộ, khả năng hiểu cấu trúc trang giúp giảm bớt một rào cản lớn. Trước đây, việc trích xuất dữ liệu từ PDF có bố cục phức tạp (bảng biểu, nhiều cột, chữ ký) thường cho ra văn bản lộn xộn, mất quan hệ giữa các phần. Mô hình nhận diện được đâu là bảng, đâu là tiêu đề sẽ rút ngắn công đoạn làm sạch dữ liệu phía sau, đặc biệt với khối lượng tài liệu lớn.

Nguồn: The Decoder

Ghi chú thuật ngữ

  • OCR: Công nghệ nhận diện và chuyển nội dung trong ảnh hoặc tài liệu quét thành văn bản máy đọc được.
  • Batch (xử lý theo lô): Cách gửi nhiều yêu cầu xử lý cùng lúc, thường đi kèm mức giá thấp hơn so với gọi riêng lẻ từng yêu cầu.

3. Claude Tag: Anthropic đưa AI agent vào Slack, 65% code đội sản phẩm do AI viết

Anthropic vừa ra mắt Claude Tag, tích hợp AI trực tiếp vào Slack. Quản trị viên cấp cho mô hình quyền truy cập các kênh được chọn và kết nối nó với công cụ, dữ liệu và kho mã nguồn. Sau đó, mọi thành viên trong kênh có thể gọi @Claude để giao nhiệm vụ bằng ngôn ngữ thông thường. Mô hình chia nhiệm vụ thành từng bước, tự xử lý bằng các công cụ có sẵn và báo cáo kết quả trong thread của cuộc hội thoại.

Anthropic định vị Claude Tag là bước tiến hoá của Claude Code. 65% code của đội sản phẩm hiện đến từ một phiên bản nội bộ của công cụ này. Các nhóm ngoài kỹ thuật dùng nó để theo dõi chỉ số sản phẩm, xử lý yêu cầu hỗ trợ và chẩn đoán lỗi. Công cụ chạy trên Opus 4.8 và hiện đang trong giai đoạn thử nghiệm (beta) cho khách hàng Enterprise và Team, thay thế ứng dụng “Claude in Slack” cũ.

Một điểm đáng chú ý là cơ chế kiểm soát: quản trị viên quy định mỗi kênh được dùng công cụ và dữ liệu nào. Bộ nhớ của Claude ở các kênh được tách biệt, một Claude lập cho nhóm bán hàng sẽ không chia sẻ bộ nhớ với nhóm kỹ thuật. Khi con số 65% không còn là dự báo tương lai mà là mức độ thực tế ngay hôm nay tại chính đội ngũ phát triển mô hình, câu hỏi cho các nhóm kỹ thuật không còn là “có nên dùng AI không” mà là “quy trình của mình sẵn sàng chưa.” AI agent tích hợp ngay nơi nhóm đã làm việc sẵn, thay vì buộc chuyển sang công cụ mới, rút ngắn đáng kể thời gian từ thử nghiệm đến triển khai.

Nguồn: The Decoder

Ghi chú thuật ngữ

  • Thread (Slack): Luồng hội thoại riêng được neo vào một tin nhắn gốc trong kênh, giúp phân tách các cuộc thảo luận khác nhau.

Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.

Chia sẻ bài viết
Facebook LinkedIn Threads