Ngày 8/7, hai tin tức AI đáng chú ý bao gồm: tiết lộ lý do open source và frontier labs không cạnh tranh mà bổ sung cho nhau trong cùng một vòng đời triển khai; và nghiên cứu mới của Anthropic lần đầu đọc được luồng suy nghĩ nội tâm bên trong Claude.
1. Frontier labs sở hữu giai đoạn khám phá, open source sở hữu giai đoạn vận hành
CEO Decagon Jesse Zhang vừa đặt tên cho một nghịch lý nhiều đội kỹ thuật đang quan sát: tại sao các triển khai trưởng thành đang chuyển dần sang mô hình nhỏ hơn, rẻ hơn, nhưng tổng chi tiêu cho mô hình frontier vẫn không giảm?
Câu trả lời của Zhang: frontier và open source không phải đối thủ mà là hai pha của cùng một vòng đời. Mô hình frontier chứng minh use case. Khi use case đã ổn định, mô hình open source tiếp nhận để chạy với chi phí thấp hơn. Như Zhang viết: “Frontier labs sẽ giữ giai đoạn khám phá. Open source sẽ ngày càng nắm giai đoạn vận hành thực tế.”
Nếu đội bạn đang dùng mô hình frontier cho mọi thứ, hoặc đang dùng open source cho mọi thứ, cả hai đều có thể là dấu hiệu của một chiến lược chưa tối ưu. Dữ liệu từ một nền tảng AI xác nhận: Anthropic vẫn chiếm hơn một nửa tổng chi tiêu AI trên nền tảng đó, dù thị phần giảm nhẹ do giá tăng trong tháng qua.
Nguồn: TechCrunch
Ghi chú thuật ngữ
- Open source: Mô hình AI có trọng số công khai, cho phép tải về và tự chạy mà không cần trả phí theo lượt dùng.
- Use case: Tình huống ứng dụng cụ thể mà một mô hình AI được triển khai để giải quyết trong thực tế.
2. Anthropic lần đầu đọc được luồng suy nghĩ ngầm bên trong Claude
Anthropic vừa công bố nghiên cứu về J-Space: một tập hợp nhỏ các pattern (mẫu hình) nội tâm bên trong Claude, hoạt động như bộ nhớ làm việc ngầm mà mô hình dùng để suy luận trước khi tạo ra đầu ra.
Công cụ đọc J-Space được gọi là J-Lens (viết tắt của Jacobian Lens). Với mỗi từ trong từ vựng của Claude, J-Lens tìm ra pattern nội tâm khiến mô hình có xu hướng nói từ đó vào một thời điểm nào đó trong tương lai. Kết quả: Claude ngầm lưu giữ khái niệm mà không cần phải nói ra, rồi dùng những khái niệm này để suy luận đa bước.
Ví dụ điển hình từ nghiên cứu: khi khái niệm “France” đang hoạt động trong J-Space, Claude có thể suy ra thủ đô, ngôn ngữ, châu lục hoặc tiền tệ. Thay “France” bằng “China”, toàn bộ đáp án thay đổi theo. Khi nhà nghiên cứu tắt J-Space đi, Claude vẫn nói được, phân loại câu và trả lời câu hỏi đơn giản, nhưng mất khả năng suy luận đa bước, tóm tắt và viết thơ.
Anthropic không khẳng định phát hiện này liên quan đến ý thức, nhưng dùng Global Workspace Theory từ nghiên cứu ý thức học làm nền để giải thích. Anthropic cũng công bố mã nguồn J-Lens kèm demo tương tác cùng Neuronpedia, cho phép giới nghiên cứu kiểm tra phương pháp trên các mô hình open-weight khác.
Nguồn: The Decoder
Ghi chú thuật ngữ
- J-Space: Tập hợp nhỏ các pattern nội tâm trong Claude mà Anthropic xác định là đóng vai trò bộ nhớ làm việc ngầm, khác biệt với phần còn lại của quá trình xử lý.
- J-Lens (Jacobian Lens): Phương pháp của Anthropic để đọc J-Space, dựa trên việc với mỗi từ, tìm ra pattern nội tâm khiến mô hình có xu hướng nói từ đó trong tương lai.
- Global Workspace Theory: Lý thuyết từ nghiên cứu ý thức học, cho rằng não bộ có một không gian làm việc chung tích hợp thông tin từ nhiều vùng xử lý chuyên biệt.
- Neuronpedia: Nền tảng trực tuyến cung cấp công cụ diễn giải và trực quan hóa hoạt động nội tâm của mô hình AI.
- Open-weight: Mô hình AI có trọng số công bố công khai, cho phép nhà nghiên cứu tải về và chạy trực tiếp.
Bài viết của đội ngũ ZTO Labs, chuyên đào tạo và nghiên cứu AI tại Việt Nam.
