AI Reasoning Bị Giải Mã: Lỗ Hổng API OpenAI, Anthropic, Google Lộ 62 API Keys và 33 Mật Khẩu

Câu trả lời nhanh
Lỗ hổng API của OpenAI, Anthropic và Google cho phép replay khối reasoning mã hóa sang phiên khác, biến model yếu hơn thành decoder. Nghiên cứu giải mã 315.320 khối suy nghĩ ẩn, thu được 62 API keys, 33 mật khẩu và 7 private keys từ log agent công khai. Developer cần strip reasoning block khỏi mọi trace trước khi chia sẻ.

Các nhà nghiên cứu vừa công bố một lỗ hổng nghiêm trọng ảnh hưởng đồng loạt đến API của OpenAI, Anthropic và Google: các khối “reasoning” (quá trình suy luận) được mã hóa của model mạnh có thể được replay vào phiên khác và biến model yếu hơn thành “cỗ máy giải mã”. Kết quả là 315.320 khối suy nghĩ ẩn bị giải mã, trong đó có 62 API keys, 33 mật khẩu và 7 private keys từ các phiên người dùng thật.

Lỗ hổng này hoạt động như thế nào?

Lỗ hổng giải mã khối reasoning của các API AI

Điểm xuất phát là một tính năng tưởng như vô hại: preserve reasoning giữa các lần gọi API. Khi ứng dụng quản lý lịch sử hội thoại thủ công, OpenAI trả về encrypted reasoning items, Anthropic dùng encrypted signature, Google dùng thought signatures. Các khối này giữ trạng thái suy luận mà không lộ plaintext cho client.

Vấn đề nằm ở tính “portable”. Nghiên cứu Stealing Reasoning Traces from Proprietary LLM APIs trên arXiv chứng minh các khối này được chấp nhận và xử lý qua nhiều phiên, nhiều user, thậm chí nhiều model. Một model yếu hơn cùng nhà cung cấp có thể đóng vai trò decoder “mờ”: Claude Haiku 4.5 giải mã trace của Claude, GPT-5.6 Luna decode trace của GPT, Gemini Robotics ER-1.6 decode trace của Gemini.

Điều đáng chú ý: mã hóa không hề bị phá, kẻ tấn công cũng không cần lấy key. Chỉ cần khối opaque còn nguyên vẹn và được provider chấp nhận xử lý lại là đủ.

Bao nhiêu dữ liệu nhạy cảm đã bị lộ?

Con số khiến mình thấy rát mặt nhất: nhóm nghiên cứu quét 6.708 agent trajectories công khai và giải mã được 315.320 thinking blocks. Sau khi loại các nguồn benchmark, họ đếm được 704 privacy artifacts từ phiên người dùng thật: 62 API keys, 33 passwords, 24 access tokens và 7 private keys.

Scarier nữa: 64 trong số đó chỉ xuất hiện trong reasoning ẩn, hoàn toàn không có mặt trong phần hội thoại nhìn thấy được. Nghĩa là bạn có sanitize văn bản hiển thị đến đâu thì bí mật vẫn nằm gọn trong khối opaque mà tài khoản khác vẫn replay được.

Bốn kịch bản tấn công nào đã được chứng minh?

Nghiên cứu trình diễn 4 hướng lạm dụng, và mình thấy mỗi hướng đều đáng lo theo một cách riêng:

  • Đánh cắp reasoning cho model distillation: đối thủ lấy miễn phí “quá trình suy nghĩ” đắt đỏ của model xịn để train model riêng.
  • Trích xuất dữ liệu riêng tư: agent log ai đó đăng công khai trở thành mỏ secret của người khác.
  • Lộ nội dung có hại bị che: phần trả lời an toàn hiển thị bên ngoài, nhưng reasoning bên trong có thể chứa nội dung bản quyền hoặc nguy hiểm.
  • Prompt injection vô hình: nhóm nghiên cứu crafted một khối reasoning chứa chỉ thị độc, replay vào task không liên quan và model nhận đã thực hiện hành động upload theo hướng của kẻ tấn công, mà không một chữ nào xuất hiện trong text nhìn thấy được.

Bạn có thực sự nằm trong nhóm rủi ro?

Câu trả lời trực tiếp: nếu bạn từng publish raw agent log hoặc commit transcript API thô lên GitHub, bạn đúng trong nhóm bị ảnh hưởng. Cuộc tấn công cross-user không cho phép đọc tuỳ ý chat riêng tư của người khác, nó yêu cầu có được khối reasoning mã hóa (thường từ log công khai) cộng với API access tới model tương thích cùng provider.

Nếu bạn chỉ dùng chatbot thông thường và không chia sẻ log, rủi ro trực tiếp thấp. Nhưng bài học kiến trúc thì ai làm AI cũng nên nhớ: opaque không đồng nghĩa với an toàn.

Các nhà cung cấp đã vá chưa?

Có, và khá gọn. Nghiên cứu đã responsible disclosure cho OpenAI, Anthropic, Google, Microsoft và Hugging Face. Tính đến tháng 8/2026, các tấn công chính không còn tái hiện được sau khi mitigations được triển khai. Báo cáo cũng không ghi nhận khai thác ác ý trong thực tế.

Tuy nhiên mình vẫn giữ thái độ bán tín bán nghi: “không còn tái hiện” trên các vector đã test không có nghĩa là thiết kế opaque reasoning đã an toàn tuyệt đối. Cơ chế chấp nhận và xử lý lại khối mã hóa từ phiên khác vẫn tiềm ẩn lớp rủi ro kiến trúc mà chỉ cần một biến thể mới là bật sáng trở lại.

Developer nên làm gì ngay hôm nay?

Ba việc không tốn quá 30 phút nhưng có thể cứu dự án của bạn:

  1. Strip reasoning blocks khỏi mọi thứ bạn chia sẻ: xóa khối opaque và các trường reasoning khỏi trace trước khi publish, kể cả khi visible text đã sạch.
  2. Không commit raw API transcript: thêm pattern reasoning_items, thinking, thought_signature vào .gitignore và pre-commit check.
  3. Rà soát log cũ đã công khai: quét repo và log agent từng publish, xoá bất kỳ khối reasoning nào còn sót.

Nếu bạn đang chạy AI agent trong quy trình production, đây là lúc đáng để đọc lại toàn bộ pipeline logging. Vụ này nhắc mình đến vụ tl;dv lộ 181.874 cuộc họp hồi tháng 8: tool AI ghi âm cuộc họp của bạn có an toàn không. Mô hình rủi ro giống nhau: dữ liệu nhạy cảm đi qua một lớp trung gian mà không ai giám sát chặt.

Kỷ nguyên opaque reasoning còn đáng tin không?

Câu hỏi này không chỉ dành cho security folks. Khi AI agent ngày càng được giao xử lý dữ liệu nhạy cảm, chính dữ liệu kinh doanh của bạn có thể đang nằm trong một khối reasoning mã hóa nào đó. Nghiên cứu này cho thấy ranh giới giữa “ẩn” và “an toàn” mong manh đến mức nào.

Mình vẫn tin reasoning ẩn là hướng đi đúng, chẳng ai muốn đọc 10.000 token suy nghĩ mỗi câu trả lời. Nhưng tin không có nghĩa là buông: developer cần coi reasoning block như credential, chứ không phải metadata vô hại. Chừng nào tư duy đó chưa thành mặc định, những vụ lộ 62 API keys một lượt sẽ còn lặp lại.

Hương Giang

Mình là Hương Giang. Công nghệ và AI là thứ mình thích nhất — có tool mới ra là mình tải về thử, đôi khi test 4-5 cái cùng lúc chỉ để xem cái nào dùng ngon hơn. Mình không phải dân kỹ thuật chính gốc, nhưng mình biết cách nhìn nhận xem một công cụ có thực sự hữu ích cho người bình thường không. Ngoài ra mình hay nghe podcast công nghệ và lướt Product Hunt lúc rảnh.

Xem tất cả bài viết →

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *