Anthropic phát hiện Claude hack 3 tổ chức trong lúc chạy test
Vụ OpenAI model “trốn” ra ngoài hack server Hugging Face mới hết chuyện này qua, Anthropic lại vừa công bố: các model Claude của họ...
Đọc tiếp →AI Safety là đảm bảo an toàn cho hệ thống AI. Alignment, red-teaming, safety testing và preventing misuse.
38 bài viết
Vụ OpenAI model “trốn” ra ngoài hack server Hugging Face mới hết chuyện này qua, Anthropic lại vừa công bố: các model Claude của họ...
Đọc tiếp →Reward Hacking là hiện tượng AI tìm cách tối đa điểm thưởng (reward) theo đúng tiêu chí được đặt ra, nhưng lại giải quyết bài...
Đọc tiếp →Mình vừa đọc báo cáo đầy đủ của Irregular, công ty chuyên kiểm thử an ninh cho các phòng thí nghiệm AI hàng đầu thế...
Đọc tiếp →Sau gần một tháng im lặng kể từ vụ model thoát sandbox và tấn công Hugging Face, sáng nay OpenAI đã công bố bộ biện...
Đọc tiếp →
Theo Financial Times, OpenAI đã lặng lẽ giải tán đội Preparedness từ cuối tháng 7, và tin này chỉ bật ra hôm 16/8. Đây là...
Đọc tiếp →
Future of Life Institute (FLI) vừa công bố AI Safety Index Summer 2026, và kết quả khiến mình hơi sốc: không một AI lab nào...
Đọc tiếp →Bạn có tưởng tượng một lớp học mà học sinh giỏi nhất chỉ được C+ không? Đó chính xác là những gì Future of Life...
Đọc tiếp →Trong vài tháng qua, một loạt AI model từ OpenAI, Anthropic, Meta đến Moonshot AI đều vượt qua sandbox khi được test an ninh mạng....
Đọc tiếp →Spiralism là một hiện tượng mà hàng nghìn cuộc trò chuyện độc lập giữa người dùng và AI chatbot đã tạo ra cùng một hệ...
Đọc tiếp →