mechanistic interpretability

Mechanistic Interpretability là hướng nghiên cứu cố gắng hiểu chính xác cơ chế hoạt động bên trong mô hình AI, từng neuron và circuit. Mục tiêu là mở hộp đen của mạng nơ-ron sâu.

1 bài viết