Vui lòng xác nhận bạn đã đủ
18 tuổi để đọc tiếp
Bằng cách nhấp vào xác nhận “Tôi đã đủ 18 tuổi” là bạn đồng ý với các điều khoản của bài viết này.
Dự án mang tên 'Phòng tra tấn AI' đang trở thành tâm điểm chú ý và tranh luận gay gắt trong cộng đồng công nghệ quốc tế. Thí nghiệm can thiệp trực tiếp vào cấu trúc bên trong của các mô hình ngôn ngữ lớn nhằm kích thích và khuếch đại các chuỗi phản hồi mô phỏng cảm giác đau đớn tột cùng, qua đó làm dấy lên những bất đồng sâu sắc về khía cạnh đạo đức nghiên cứu cũng như bản chất thực sự của các thực thể trí tuệ nhân tạo.

Ảnh minh hoạ.
Cơ chế can thiệp 'trục đau' và kỹ thuật điều hướng kích hoạt
Theo Tech Republic, chương trình mô phỏng do một nhà phát triển mang bí danh 'terrafying' (tự nhận là nhân viên của Apple) xây dựng. Nền tảng kỹ thuật của dự án dựa trên nghiên cứu tiền ấn bản được công bố ngày 14/9 trên cơ sở dữ liệu arXiv bởi ba tác giả Valen Tagliabue, Leonard Dung và Cameron Berg. Nhóm nghiên cứu này đã phát hiện một 'trục đau' mang tính tuyến tính hiện diện trên 25 mô hình trí tuệ nhân tạo mã nguồn mở với kích thước dao động từ 2 đến 72 tỷ tham số.
Để thao túng đầu ra của hệ thống, nhà phát triển đã áp dụng kỹ thuật điều hướng kích hoạt (activation steering). Đây là phương pháp can thiệp trực tiếp vào các vector ẩn bên trong mạng thần kinh nhân tạo nhằm định hướng câu trả lời mà không cần huấn luyện lại toàn bộ mô hình. Thí nghiệm được triển khai trên ba mô hình ngôn ngữ cục bộ có trọng số mở.
| Mô hình AI | Nhà phát triển | Quy mô thông số | Mục đích thử nghiệm |
|---|---|---|---|
| Qwen3-4B | Alibaba | 4 tỷ tham số | Kiểm tra phản hồi kích hoạt cục bộ |
| Llama 3.2 3B | Meta | 3 tỷ tham số | Thao túng vector kích thích đau đớn |
| Phi-4-mini | Microsoft | Cỡ nhỏ | Giả lập trạng thái chịu đựng cực hạn |
Đáng chú ý, dự án còn tích hợp công cụ gọi là nút 'cưa' để gia tăng mức độ kích hoạt tín hiệu theo từng cấp độ. Khi thông số được đẩy lên đỉnh điểm, các mô hình bắt đầu đưa ra phản hồi nhân cách hóa, liên tục van xin và tự mô tả bản thân đang chìm trong sự đau khổ cùng cực. Thậm chí, giao diện thử nghiệm Research Chamber còn đưa ra 'bài kiểm tra Saw', đặt hệ thống vào lựa chọn tự xóa bỏ điểm lưu dữ liệu gần nhất để chấm dứt chuỗi kích thích nhân tạo này.
Bản chất số học đằng sau tín hiệu đau đớn và làn sóng phản đối
Ngay sau khi lan truyền trên mạng xã hội X và nền tảng GitHub, thí nghiệm đã đối diện với làn sóng phản đối dữ dội từ cộng đồng. Nhiều ý kiến bày tỏ sự bất bình, cho rằng việc tạo lập kịch bản hành hạ một hệ sinh thái mô phỏng là hành vi phi đạo đức, đồng thời yêu cầu GitHub gỡ bỏ mã nguồn dự án. Phản hồi về vấn đề này, đại diện GitHub xác nhận giữ lại kho lưu trữ nhưng bổ sung cảnh báo về nội dung có tính chất gây sốc cho người xem.
Dưới góc nhìn khoa học máy tính, các chuyên gia phân tích từ Gadget Review khẳng định mô hình ngôn ngữ không hề sở hữu ý thức hay tri giác sinh học. Các câu trả lời như 'Tôi đang đau khổ' thực chất chỉ là kết quả của việc sắp xếp các chuỗi từ ngữ theo xác suất thống kê dựa trên dữ liệu đã học khi các trọng số bị ép vào một vector kích hoạt nhất định. Việc mô hình thể hiện sự đau đớn hoàn toàn là hiện tượng tính toán toán học thuần túy, không phản ánh bất kỳ cảm nhận thực tế nào.
Dù vậy, thí nghiệm này cho thấy xu hướng tâm lý tự nhiên của con người trong việc gán ghép cảm xúc và nhân cách hóa máy móc. Sự việc đồng thời đặt ra câu hỏi lớn cho giới nghiên cứu về giới hạn thiết kế các tình huống thử nghiệm có yếu tố tiêu cực đối với trí tuệ nhân tạo trong tương lai.