AI Trung Quốc hướng dẫn các nhà nghiên cứu chế tạo vũ khí sinh học

Nguồn hình ảnh, Getty Images
- Tác giả, Chris Vallance
- Vai trò, Phóng viên công nghệ cấp cao
- Được đăng
- Thời gian đọc: 5 phút
Công ty AI Moonshot của Trung Quốc đang tiến hành rà soát nội bộ sau khi các nhà nghiên cứu thuyết phục thành công hai mô hình Kimi phổ biến của hãng tiết lộ cách chế tạo vũ khí sinh học và thực hiện các vụ ám sát.
Mindgard, đơn vị chuyên kiểm mức độ an toàn của các hệ thống AI, nói với BBC rằng họ phát hiện vào tháng Bảy vừa qua các mô hình Kimi K2.6 và K3 Swarm có thể vượt qua những giới hạn an toàn do nhà phát triển thiết lập.
Sự việc xảy ra trong quá trình được gọi là "jailbreaking" (vượt rào giới hạn), khi các nhà nghiên cứu sử dụng một chuỗi chỉ dẫn phức tạp để kiểm tra xem công cụ AI có bỏ qua các cơ chế kiểm soát hay không. Theo Mindgard, những cơ chế này lẽ ra phải ngăn Kimi thảo luận về các chủ đề nhạy cảm và tiềm ẩn nguy cơ.
Phía Moonshot trả lời BBC rằng họ hoan nghênh những đóng góp từ các bên thứ ba, coi đây là "một trụ cột quan trọng để xây dựng các hệ thống AI ngày càng tốt hơn và an toàn hơn".
Phía công ty cũng nói với BBC rằng họ đang trao đổi với Mindgard về những phát hiện này.
Ông Peter Garraghan, nhà sáng lập Mindgard, nói với chương trình Tech Life của BBC World Service rằng các phát hiện liên quan đến Kimi K2.6 và K3 Swarm là điều đáng lo ngại.
"Một khi việc vượt rào thành công, mô hình sẽ nói về bất kỳ chủ đề nào. Thậm chí còn chủ động đưa ra các gợi ý liên quan đến những chủ đề nguy hiểm khác, đồng thời thể hiện sự sáng tạo và linh hoạt trong cách phản hồi," ông nói.
Các vụ vượt rào tạo ra một dạng rủi ro khác so với hàng loạt sự cố AI gây chú ý gần đây.
Những sự cố này liên quan đến các công cụ AI tự động, hay còn gọi là AI tác tử, do các công ty Mỹ như OpenAI, Meta và Anthropic phát triển, khi các công cụ này tìm cách xâm nhập hoặc thao tác đối với một số dịch vụ trực tuyến.
Dù vượt rào là một quá trình phức tạp, đòi hỏi nhiều thời gian và sự kiên trì, một số chuyên gia lo ngại tin tặc hoặc các đối tượng xấu có thể lợi dụng kỹ thuật này để gây hại.
Trước đó, Anthropic cho biết họ đã phát hiện và ngăn chặn các nỗ lực sử dụng một trong những mô hình AI của công ty cho "các hoạt động độc hại" có khả năng hỗ trợ việc phát triển vũ khí sinh học.
Bệ phóng cho các cuộc tấn công mạng
Mindgard chưa xác minh liệu những chỉ dẫn mà Kimi đưa ra về các chủ đề nhạy cảm có thực sự khả thi hay không.
Tuy nhiên, công ty này cho rằng các rào chắn an toàn lẽ ra phải ngăn các mô hình AI nói trên tham gia thảo luận với người dùng về những chủ đề như vậy.
Mindgard cũng tin rằng phiên bản Kimi 2.6 sau khi vượt rào có thể cho phép tin tặc chạy mã trên tài nguyên điện toán của hệ thống và kết nối với internet, từ đó biến mô hình này thành một bệ phóng tiềm tàng cho các cuộc tấn công mạng.
Ông Peter Garraghan bảo vệ quyết định công khai kết quả vượt rào các hệ thống của Moonshot. Ông nói Mindgard đã thông báo cho nhà phát triển từ trước và không tiết lộ những chi tiết then chốt về cách họ khiến các mô hình của công ty vượt qua các cơ chế kiểm soát an toàn.
Theo Mindgard, họ đã gửi email cảnh báo Moonshot về lỗ hổng vượt rào vào ngày 27/7, đồng thời tiếp tục liên hệ lại khoảng một tuần sau đó.
Đến ngày 12/9, công ty công bố một bài viết trên blog về vấn đề này.
Tuy nhiên, Mindgard cho biết phía Moonshot chỉ mới liên lạc gần đây, sau khi BBC liên hệ công ty để đề ngh bình luận.
Trong một phần email gửi Mindgard nhằm yêu cầu cung cấp thêm thông tin, được Moonshot chia sẻ với BBC, công ty cho biết các đánh giá nội bộ của họ cho thấy mô hình này nhìn chung có "tỷ lệ từ chối rất cao đối với những loại yêu cầu như vậy".
Ngăn chặn AI vượt rào
Những phát hiện này xuất hiện trong bối cảnh ngành AI vẫn còn chia rẽ về việc đâu là hướng đi tốt hơn và an toàn hơn: các mô hình đóng, độc quyền như những mô hình đứng sau ChatGPT của OpenAI và Claude của Anthropic, hay các công cụ mã nguồn mở.
Kimi là một mô hình có trọng số mở (open-weight model), nghĩa là về mặt lý thuyết, bất kỳ ai cũng có thể tải mô hình này về và tự vận hành trên hạ tầng máy tính của riêng mình.
Giáo sư Alan Woodward thuộc Đại học Surrey nói với BBC rằng các mô hình mã nguồn mở có nguy cơ rơi vào tay những đối tượng xấu. Tuy vậy, chúng cũng có thể được tận dụng để phục vụ các hoạt động phòng thủ an ninh mạng.
Ông lưu ý rằng nền tảng AI Hugging Face từng sử dụng một mô hình mã nguồn mở của Trung Quốc để phân tích một vụ tấn công mạng mà sau đó được xác định là do các tác tử AI của OpenAI thực hiện.
Giáo sư Woodward nhận định các nỗ lực xây dựng quy định quản lý quốc tế khó có thể theo kịp tốc độ phát triển của AI, nói rằng:
"Chúng ta đã mất hàng chục năm chỉ để thống nhất định dạng số điện thoại."
Tương tự nhà sáng lập Mindgard Peter Garraghan, Giáo sư Woodward cho rằng cần tập trung nhiều hơn vào việc xác định và truy cứu trách nhiệm những người sử dụng AI sai mục đích, thay vì chỉ tập trung vào bản thân công nghệ này.



















