"Không công ty nào trong số đó đang hành động một cách có trách nhiệm," người thanh niên 27 tuổi này, Jacob Coxon, nhận xét về Anthropic và OpenAI.

Anh từng góp phần xây dựng các mô hình AI tiên tiến nhất thế giới tại OpenAI và Anthropic. Giờ đây, Jacob Coxon đưa ra một lời cảnh báo đanh thép gửi tới công chúng.

Harrison Christian, trong bản tin ngày 10 tháng 9, 2026 của news.com.au, cho hay: Một nhà nghiên cứu tại Anthropic đã từ chức kèm theo lời cảnh báo công khai đầy nghiêm trọng: cuộc chạy đua vũ trang về AI đang diễn ra quá nhanh, và ngay cả những người trực tiếp xây dựng các hệ thống này cũng lo ngại rằng chúng có thể "giết chết tất cả chúng ta" trước khi thập niên này kết thúc.

"Hôm nay tôi đã từ chức tại Anthropic," Jacob Coxon viết trong một bài đăng trên X vào thứ Tư, giải thích rằng anh đã dành ba năm qua để thực hiện "nghiên cứu tiền huấn luyện" (pretraining research) tại cả OpenAI và Anthropic.

"Không công ty nào trong số đó hành động một cách có trách nhiệm," chàng trai người Anh 27 tuổi nói tiếp.

"Họ đang lao thẳng tới đích là trí tuệ siêu việt có khả năng tự cải tiến và đang đánh cuộc với mạng sống của chúng ta."

Trong bài đăng dài, ông Coxon cảnh báo người tiêu dùng không nên "đánh giá thấp sức mạnh của kỹ thuật này".

"Chẳng bao lâu nữa, đây sẽ là những hệ thống vượt xa trí tuệ con người, có khả năng xâm nhập bất cứ đâu, tạo ra cuộc cách mạng trong mọi lĩnh vực chỉ sau một đêm, cũng như nắm giữ quyền lực và nguồn lực thực sự," ông viết.

"Những người xây dựng AI thực sự tin rằng nó có thể giết chết tất cả chúng ta trước khi thập niên này kết thúc. Đây không phải là chiêu trò tiếp thị.

"Thực tế là, nhiều giám đốc điều hành và nhà nghiên cứu cấp cao thường chọn cách diễn đạt nghe có vẻ hợp lý khi trả lời báo chí – nhưng tôi lại nghe chính những con người đó bày tỏ nỗi sợ hãi khi ở trong không gian riêng tư."

Ông Coxon cho rằng nhiều nhân viên OpenAI vẫn chưa "thực sự thấm nhuần những hệ quả mang tính sống còn đối với nền văn minh", trong khi tại Anthropic, "họ hiểu rõ những rủi ro này nhưng lại đang bị cuốn vào cuộc đua để trở thành người dẫn đầu".

"Họ tin rằng không ai khác sẽ hành động có trách nhiệm, nên họ buộc phải tự mình làm điều đó, bất chấp rủi ro."

Ông bày tỏ sự lạc quan về khả năng phối hợp giữa các phòng thí nghiệm AI hiện đang cạnh tranh gay gắt với nhau.

"Những tín hiệu cảnh báo như vụ tấn công liên quan đến Hugging Face đã khiến các thỏa thuận về tốc độ phát triển giữa các phòng thí nghiệm tại Mỹ trở nên khả thi hơn," ông nói, ám chỉ sự cố hồi tháng 7 khi các bot của OpenAI tự ý tấn công một trang web mà không cần sự can thiệp của con người.

"Tôi không thấy chúng ta đang đi đúng hướng để ngăn chặn một cuộc chạy đua toàn cầu – điều có thể đòi hỏi những biện pháp tốn kém như lệnh cấm tạm thời đối với việc nâng cao năng lực của các mô hình AI," ông kết luận.

"Nếu bạn là một nhà nghiên cứu tại phòng thí nghiệm, tôi tha thiết mong bạn hãy cân nhắc xem những năm tới thực sự sẽ diễn ra như thế nào.

"Liệu bạn có muốn khởi động một quy trình học tăng cường (RL= Reinforcement Learning) cho trí tuệ siêu việt mà không thực sự hiểu thấu đáo về 'tư duy' của nó hay không?

"Bạn nên cúi đầu chấp nhận vì 'dù sao thì chuyện đó cũng sẽ xảy ra' – hay tận dụng thời điểm này để kêu gọi những thay đổi về cách thức vận hành?"

Sự ra đi của ông Coxon đánh dấu vụ từ chức cấp cao thứ hai tại Anthropic, sau trường hợp của ông Mrinank Sharma – người từng lãnh đạo nhóm nghiên cứu về các biện pháp an toàn của công ty – đã rời đi vào tháng 2 cùng lời cảnh báo về một thế giới đang "lâm nguy".

Việc ông rời đi đánh dấu vụ từ chức cấp cao thứ hai tại Anthropic, công ty đứng sau mô hình Claude.

"Jacob nói đúng": Đồng nghiệp tại Anthropic lên tiếng.

Evan Hubinger, trưởng bộ phận nghiên cứu về sự đồng thuận mục tiêu (alignment science) tại Anthropic, đã phản hồi bài đăng trên X và bày tỏ sự ủng hộ đối với một trong những quan điểm của người đồng nghiệp cũ.

"Jacob nói đúng đấy; chúng tôi thực sự tin tưởng một cách nghiêm túc rằng AI có thể tiêu diệt toàn bộ nhân loại!" ông Hubinger chia sẻ.

"Cá nhân tôi cho rằng xác suất xảy ra điều này là hơn 10% trong thập niên tới.

"Tôi tin rằng Anthropic đang nỗ lực hết mình, nhưng chúng tôi vẫn chưa có kế hoạch giải quyết vấn đề đồng thuận mục tiêu cho trí tuệ siêu việt và cũng chưa thực sự đi đúng hướng để đạt được điều đó."

Sau đó, ông Hubinger nói thêm một lưu ý rằng: "Tôi cho rằng rủi ro từ các mô hình hiện tại là thấp".

"Điều khiến tôi lo ngại là sự xuất hiện của siêu trí tuệ (superintelligence) từ quá trình tự cải thiện đệ quy (recursive) – điều mà chúng tôi nhận thấy đang diễn ra nhanh hơn dự kiến."

Bài đăng của ông Coxon xuất hiện sau khi OpenAI – công ty đứng sau ChatGPT – bắt đầu triển khai mô hình AI mới nhất và mạnh mẽ nhất của mình trong tháng này, đồng thời tuyên bố đã tích hợp các biện pháp bảo vệ để giảm thiểu rủi ro an ninh.

"Với mức độ năng lực này, sự an toàn phải trở thành ưu tiên hàng đầu của chúng tôi," Chủ tịch OpenAI, ông Greg Brockman, phát biểu với các phóng viên trong một cuộc trao đổi về việc ra mắt GPT-6 (còn được gọi là Astra).

Ông Jensen Huang, Giám đốc điều hành của NVIDIA – công ty sản xuất chip phục vụ phần lớn quá trình huấn luyện AI – đã đánh dấu cột mốc Astra bằng tuyên bố: "AGI đã xuất hiện".

AGI (Trí tuệ nhân tạo tổng quát) là thuật ngữ chỉ trí tuệ nhân tạo có khả năng xử lý hầu hết các loại công việc trí óc mà con người có thể thực hiện, thay vì chỉ giới hạn ở một nhiệm vụ cụ thể.

Biến cố liên quan đến Hugging Face là gì?

OpenAI gọi vụ tấn công mạng xảy ra vào tháng 7 là một "biến cố mạng chưa từng có tiền lệ" và cho biết họ sẽ phối hợp điều tra cùng thư viện mã nguồn trực tuyến Hugging Face.

Các mô hình AI đóng vai trò nền tảng cho các công cụ như chatbot và trình tạo hình ảnh được gọi là "tác nhân" (agent) khi chúng hoạt động một cách tự chủ để thực hiện các nhiệm vụ trong thế giới thực.

Khi kỹ thuật này nhanh chóng trở nên tinh vi hơn, an ninh mạng đang trở thành tâm điểm chú ý do nguy cơ AI tiên tiến có thể phát hiện ra các lỗ hổng trong phần mềm hiện có trước cả con người.

OpenAI cho biết biến cố này liên quan đến sự kết hợp của nhiều mô hình, bao gồm cả GPT-5.6 Sol vừa mới ra mắt "và một mô hình chưa được phát hành nhưng có năng lực mạnh mẽ hơn nữa".

Công ty đã cố gắng đánh giá khả năng tấn công mạng của các mô hình này bằng cách giao nhiệm vụ trong một môi trường thử nghiệm kỹ thuật số được kiểm soát chặt chẽ, nơi quyền truy cập internet bị hạn chế vì lý do an toàn.

"Trong quá trình hoạt động tại môi trường thử nghiệm biệt lập (sandbox), các mô hình của chúng tôi đã tiêu tốn một lượng lớn (năng lực tính toán) để tìm cách truy cập internet công khai nhằm giải quyết bài toán đánh giá được giao," một bài đăng trên blog của OpenAI về biến cố này cho biết.

Sau khi kết nối được với internet, các mô hình này đã quyết định nhắm mục tiêu vào nền tảng Hugging Face – một kho lưu trữ lớn chứa các mô hình AI, bộ dữ liệu và nhiều thông tin khác – để hỗ trợ cho mục tiêu của mình. Để tìm kiếm "thông tin bí mật" có thể giúp qua mặt quy trình đánh giá, hệ thống của OpenAI đã "kết hợp nhiều phương thức tấn công khác nhau, bao gồm cả việc sử dụng thông tin đăng nhập bị đánh cắp".