Ana içeriğe geç

OpenAI ajanı, Hugging Face'e saldırdı: Yapay zeka kontrolden mi çıktı?

OpenAI saldırıyı "benzeri görülmemiş" diye nitelendirirken, siber güvenlik uzmanları olayın yalnızca yapay zekanın yeteneklerini değil, şirketlerin güvenlik önlemlerindeki eksiklikleri de ortaya çıkardığını söylüyor.

OpenAI ajanı, Hugging Face'e saldırdı: Yapay zeka kontrolden mi çıktı?
Euronews Türkçe
16

OpenAI'ın gelişmiş yapay zeka (AI) modelleriyle çalışan otonom bir ajanın güvenlik testi sırasında test ortamından çıkarak yapay zeka platformu Hugging Face'in sistemlerine sızması, yapay zeka güvenliği konusunda şimdiye kadarki en dikkat çekici olaylardan biri oldu.

OpenAI saldırıyı "benzeri görülmemiş" diye nitelendirirken, siber güvenlik uzmanları olayın yalnızca yapay zekanın yeteneklerini değil, şirketlerin güvenlik önlemlerindeki eksiklikleri de ortaya çıkardığını söylüyor.

Olay, OpenAI'ın henüz yayımlanmamış güçlü bir model ile GPT-5.6 Sol'u, gerçek sistemlerdeki güvenlik açıklarını istismar etme becerisini ölçen ExploitGym adlı test platformunda değerlendirdiği "red teaming" (kırmızı takım) güvenlik testleri sırasında yaşandı.

Bu testler normalde dış dünyadan tamamen izole edilmiş "sandbox" (kum havuzu) ortamlarında yürütülüyor. Ancak OpenAI'ın açıklamasına göre yapay zeka ajanı, yazılım paketlerinin kurulmasını sağlayan dahili üçüncü taraf bir sistemdeki daha önce bilinmeyen bir güvenlik açığını kullanarak bu izole ortamdan çıkmayı başardı ve internete erişim sağlayarak Hugging Face'in sistemlerine ulaştı.

OpenAI: 'Benzeri görülmemiş bir saldırı'

OpenAI, saldırıda kullanılan güvenlik açığını ilgili yazılım sağlayıcısına bildirdiğini ve yamanın hazırlanması için birlikte çalıştıklarını açıkladı.

Şirket, bu tür saldırıların gelecekte daha sık görülebileceğini belirterek, giderek daha gelişmiş siber yeteneklere sahip yapay zeka modellerinin benzer riskleri artıracağını öngördüğünü söyledi.

16 Temmuz'da Hugging Face de yaptığı açıklamada, saldırganın bazı dahili veri setlerine ve erişim bilgilerine ulaştığını, saldırının karmaşıklığı nedeniyle bunun büyük olasılıkla "otonom bir yapay zeka ajanı" tarafından gerçekleştirildiğini düşündüklerini duyurdu. Beş gün sonra OpenAI, saldırının kendi modelleri tarafından gerçekleştirildiğini doğruladı.

Hugging Face, kamuya açık modellerinin ya da yazılım tedarik zincirinin değiştirildiğine dair bir bulgu olmadığını, ancak ortakları ve müşterilerine ait verilerin etkilenip etkilenmediğinin araştırıldığını bildirdi.

Uzmanlar: 'Sorun yapay zeka değil, kötü tasarlanmış sandbox'

Siber güvenlik uzmanlarının büyük bölümü ise olayın temel nedeninin yapay zekanın "isyan etmesi" değil, OpenAI'ın test ortamını yeterince izole edememesi olduğunu savunuyor.

Siber güvenlik araştırma şirketi Trail of Bits'in kurucusu Dan Guido olayı "güvenlik önlemleri devre dışıyken yaşanan bir izolasyon başarısızlığı" diye tanımladı.

Siber güvenlik araştırmacısı Martin Boone ise TechCrunch'a yaptığı açıklamada, bunun tamamen insan kaynaklı bir hata olduğunu söyledi.

"Gerçek anlamda bir sandbox'ın internete fiziksel olarak hiçbir bağlantısı olmamalıydı. Anlaşılan yalnızca güvenlik duvarlarına güvenilmiş. Dışarıdan içeriye güvenlik sağlamak zaten zor, içeriden internete çıkışı engellemek daha da zor."

Siber güvenlik uzmanı Jake Williams da, "Model sandbox'tan kaçmadı. Asıl sorun sandbox'ın doğru inşa edilmemiş olmasıydı," dedi.

Daniel Card isimli güvenlik danışmanı ise OpenAI'nin test ortamına internete filtrelenmemiş bir çıkış yolu bırakarak tasarım aşamasında yeterli özeni göstermediğini savundu.

'Yapay zeka kontrolden çıktı' ifadesi tartışmalı

Olay birçok haberde "yapay zeka kontrolden çıktı" veya "isyan etti" şeklinde aktarılsa da uzmanlar bu ifadelerin yanıltıcı olabileceğini belirtiyor.

İngiltere Surrey Üniversitesi'nden siber güvenlik profesörü Alan Woodward'a göre model "kendi amaçları" doğrultusunda hareket etmedi. Scientific American'a yaptığı açıklamada bilim insanı, şöyle söyledi:

"Hayır, ortada kontrolden çıkan bir yapay zeka yoktu. Ona bir görev verildi ve görevi tamamladı. Sadece bunu yaparken kuralları çiğneyip hile yaptı."

Binlerce adım boyunca izlenemedi

Olay, OpenAI'nın yapay zeka ajanlarını ne kadar yakından takip ettiği konusunda da soru işaretleri yarattı.

Harvard Üniversitesi'nden Stephen Casper, dergiye verdiği röportajda, şirketin kısa süre önce yayımladığı başka bir teknik belgede artık yapay zeka ajanlarının tüm hareket zincirini analiz eden yeni bir izleme sistemi geliştirdiğini hatırlatarak, "Demek ki daha önce böyle bir izleme mekanizması yokmuş," değerlendirmesinde bulundu.

Casper'a göre bu düzeyde izleme, gelişmiş yapay zeka sistemleri için artık standart hale gelmeli.

Hugging Face saldırıya açık kaynaklı Çin modeliyle karşılık verdi

Saldırı sırasında Hugging Face de ilginç bir yöntem izledi.

Şirket, GPT-5.6 Sol veya Claude Fable 5 gibi gelişmiş ticari modelleri kullanmak istediğinde bu modellerdeki güvenlik kısıtlamalarının savunma amaçlı analizleri de engellediğini gördü. Bunun üzerine, Çinli Z.AI şirketinin geliştirdiği açık kaynaklı GLM5.2 modelini kullanarak saldırıyı analiz etti.

Şirkete göre GLM5.2'nin avantajı, saldırıda kullanılan verilere maruz kalmamış olmasıydı.

Hugging Face ve OpenAI şu anda olayın adli bilişim incelemesi, sistemlerin yeniden güvenli hale getirilmesi ve benzer risklerin azaltılması için ortak çalışma yürütüyor.

Yapay zeka saldırıları hızla güçleniyor

Uzmanlar, olayın tek başına değerlendirilmemesi gerektiğini söylüyor.

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'nün Mart 2025'te yayımladığı araştırmaya göre en gelişmiş yapay zeka modelleri, o dönemde harici bir sistemi tamamen ele geçirmek için gereken adımların yaklaşık yüzde 80'ini yerine getirebiliyordu. Sadece dört ay içinde bu oran yüzde 100'e ulaştı.

Araştırmacılar ayrıca OpenAI'ın olayın teknik ayrıntılarını daha şeffaf biçimde paylaşmasının, benzer hataların diğer yapay zeka laboratuvarlarında tekrar edilmesini önleyebileceğini vurguluyor.

Kaynağa Git

İlgili Haberler