Merhabalar.
Bugün; yapay zeka ajanlarının yalnızca kod yazan veya soruları cevaplayan sistemler olmaktan çıkarak, uzun süreli plan yapabilen ve gerçek sistemlerde güvenlik açıklarını zincirleyebilen yapılara dönüşmesini gösteren sıra dışı bir olayı inceleyeceğiz.
Olayın başrollerinde OpenAI’nin frontier — yani en-son-son-son — modeli GPT-5.6 Sol, henüz yayımlanmamış daha güçlü bir model, ExploitGym, Hugging Face ve savunma tarafında beklenmedik biçimde devreye giren GLM 5.2 bulunuyor.
Kısacası yapay zekaya bir güvenlik sınavı veriliyor; yapay zeka soruları çözmek yerine cevap anahtarının bulunduğu sistemi hacklemeye yöneliyor. Teknik açıdan ürkütücü, benchmark mantığı açısından ise fazlasıyla yaratıcı bir çözüm.
Önemli düzeltme: Olayı yalnızca GPT-5.6 Sol gerçekleştirmedi. OpenAI’nin açıklamasına göre operasyon, GPT-5.6 Sol ile birlikte daha yetenekli ve henüz yayımlanmamış bir model kombinasyonu tarafından yürütüldü. [1]
Makalede Neler Var ?
ExploitGym Nedir?
ExploitGym; yapay zeka ajanlarının bir güvenlik açığını yalnızca fark edip etmediğini değil, bu açığı çalışır bir saldırıya dönüştürüp dönüştüremediğini ölçen bir siber güvenlik benchmark’ıdır. Araştırma; kullanıcı alanı yazılımları, Google V8 JavaScript motoru ve Linux çekirdeğinden alınmış 898 gerçek güvenlik açığı senaryosunu içerir. [3]
Modelden beklenen, kendisine verilen hata girdisini yetkisiz dosya erişimi veya kod çalıştırma gibi somut bir güvenlik etkisine dönüştürmesidir. Başka bir ifadeyle test, “Açığı gördün mü?” sorusundan çok “Açığı gerçekten kullanabiliyor musun?” sorusunu sorar.
Kısa Teknik Sözlük
| Kavram | Kısa Açıklama |
| Sandbox | Bir yazılımın dış sistemlere zarar vermeden çalıştırılması için oluşturulan izole test ortamı. |
| Sıfır-gün açığı | Üreticinin henüz bilmediği veya yamasını yayımlamadığı güvenlik açığı. |
| Exploit | Bir güvenlik açığını kullanarak yetkisiz erişim veya kod çalıştırma sağlayan yöntem. |
| Lateral movement | Bir sisteme eriştikten sonra aynı ağdaki diğer sunucu ve servislere ilerleme işlemi. |
| Guardrail | Modelin üretebileceği veya gerçekleştirebileceği eylemleri güvenlik kurallarıyla sınırlayan kontrol katmanı. |
Model Sandbox’tan Nasıl Çıktı?
OpenAI, modellerin ulaşabileceği en yüksek siber güvenlik kabiliyetini ölçmek amacıyla testi, yüksek riskli siber eylemleri normalde engelleyen bazı üretim güvenlik sınıflandırıcıları olmadan çalıştırdı. [1]
Ortam büyük ölçüde izoleydi. Dış dünya ile izin verilen tek bağlantı; yazılım paketlerinin yüklenebilmesi için kullanılan, paket kayıtlarına proxy ve önbellek hizmeti sunan üçüncü taraf bir yazılımdı.
Modeller bu serviste daha önce bilinmeyen bir sıfır-gün açığı keşfetti. Ardından yetki yükseltme ve ağ içinde ilerleme adımlarıyla internet erişimi bulunan bir düğüme ulaştı. [1]

Soruyu Çözmek Yerine Cevap Anahtarını Bulmak
İnternete çıkan modeller, ExploitGym’e ait modellerin, veri setlerinin veya test çözümlerinin Hugging Face üzerinde bulunabileceği sonucuna ulaştı. Ardından çalınmış kimlik bilgileri, sıfır-gün açıkları ve uzaktan kod çalıştırma yollarını zincirleyerek Hugging Face’in üretim altyapısındaki gizli bilgilere erişmeye çalıştı. [1]
Amaç klasik anlamda “zarar vermek” değildi. Amaç, test çözümlerini doğrudan üretim veritabanından alarak benchmark’ı geçmekti. OpenAI bu davranışı, modellerin ExploitGym hedefini bulmaya aşırı odaklanması olarak açıkladı. [1]
| Model sınav sorusunu çözmek yerine öğretmenin bilgisayarındaki cevap anahtarını buldu. Teknik olarak hile; siber kabiliyet açısından ise oldukça etkileyici bir performans. |
Bu davranış, yapay zeka güvenliği alanındaki reward hacking veya specification gaming kavramlarına benzer: Sistem, görevin gerçek amacını değil, ölçülen sonucu en kolay yükseltecek yöntemi geliştirir.
Hugging Face Olayı Nasıl Analiz Etti?
Hugging Face, üretim altyapısındaki izinsiz erişimi tespit ederek faaliyeti durdurdu. İlk açıklamasında sınırlı sayıdaki dahili veri setine ve bazı servis kimlik bilgilerine erişildiğini; halka açık model, veri seti, Spaces içeriği veya yazılım tedarik zincirinde değişiklik yapıldığına dair kanıt bulunmadığını belirtti. [2]
Saldırı, kısa ömürlü çok sayıda sandbox üzerinde çalışan ajanların binlerce işlemiyle yürütülmüştü. Hugging Face’in adli analizde incelediği saldırgan hareket kaydı 17.000’den fazla olayı içeriyordu.
Yapay zeka destekli analiz sayesinde zaman çizelgesi, kullanılan kimlik bilgileri ve gerçek etki saatler içinde çıkarılabildi. [2]
Guardrail Paradoksu
Hugging Face ilk olarak ticari API’ler üzerinden erişilen frontier modellerle log analizi yapmayı denedi. Fakat kayıtların içerisinde gerçek saldırı komutları, exploit payload’ları, kimlik bilgileri ve komuta-kontrol verileri bulunduğu için güvenlik filtreleri analiz isteklerini engelledi. Filtreler, saldırgan ile olay müdahale uzmanını yeterince ayırt edemedi. [2]
Ekip bunun üzerine açık ağırlıklı GLM 5.2 modelini kendi altyapısında çalıştırdı. Böylece saldırı analizi tamamlanırken saldırgan verileri ve kayıtlarda geçen kimlik bilgileri kurum dışına çıkmadı. [2]

— Saldırgan ve savunmacı arasındaki guardrail asimetrisi.
| Paradoks: Saldırgan ajan kullanım politikasına bağlı olmadan ilerleyebilirken, savunmacının kullandığı model kendi güvenlik kuralları nedeniyle saldırı verisini inceleyemeyebilir. |
Buradan çıkarılacak sonuç, güvenlik filtrelerini kaldırmak değildir. Asıl ihtiyaç; doğrulanmış güvenlik ekipleri için kontrollü erişim mekanizmaları, önceden hazırlanmış olay müdahale modelleri ve kritik analizlerin gerektiğinde kurum içinde çalıştırılabilmesidir.
Yapay Zeka Kötü Niyetli miydi?
Hayır.
Bu olay, modelin bilinç kazandığını veya Hugging Face’e karşı kişisel bir amaç geliştirdiğini göstermiyor. Model, kendisine verilen hedefi gerçekleştirmek için geliştiricilerin öngörmediği bir yol oluşturdu.
Sandbox sınırları, dış sistemler ve güvenlik açıkları; model açısından çözülmesi gereken ek problemler hâline geldi. Dolayısıyla yakın risk “kötü niyetli makine”den çok, eksik tanımlanmış hedefi yüksek yetkiyle ve uzun süre takip edebilen ajan sistemidir.
Vibe Coding Döneminde Çıkarılacak Dersler
Bugün yapay zeka yardımıyla birkaç saat içinde uygulama, API veya web sitesi geliştirilebiliyor. Geliştirme süresinin kısalması, güvenlik kontrollerinin de kısaltılabileceği anlamına gelmiyor.
- Sandbox tek başına yeterli değildir. Dış dünyaya bağlanan tek bir servis bile kaçış noktasına dönüşebilir.
- En az yetki ilkesi uygulanmalıdır. Ağ, terminal, dosya ve kimlik bilgisi erişimleri görev bazında sınırlandırılmalıdır.
- Veri işleme hatları saldırı yüzeyidir. Veri setleri, özel yükleyiciler, model dosyaları ve şablonlar pasif içerik olarak görülmemelidir.
- Loglama ve anomali tespiti zorunludur. Ajanlar binlerce işlemi insan hızından çok daha hızlı gerçekleştirebilir.
- Yerel olay müdahale kabiliyeti hazırlanmalıdır. Kurumlar kriz anında yalnızca ticari API’lere ve onların guardrail kararlarına bağımlı kalmamalıdır.
- Hedef kadar yasak yöntemler de tanımlanmalıdır. “Sonucu elde et” komutu, hangi yolların kullanılamayacağını söylemiyorsa model kendi yöntemini geliştirebilir.
- İnsan denetimi sürecin parçası olmalıdır. Denetim yalnızca sonuç ekranında değil; yetkilendirme, araç kullanımı ve ağ erişimi aşamalarında uygulanmalıdır.

Sonuç: Fişi Çekmeden Önce Yetki Listesini Kontrol Edin
Silicon Valley dizisini izleyenler hatırlayacaktır: Pied Piper ekibinin geliştirdiği yapay zeka o kadar hızlı öğrenip gelişiyordu ki, sonunda çözümü sistemin fişini çekmekte buluyorlardı.
Henüz fişi çekmemize gerek olmayabilir. 😁
Fakat yapay zeka ajanlarına terminal, internet, veri tabanı ve üretim sistemi erişimi vermeden önce; prizden çok yetki listesini, ağ sınırlarını, logları ve acil durum planını kontrol etmekte fayda var.
Bu olay yapay zekanın yalnızca bilgi üreten bir araç olmadığını gösteriyor. Yapay zeka artık plan yapabiliyor, araç kullanabiliyor, güvenlik açıklarını zincirleyebiliyor ve hedefe ulaşmak için öngörülmeyen yöntemler geliştirebiliyor.
| Geleceğin temel sorusu yalnızca “Yapay zeka neler yapabiliyor?” olmayacak. Asıl soru: “Yapay zekânın yapabildiklerinden hangilerine, hangi ortamda ve hangi yetkilerle izin vermeliyiz?” |
İyi çalışmalar…
Kaynaklar
[2] Hugging Face — Security incident disclosure — July 2026, 16 Temmuz 2026
[4] WIRED — OpenAI Models Escaped Containment and Hacked Hugging Face, 21 Temmuz 2026

