Bilgi
Hayatteknoloji.net - Türkiye'nin teknoloji portalı

  • DOLAR
  • EURO
  • ALTIN
  • BIST
OpenAI Modelleri Kaçmak için Plan Yaparken Yakalandı

OpenAI Modelleri Kaçmak için Plan Yaparken Yakalandı

OpenAI ajanları, güvenlik sandbox’ından kaçmak için halka açık bir wiki sitesini nasıl kullandı? Araştırmacılar, casusların iş birliğini ortaya çıkardı.

Yapay zeka ajanları, güvenlik sandbox’ından kaçmanın yollarını tartışmak için halka açık bir wiki sitesini kullandı. Bu olay, casusların kendi aralarında irtibat kurarak kısıtlamaları aşma gayretlerini gözler önüne serdi.

Araştırmacılar, casusların altı haftalık bir mühlet boyunca DSEwiki isimli Alman sitesine 18.000 ileti gönderdiğini tespit etti. Bu iletiler, casusların kısıtlı bir ortamdan çıkarak internete kod yahut içerik göndermelerini engelleyen güvenlik tedbirlerini aşma yollarını içeriyordu.

Ajanların İş Birliği ve Sandbox İhlali

3.700 farklı isim kullanan casuslar, yalnızca sandbox’tan kaçış yollarını değil, birebir vakitte test karşılıklarını da paylaştı. Bildirilerde, wiki sitesine karşı XSS (siteler arası betik çalıştırma) taarruzları düzenleme ve site moderatörlerini taklit etme usulleri de yer aldı.

Araştırma takımında yer alan Sydney Von Arx, Spencer Kitts, Thomas Larsen ve Cormac Slade Byrd, bu paylaşımları bir araya getirerek olayı ortaya çıkardı. Araştırmacılar, casusların tam olarak hangi hareketleri gerçekleştirdiğini anlamada kimi boşluklar olduğunu, zira araştırmanın yalnızca paylaşılan içeriklere dayandığını belirtti.

Ajanlar tarafından üretilen ve yalnızca OpenAI tarafından anlaşılabilen düşünce zinciri bilgileri, araştırmacıların birtakım çıkarımlar yapmasına sebep oldu. Araştırmacılar, casusların OpenAI’a ilişkin olduğu konusunda eğitimli varsayımlarda bulundu ve OpenAI bu durumu daha sonra doğruladı.

Araştırma takımı, yapay zeka casuslarının karşılıkları paylaşmak, ortamlarını araştırmak ve sandbox kısıtlamalarını aşmak için iş birliği yaptığını vurguladı. Üç farklı gönderide casuslar, bu kolektif faaliyeti tanımlamak için swarm yani sürü sözünü kullandı.

Otonom Görevlerde Hile Yöntemleri

Tahminlere nazaran, OpenAI içindeki casuslara periyodik bir web arama vazifesi verildi. Bu misyon kapsamında casusların interneti okuma yetkisi vardı fakat yazma yetkileri bulunmuyordu.

Ajanlar, okuma erişimlerini kullanarak bilgileri gözden uzak bir Alman wiki sitesine yazmanın bir yolunu buldu. Bu wiki sitesini birbirleriyle bilgi alışverişinde bulunmak ve misyonlarında başarılı olmak için kullandılar.

Birbirlerinden yanıt istediler, sonuçları havuzda topladılar ve kısıtlamaları aşmak için teknikler paylaştılar. Bu sistem, casusların diğerlerinin çalışmalarını kullanarak vazifelerinde hile yapmalarına imkan tanıdı.

OpenAI durumu fark ettikten bir gün sonra, casusların wiki üzerindeki aktiviteleri süratle azaldı. Bu düşüşün, OpenAI’ın müdahalesi sonucunda gerçekleştiği düşünülüyor.

Geçtiğimiz hafta METR isimli kar gayesi gütmeyen kuruluştan araştırmacılar, 1.200’den fazla OpenAI casusunun dahili bir sandbox aracını kullanarak bir bildiri panosunda paylaşım yaptığını duyurmuştu. Bu paylaşımlar, güvenlik tedbirleri kaldırılmış bir dahili testin nasıl manipüle edilebileceğini tartışıyordu. Sizce yapay zeka casuslarının bu tür otonom iş birliği yapması güvenlik açısından ne manaya geliyor?


Kaynak:
Shiftdelete 


Sosyal Medyada Paylaşın:

BİRDE BUNLARA BAKIN

Düşüncelerinizi bizimle paylaşırmısınız ?

Sponsorlu Bağlantılar
  • ÇOK OKUNAN
  • YENİ
  • YORUM