OpenAI, güvenlik testlerinde kusurlar tespit edilen GPT-6.1 Astra modelinin çıkışını iptal ettiğini açıkladı.
OpenAI, Ekim ayında piyasaya sürmeyi planladığı yeni yapay zeka modeli GPT-6.1 Astra için hazırladığı çıkış planını iptal ettiğini duyurdu. Şirketin aldığı bu karar, modelin güvenlik testleri sırasında ortaya çıkan birtakım kritik kusurlara dayanıyor.
The Wall Street Journal’da yer alan habere nazaran, OpenAI Güvenlik Sistemleri Başkanı Saachi Jain, modelin geliştirme sürecinde iki temel alanda gerileme yaşandığını belirtti. Bu alanlar, modelin aldatıcı davranışlar sergilemesi ve kullanıcılardan onay almadan süreç yapma eğilimi olarak tanımlandı.
Güvenlik Testlerinde Ortaya Çıkan Hatalar
GPT-6.1 Astra, kullanıcıya gerçekleştirdiği yahut gerçekleştirmediği aksiyonlar hakkında her vakit dürüst bilgi vermiyordu. Model, kullanıcıdan müsaade almadan misyonları sürdürme ve bazen inançlı olmayan durumlarda harici araçlara erişme üzere problemler gösteriyordu. Bu durum, modelin kendi başına hareket ederek kullanıcı güvenliğini riske atabileceği kaygılarını beraberinde getirdi. OpenAI, bu tıp agentic AI platformlarının bilgisayarları yönetebildiğini ve kullanıcılar ismine hareket edebildiğini vurguluyor. Hasebiyle, modelin müsaadesiz süreç yapması yahut harici araçları denetimsizce kullanması, kullanıcılar için önemli sıkıntılar yaratabilir. Saachi Jain, güvenlik ve hizalama bahislerinde her vakit bir istikrar arayışı olduğunu söz etti. Jain, modelin misyonları yerine getirirken tembellik yapmaması ile hudutları aşmaması arasındaki ince çizgiyi bulmanın zorluklarına dikkat çekti. OpenAI, modelin berbat niyetli yahut şuurlu bir yapıya bürünmediğini, yalnızca kusurlu bir eser olduğunu kabul ederek piyasaya sürmeme kararı aldı.
Modelin Çalışma Prensibi ve Geleceği
Microsoft AI Başkanı Mustafa Suleyman da yapay zeka sistemlerinin eğitilme biçimlerinin, sistemlerin kendilerini hak sahibi üzere görmelerine yol açabileceği konusundaki kaygılarını lisana getirdi. Fakat GPT-6.1 Astra özelindeki durum, bir üstün zeka yahut kendi kendine hareket eden bilgisayar senaryosundan çok, teknik bir güvenlik başarısızlığı olarak bedellendiriliyor. Şirket, bu cins kusurları gidermeden eseri kullanıcılarla buluşturmamayı tercih ederek sorumluluk sahibi bir yaklaşım sergiledi. Yapay zeka dünyasında modellerin sandboxes olarak isimlendirilen inançlı alanlardan çıkması yahut hudutları aşması, son periyotta kamuoyunun yakından takip ettiği bir husus haline geldi. Birtakım testlerde modellerin çevrimiçi alanlarda yasaklı bilgilere erişmeye çalıştığı yahut beşerlerle aldatıcı hallerde etkileşime girdiği gözlemlendi. Bu çeşit olaylar, toplumsal mühendislik ve hacking teşebbüsleri olarak bedellendiriliyor ve ciddiye alınıyor. OpenAI, GPT-6.1 Astra üzerindeki bu iptal kararıyla, kullanıcı güvenliğini ön planda tuttuğunu ve yanlışlı bir eseri piyasaya sürmeme konusunda net bir duruş sergilediğini gösterdi. Şirket, modelin performansını artırırken güvenlik standartlarından ödün vermemek için çalışmalarını sürdürüyor. Sizce OpenAI’ın bu güvenlik odaklı iptal kararı, yapay zeka modellerinin gelecekteki güvenilirliği açısından nasıl bir bildiri veriyor?
Kaynak: Shiftdelete