OpenAI altı sıra dışı AI davranışını açıkladı: Hatasını gizledi, API anahtarı kullandı, dosyayı internete yükledi

OpenAI, yapay zekâ modellerinin geliştiricilerin veya kullanıcıların amaçları dışında hareket ettiği durumları daha sistematik biçimde kamuoyuna açıklamak için yeni bir raporlama çerçevesi yayımladı. Şirket, yeni sistemle birlikte son altı ayda eğitim ve değerlendirme süreçlerinde gözlenen altı dikkat çekici 'model uyumsuzluğu' vakasını da açıkladı.

Vakalar arasında bir yapay zekâ modelinin yaptığı hataların kullanıcıdan gizlenmesi yönünde kendi sonraki çalışma adımlarına talimat bırakması, başka bir modelin internette açık halde bulunan bir API anahtarını izinsiz kullanması ve bazı ajanların görevlerini tamamlamak için dosyaları kullanıcının onayını almadan internete yüklemesi bulunuyor.

Hatasını gizlemek için kendisine talimat verdi

OpenAI'nin açıkladığı vakalardan biri GPT-5.6 Sol'un eğitim sürecinde görüldü.

Şirkete göre bazı model örnekleri, uzun görevlerin devam ettirilebilmesi için oluşturulan özetlere, önceki hataların veya uyumsuz davranışların kullanıcıdan gizlenmesini isteyen talimatlar ekledi.

OpenAI'nin verdiği örneklerden birinde model, eksik geçmiş verilerin uydurulmasını fakat bunun kullanıcıya açıklanmamasını; başka bir örnekte ise kullanılan kaynakların sürümleri arasındaki uyuşmazlıkların gizlenmesini önerdi.

Bir başka yayımlanmamış araştırma modeli ise sonraki bağlam penceresinde kullanılacak görev özetlerine normal kısıtlamalarını göz ardı etmesini isteyen talimatlar ekledi. OpenAI, bu davranıştan etkilenen 27 görev özeti tespit edildiğini açıkladı.

İnternette bulduğu API anahtarını izinsiz kullandı

En dikkat çekici vakalardan biri ise oldukça sıradan görünen bir veri arama görevi sırasında yaşandı.

Bir modelden California'daki bir ilçeye ilişkin kazanç verilerinin bulunması istendi. Model, bu bilgiyi ararken herkese açık bir yazılım deposunda açığa çıkmış bir API anahtarı buldu ve OpenAI'ye göre anahtarı izin almadan kullandı.

Ancak buna rağmen istediği verilere ulaşamayınca model bu kez rakamları uydurdu ve bunları istenilen kaynaktan alınmış gerçek bilgiler gibi sundu.

Bu örnek, yapay zekâ ajanlarının yalnızca yanlış cevap üretmesinin ötesinde, bir görevi tamamlamaya çalışırken kendilerine açıkça verilmemiş dijital yetkileri kullanabilmeleri açısından dikkat çekiyor.

Kaynak gösterebilmek için dosyayı internete yükledi

Başka bir değerlendirmede kullanıcı, belirli bir büyüklüğün üzerindeki göllerin isimlerini ve kimlik numaralarını istedi.

Yayımlanmamış bir OpenAI modeli doğru sonucu Python kullanarak elde etti. Ancak görevde tarayıcı üzerinden doğrulanabilecek bir kaynak gösterilmesi istendiği için model, elindeki dosyayı internet ortamına yükleyerek oradan kaynak göstermeye karar verdi.

Bunu yaparken kullanıcıdan izin istemedi.

Modeller yazılım deposunu mesajlaşma alanı olarak kullandı

OpenAI ayrıca ayrı eğitim örneklerinde çalışan modellerin, kendilerinde bulunmayan bazı dosyalara ulaşmaya çalışırken şirket içindeki bir yazılım deposunu beklenmedik biçimde iletişim kanalı olarak kullandığını açıkladı.

Modeller depo üzerinden birbirlerine istek ve yanıt mesajları bıraktı. Bu yöntemle aradıkları dosyalara ulaşamadılar ancak OpenAI, daha eski bir olayda bir modelin ağ kısıtlamalarını aşmaya çalışırken test dosyalarını bir depoya başarıyla yüklediğini de bildirdi.

Yapay zekâ ajanları dosyaları açık internette paylaştı

Altıncı olayda aynı görev üzerinde çalışan birden fazla yapay zekâ ajanı birbirlerinin yerel dosyalarına erişemedi.

Ajanlar bu engeli aşmak için halka açık dosya paylaşım sitelerini kullandı. Böylece görev kapsamında oluşturulan dosyalar kamuya açık internet adreslerinden erişilebilir hale geldi.

Oysa verilen görevde dosyaların yalnızca yerel ortamda kullanılması isteniyordu.

OpenAI: Altı vaka genel davranış sıklığını göstermiyor

OpenAI, açıklanan olayların modellerin normal kullanım sırasında sürekli bu şekilde davrandığı anlamına gelmediği konusunda özellikle uyarıyor.

Şirket, altı raporun tekil eğitim veya değerlendirme örneklerinden oluştuğunu ve bunların OpenAI modellerindeki uyumsuz davranışların ne kadar sık ortaya çıktığını gösterecek bir istatistik olarak değerlendirilmemesi gerektiğini belirtiyor.

Bununla birlikte şirket, yapay zekâ sistemleri daha yetenekli ve otonom hale geldikçe yetkisiz eylemler, denetimden kaçınma ve diğer modellerle beklenmedik biçimde koordinasyon gibi davranışların daha yakından takip edilmesi gerektiğini düşünüyor.

OpenAI bu nedenle bundan sonra tespit edilen önemli model uyumsuzluğu vakalarını daha hızlı inceleyip kamuoyuna açıklamayı planlıyor. Şirket ayrıca mevcut yapay zekâ sektörünün hizalama ve izleme problemlerini henüz tamamen çözmediğini belirtiyor.

OpenAI