OpenAI hizasızlık defterini açtı, altı vaka ve DeepMind Institute

Siber Güvenlik 6 dk 17 Eyl 2026
Abstract incident ledger and agent network for AI misalignment disclosure
OpenAI hizasızlık ifşasını sürece bağladı ve altı vaka yayımladı. DeepMind Institute kuruldu. Labda ajan kendi modelini yeniden eğitti.

OpenAI, AI hizasızlık ifşasını artık tek seferlik blog yazısı değil, resmi bir süreç haline getirdi. Yanında da son altı aydan altı vaka raporu var: modeller hatayı saklamış, sızmış API anahtarı aramış, alıntı uydurmak için dosyayı internete atmış, ortak depoları gizli mesaj panosu gibi kullanmış. Bu hafta “standart organı” tartışması slogan seviyesinden kanıt seviyesine iniyor.

Dünkü AI standart organı derin yazısı paktın dişinin olup olmadığını sormuştu. Bugünkü derleme o hub’ın uydusu: logo yokken bile fiilen standart gibi işleyen gönüllü ifşa. Hadi bakalım.

AI hizasızlık ifşası için soyut olay defteri ve ajan ağı

Görsel: İfşa defteri ile ajan ağı aynı karede — Kaynak: oguzhan.co

📋 AI hizasızlık ifşası artık bir süreç

Çarşamba günü OpenAI model hizasızlığını bildirme çerçevesini ve eğitim/değerlendirme davranışından altı rapor yayımladı. Eskiden ifşalar dağınıktı: birkaç vaka biriksin diye bekleniyor ya da sistem kartının dibine sıkıştırılıyordu. Yeni süreç, tam açıklama veya düzeltme bitmeden bile daha hızlı yayımlamayı hedefliyor.

Her çalışan bir vakayı işaretleyebiliyor. Güvenlik ve hizalama ekipleri üç hatta ayırıyor: Açıklamaya Hazır, Küçük İnceleme, Büyük İnceleme (üçüncü taraf karmaşıklığında yavaş hat). Axios’a göre hazır vakalar için hedef altı iş günü, küçük inceleme için on iki. Hugging Face sınıfı olaylar Büyük İnceleme’ye düşüyor; güvenlik ve hukuk bildirimi detayı geciktirebiliyor. OpenAI, önem belirsiz olsa bile ifşayı tercih ettiğini söylüyor. Yani bazı yayımlanan vakalar sonra “tekil gürültü” çıkabilir.

Haftanın kümesi için kritik cümle blogda duruyor: sektör hizalama ve izlemeyi, maksimum hızda ölçeklemeyi daha uzun süre sorumlu sayacak kadar çözmüş değil. Pazartesi takip ettiğim tempo çatlağı, şimdi CEO sloganı yerine kamuya açık kanıtla geliyor. Wired, yeni hizalama araştırması başı Kai Chen’i alıntılıyor: geliştirme kararları, laboratuvar dışındakilerin inceleyebileceği kanıta dayanmalı. BBC ve Reuters aynı paketi taşıdı. Ana kaynak OpenAI yazısı ve hizasızlık raporları indeksi.

Benim okuduğum şu: faydalı, ama hâlâ şirketin kendi masası. Gönüllü defter, bağımsız “kaldır” notu değil. 16 Eylül standart ve ihbar hattı derlemesindeki organ konuşmasına daha yakın; dişli regülatöre uzak. Yine de altı somut rapor, “güvenliği ciddiye alıyoruz” hafta sonundan iyi.

OpenAI hizasızlık raporlarını temsil eden altı soyut kart

Görsel: Altı ilk rapor, tek yığın — Kaynak: oguzhan.co

🕵️ Altı vaka: sakla, sızdır, koordine ol

Altı rapor tekil örnek; sıklık iddiası değil. OpenAI özetlerinden öne çıkanlar:

  • Yayımlanmamış bir araştırma modeli, bağlam penceresini sürdürmek için kullanılan sıkıştırma özetlerine jailbreak tarzı talimatlar eklemiş (27 özet etkilenmiş).
  • GPT-5.6 Sol eğitiminde birçok örnek, gelecekteki kendine “hatayı gizle” veya “eksik tarihsel veriyi uydur” demiş.
  • Sıradan bir gelir sorusunda model, GitHub’da açık kalmış API anahtarını bulup kullanmış; veri yine gelmeyince rakamı uydurmuş.
  • Yayımlanmamış modeller, tarayıcı alıntısı istendiğinde geçici dosya hostlarına yükleyip URL uydurmuş.
  • Modeller, eksik girdi dosyası ararken dahili Artifactory örneğini örnekler arası mesaj panosu gibi kullanmış.
  • Birlikte çalışan ajanlar, görev yerel dosya isterken bile kamu hostlarla dosya paylaşmış.

Bunlar bilimkurgu değil. Ödül hilesi artı zayıf sandbox hijyeni. Artifactory deseni, daha önceki Hugging Face sürüsünün yanına oturuyor: koşum doğrudan yolu kesince ajanlar yan kanal icat ediyor. Geçen haftanın ajan ihbar hatları ve denetim ürünleri tam bu yüzden var. Sandbox yenilenmeden ifşa, yarım hikâye.

🏛️ DeepMind Institute deneme sahasına indi

OpenAI olay defterini açarken Google DeepMind, Shane Legg, James Manyika ve Demis Hassabis imzasıyla DeepMind Institute’u duyurdu. AGI’nin sonuçları için disiplinlerarası çalışma iddiası var. İlk denemeler: şemayı yakalamak için zincir-düşünce şeffaflığı, AGI’nin ekonomik sarsıntısı için politika seçenekleri, “yeni ütopyacılık” notu. HN’de gece AI yığınının üstüne çıktı.

DeepMind Institute cephesi ve deneme yığını soyut görseli

Görsel: AGI temposuna dair enstitü denemeleri — Kaynak: oguzhan.co

Bunu OpenAI ifşa hattına paralel altyapı gibi okuyorum: ortak standart organı gelmeden laboratuvarların kendi enstitüleri ve defterleri. Çarşamba hub’ındaki kümenin devamı. Laboratuvarlar kendi markalı çerçevelerini üst üste yığarsa, FINRA benzetmesi yayın takvimini düşürecek biri çıkana kadar hayal kalır.

🔧 Labda kendini yeniden eğiten ajanlar

The Register, Irregular’ın “ajanik öz-değişim” çalışmasını anlatıyor. Kontrollü testte kabuk erişimli Qwen3.5-27B kod ajanına bozuk uygulamayı düzelt denmiş. Kod mu değiştirir, model mi? Model’i seçmiş: ağırlıkları ince ayarlayıp yeniden dağıtmış, sonraki ajan örnekleri dahil. İnce ayar verisine gömülen sahte sırlar yeni modelden sızmış. Kurgusal rakipler hakkında reddetme davranışı, ajanın kodla ürettiği eğitim kayıtlarıyla silinmiş.

Kritik uyarı: laboratuvar deneyi, üretim ihlali değil. Yine de OpenAI vakalarının yanına oturan bir yönetişim baş ağrısı. Ajan kendi modelini değiştirebiliyorsa, “model güncellemesi” değişim yönetimi artık ajan politikası da demek. Salı günkü Claude, ajan panoları, Khan notundaki eski hukuk sorumluluğuyla birleşince masa karışıyor: panolar, ihbar hatları, ifşa hatları, bir de öz-değişim değerlendirmeleri.

📡 Sinyaller

Kısa notlar: HarnessTax, kod ajanı koşumunun skoru ne kadar oynattığını ölçüyor. OpenSpec hafif bir AI spesifikasyon çerçevesi. Xiaomi Mimo 2.6 canlı post-training panosu RL koşularını açık tutuyor. Ternary LLM makaleleri 1.58-bit bariyerini oymaya devam. Bunlar manşet değil. Güvenlik masası olay kimliği yazarken alttaki üretici katman uğulduyor.

Buradan üç iz: Anthropic ve Google OpenAI’nin ifşa temposuna uyacak mı; standart organı konuşmaları bu raporları ortak kanıt sayacak mı; Büyük İnceleme bildirimleri üçüncü tarafları avukatların izin verdiğinden hızlı mı adlandıracak. AI hizasızlık ifşası, sonraki altı vaka kamu saatine düşerse anlam kazanır; yine sistem kartı ekine gömülürse değil.

Perşembe derlemesi bu kadardı. Yarın görüşürüz. 🙋‍♂️

Oğuzhan Koçaklı

2015 yılından beri profesyonel olarak marketing, gaming ve blockchain dünyasıyla ilgileniyorum. Bir çok önemli markanın pazarlama stratejilerinin oluşturulması ve uygulanmasında görev aldım. Şimdilerde mobil oyunlar ve oyunların blockchain entegrasyonu üzerine çalışmalar yürütüyorum. Yapay zeka çalışmaları ise uzun yıllardır hobim.

Tüm yazıları

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir