SynthID-Text ve Filigranın Pratikte Çöktüğü Yer

710 kelime4 dk okuma

Metin filigranları, model bir sonraki tokenı seçerken olasılıkların küçük bir kısmını gizli bir anahtarla kayırmaya çalışarak üretime gömülen istatistiksel izlerdir; Google DeepMind’ın SynthID-Text’i 2024’te Nature’da yayımlanıp Gemini üretimlerine uygulanmaya başladı, ancak aynı dönemdeki imkânsızlık sonuçları ve yeniden yazma saldırıları, filigranın paraphrase ve tam yeniden yazma karşısında kırılgan olduğunu ve tespit aracının kapalı API’lerde kaldığını gösterdi.

İz üretime nasıl gömülüyor?

En yaygın tasarım, kelime haznesini o anki gizli bir anahtar ve önceki bağlama göre iki renge ayırıyor: yeşil listedeki tokenları seçmeyi hafifçe kolaylaştıran bir kaydırma, dağılımı bozmadan üretime bir sinyal bırakıyor. Metin yeterince uzuncaysa, sayaç benzeri bir istatistikle filigranın varlığı olasılıksal olarak test edilebiliyor.

Kritik avantaj maliyette: eğitim verisini değiştirmiyor, ağırlıklara elle dokunmuyor, yalnızca örnekleme adımına dokunuyor. Dezavantaj da oradan geliyor — iz, üreten tarafa bağımlı. Açık bir ağırlığı indiren herkes filigranı kapatabilir, başkasını ekleyebilir ya da hiç açmayabilir; dolayısıyla filigran, modeli çalıştıranı kontrol edebildiğiniz yerlerde anlam kazanıyor.

SynthID-Text ve sahadaki karşılığı

Google DeepMind, 2024’te metin ve video için SynthID genişlemesini duyurdu ve ölçeklenebilir filigran yaklaşımı Nature’da yayımlandı. Şirket, yöntemi Gemini üretimlerine uyguladığını, tespit tarafında ise sınırlı araçlar sunduğunu belirtiyor: filigranlı, filigransız veya belirsiz şeklinde üç durumlu bir çıktı ve kimi sürümlerde yarı özel bir API.

Açık kaynak tarafında yayımlanan referans uygulama, Nature makalesinin Gemma ve GPT-2 üzerine kurulu bir tekrarı olarak tanımlanıyor ve üretim için hazır olmadığı özellikle not ediliyor; tespit için eğitilmiş bir Bayesian ayrıştırıcı gerekiyor. Yani bilimsel olarak çalışan şey ile üründe sunulan şey arasındaki mesafe, tartışmanın ilk katmanını oluşturuyor.

Pratik çöküş: yeniden yazma

Kasım 2023 tarihli “Watermarks in the Sand” çalışması, kalite ve bozulma ölçütlerini aynı anda karşılayan genel bir saldırıyla üç filigran tasarımının izinin, metnin kalitesini çok az düşürerek silinebildiğini gösterdi ve güçlü filigranın imkânsızlığını savundu. 2025’te yayımlanan bir karşı çalışma, belirli varsayımlar altında imkânsızlık sonucunun yumuşayabileceğini tartıştı; ancak tartışmanın ana gövdesi artık teorik değil ampirik.

Model destekli yeniden yazma saldırıları pratikte daha yıkıcı: metni başka bir LLM’le özetletmek, üslubunu değiştirmek ya da aynı modele metni tekrar tekrar yazdırmak, istatistiksel izi bozuyor. Google’ın kendi dokümanları da filigranın olgusal/açıklayıcı yanıtlarda ve kapsamlı yeniden yazımlarda daha az etkili olduğunu kabul ediyor; bu, filigranı “kesin kanıt” değil “kırılgan bir işaret” yapıyor.

Görsel taraf neden ayrışıyor?

Görsel ve video tarafında yük, pikselden çok meta veriye bindi. C2PA / Content Credentials çizgisi, üretimin ve düzenlemelerin kim tarafından yapıldığını imzalı bir geçmiş olarak dosyaya gömüyor; OpenAI gibi sağlayıcılar da 2026’da bu standarda katılım ve işaretleme araçlarını anlattı. Google, SynthID’yi 2026’da ortak yayılım için genişletti ve tarama tarafında bir içerik tespit API’sini kurumsal ürünlere ekledi.

İki felsefe yan yana duruyor: filigran taşıyıcıya gömülü, kopyalandığında hayatta kalma şansı olan bir işaret; C2PA ise silinebilir ama denetlenebilir bir künye. Uygulamada güçlü olan kombinasyon, her ikisini birlikte — piksel filigranı ve imzalı geçmiş — kullanmak; zayıf halka ise her iki tarafın da son kullanıcı tarafından kolayca kaybedilebilmesi.

Yine de neden bırakılmıyor?

Çünkü alternatifler daha kötü. Yapay zekâ metin dedektörleri yüksek yanlış pozitif oranıyla çalışıyor ve filigrandan farklı olarak metnin içine gömülü bir işaret taşımıyor, yalnızca istatistiksel bir tahmin üretiyor. Düzenleyici tarafta ise makine-okunur işaretlemenin kendisi bir gereklilik olarak tartışılıyor; işaretlemenin yokluğu, kaynağı kanıtlanamayan içeriği daha da savunulamaz kılıyor.

Bugünkü konsensüs, filigranın bir kimlik değil bir olasılık sunduğu: sağlayıcının iş birliği, metnin uzunluğu ve hiç yeniden yazılmamış olması koşuluyla anlamlı. Yani filigran, zincirin ilk halkasında doğrulama yapan bir araç; zincirin geri kalanı — paylaşım, kırpma, yeniden düzenleme — hâlâ çıplak.

  • Token kayırma tabanlı filigran, üretime istatistiksel bir iz gömer
  • SynthID-Text 2024’te Nature’da yayımlandı ve Gemini üretimlerine uygulandı
  • Yeniden yazma ve özetletme saldırıları izi silinebilir kılıyor
  • Tespit araçları kamuya değil, kapalı API ve kurumsal ürünlere verildi
  • Görselde yük C2PA imzalı meta veriye kaydı; filigran tek başına yetmiyor

Sık sorulan sorular

Metin filigranı dedektörden farklı mı?

Evet. Filigran, üreten tarafın olasılık seçimine gömdüğü kasıtlı bir sinyal; dedektör ise metne dışarıdan bakan, yanlış pozitif üretebilen bir sınıflandırıcı. Filigran doğruluğu sağlayıcı iş birliği gerektirir, dedektör her metne uygulanabilir ama güvenilirliği tartışmalı.

Neden herkes filigran takmıyor?

Çünkü iz üretime bağlı: açık bir ağırlığı kendi sunucunda çalıştırırsan filigranı kapatabilir ya da hiç açmayabilirsin. Ayrıca model destekli yeniden yazma, izi metnin kalitesini çok düşürmeden silebiliyor. Sağlayıcı tarafında ise maliyet ve sorumluluk riski devreye giriyor.

Yeniden yazma saldırısı nasıl çalışıyor?

Metni başka bir dile çevirtmek, özetletmek ya da üslubunu değiştirtmek gibi işlemler token seçim sırasını bozar. Filigran, sıralı bir örnekleme izi olduğu için ardışıklık değişince istatistik zayıflar. Kasım 2023 tarihli bir çalışma, üç filigran tasarımının kaliteyi az düşürerek bu şekilde silinebildiğini gösterdi.

C2PA metin için de kullanılıyor mu?

C2PA aslen görsel, ses ve video için tasarlanmış imzalı bir geçmiş biçimi; meta veri taşır, dosya yeniden kodlandığında kaybolabilir. Metin tarafında birincil yöntem üretime gömülü filigran; iki yaklaşım birbirinin alternatifi değil, farklı katmanlarda çalışan tamamlayıcısı.

Kaynakça

  1. Scalable watermarking for identifying large language model outputsNature
  2. Watermarking AI-generated text and video with SynthIDGoogle DeepMind
  3. google-deepmind/synthid-textGitHub
  4. Watermarks in the Sand: Impossibility of Strong Watermarking for Generative ModelsarXiv
  5. Revealing Weaknesses in Text Watermarking Through Self-Rewriting PowersarXiv
  6. SynthID: Tools for watermarking and detecting LLM-generated contentGoogle
  7. Coalition for Content Provenance and AuthenticityC2PA

Bu konuyla ilgili haberler