On-Device AI: Bulutu Beklemeyen Modelin Gizlilik ve Gecikme Hesabı
Cihazda yapay zeka, dil modellerini doğrudan telefon ve dizüstünün NPU’sunda çalıştırarak ağ gecikmesini ve veri paylaşımını ortadan kaldırıyor; Apple’ın yaklaşık 3 milyar parametreli yerel modeli, Llama 3.2’nin 1B/3B kenar sürümleri ve cihaz için yayımlanan gpt-oss-20b bu yarışın somut adımları olurken, asıl darboğaz hesap gücü değil birim bellek.
Hesap neden buluttan iniyor?
Sunucu tarafı çıkarım üç bedel birden çıkarıyor: ağ gecikmesi, sorgu başına GPU maliyeti ve verinin cihazı terk etmesi. Oysa yazım tamamlama, özetleme ya da fotoğraf düzenleme gibi işlerde telefonun hızlandırıcısına sığan bir model yeterli; sonuç uçuş modunda da çalışan bir asistan ve yerinde işlenen kişisel veri.
2024’ten itibaren bu gerekçe sektörün ana gündemlerinden biri oldu: Apple kendi model setini duyurdu, Meta kenar sürümleri Qualcomm ve MediaTek iş birliğiyle cihazlara indirdi, OpenAI açık ağırlıklı serisini cihaz hedefiyle yayımladı. Yarış, model büyütmekten modeli sığdırmaya kaydı.
Apple cephesi
Haziran 2024’teki WWDC’de tanıtılan Apple Intelligence, yaklaşık 3 milyar parametrelik bir temel modeli doğrudan cihazda çalıştırmak üzere kurgulandı; model Apple silicon’ın GPU’su ve Neural Engine’i için optimize edildi, daha ağır işler sunucu modellerine bırakıldı.
Temmuz 2025’te yayımlanan teknik makale mimariyi ve eğitim rejimini ayrıntılarıyla anlattı. Yerel model; yazım araçlarından özetlemeye kadar gündelik işlerin omurgası oldu ve cihazda kalması, Apple’ın gizlilik anlatısının teknik temelini oluşturdu.
Android hattı ve gpt-oss
Eylül 2024’te Meta, Llama 3.2’nin 1B ve 3B sürümlerini kenar cihazlar için duyurdu; Qualcomm ve MediaTek bu modelleri kendi hızlandırıcı yığınlarında çalıştırmayı üstlendi. Snapdragon platformunda telefonun içinde, indirilip kalıcı olarak çalışan bir dil modeli fiilen mümkün hâle geldi.
OpenAI, Ağustos 2025’te gpt-oss serisini Apache lisansıyla yayımladı ve 20B’lik üye doğrudan cihaz senaryolarını hedefliyordu; Qualcomm aynı ay gpt-oss-20b’yi Snapdragon donanımında çalıştırdığını duyurdu. Açık ağırlıklar, on-device yarışının yakıtı oldu.
Bellek duvarı
Cihazda yapay zekanın gerçek sınırı hesaptan çok bellek: milyarlarca parametreli bir model tam hassasiyette gigabaytlarca yer ister; telefonun birleşik belleği ise sistem ve uygulamalarla paylaşılmak zorunda. Kuantalama, GGUF benzeri sıkıştırılmış biçimler ve BitNet gibi üç durumlu ağırlıklar bu duvarı oymanın araçları.
Bir de pazarlama boşluğu var: NPU’nun tepe hesap rakamları, dil modeli iş yükünün bellek bant genişliği talebini karşılamıyor. Bu yüzden kazançlar model mimarisinden çok sistem yazılımı ve kuantalama katmanında birikiyor.
Nereye kadar?
Küçük modellerin kalitesi arttıkça cihaz tarafı daha fazla görevi devralacak; ama uzun akıl yürütme zincirleri ve geniş dünya bilgisi isteyen işler bir süre daha veri merkezine yazılmaya devam edecek. Mimari hibrit kalıyor: yerde hızlı refleks, bulutta ağır top.
İki komşu madde tabloyu tamamlıyor: NPU mimarisinin tepeden tırnağa nasıl kurulduğu ve CPU’da çalışan 1-bit modellerin bellek hesabı. Cihazda yapay zeka, donanım–yazılım–model üçlüsünün birlikte incelmesiyle ilerliyor.
- Gecikme ve gizlilik, cihaz çıkarımının iki somut gerekçesi
- Apple ~3B yerel modelle ana akım telefonu örnekledi
- Llama 3.2 ve gpt-oss-20b açık ağırlıklarla hattı yaygınlaştırdı
- Asıl darboğaz TOPS değil, birim bellek ve bant genişliği
- Uzun bağlam ve ağır akıl yürütme şimdilik sunucuda kalıyor
Sık sorulan sorular
On-device AI ile bulut neden birlikte yaşıyor?
Çünkü iki tarafın avantajı farklı: cihaz düşük gecikme, gizlilik ve çevrimdışı çalışma verirken; bulut devasa bağlam, güncel dünya bilgisi ve uzun akıl yürütme sağlıyor. Ürünler bu yüzden yerel modelle başlayıp gerektiğinde sunucuya terfi eden hibritler olarak kuruluyor.
Telefonda hangi modeller çalışabiliyor?
Pratik eşlik cihazın RAM’i: kuantalanmış 1–8 milyar sınıfı modeller modern amiral gemilerinde yerel olarak yürüyebiliyor. Llama 3.2’nin 1B ve 3B sürümleri tam bu hedefle yayımlandı; daha büyük modeller kuantalama ve hızlandırıcı yığını gerektiriyor.
NPU’lar GPU’dan daha mı verimli?
Tepe hesapta evet, dil modelinin darboğazında hayır. Çıkarımın büyük kısmı bellek aktarımı olduğu için, kazancın çoğu NPU’nun kendisinden değil onu besleyen yazılım katmanı ve sıkıştırma biçimlerinden geliyor.
Gizlilik tek avantaj mı?
Hayır. Ağ isteği çıkmadığı için veri sızıntısı yüzeyi küçülüyor; ayrıca çevrimdışı kullanım, sıfıra yakın gecikme ve sorgu başına sıfır API maliyeti geliyor. Bedeliyse sığmayan modeller, paylaşılamayan dev bağlamlar ve güncellenmesi zor cihaz parkurları.
Kaynakça
- Introducing Apple’s On-Device and Server Foundation ModelsApple Machine Learning Research
- Apple Intelligence Foundation Language ModelsarXiv
- Llama 3.2: Revolutionizing edge AI and vision with open, customizable modelsMeta AI
- Qualcomm partners with Meta to support Llama 3.2Qualcomm
- Introducing gpt-ossOpenAI
- OpenAI’s gpt-oss-20b on-device on SnapdragonQualcomm
Bu konuyla ilgili haberler
- Apple'dan 2nm M5 ve A20 Pro Hamlesi: Cihaz İçi Tam Otonom Ajan Dönemi Başlıyor
- Siri Yeniden Doğdu: Apple Intelligence ve Gemini ile iPhone'larda Tam Otonom Eylem Çağı
- Apple Intelligence Küresel Arenaya Açılıyor: Çin'de Baidu, Avrupa'da Yerelleştirilmiş Hibrit Bulut Modeli
- Trump’tan Tarihi ‘Süper Zeka Gücü’ Hamlesi: Jay Clayton Federal AI Çarı Olarak Atandı!