Tarayıcı İçi Modeller (ONNX)
Doğrudan tarayıcı sekmesinin belleğinde ve bilgisayarınızın ekran kartında (WebGPU/WASM üzerinden) çalışan modeller — sunucu yok, Ollama yok, kurulacak hiçbir şey yok.
"Tarayıcı İçi" Ne Anlama Gelir
Ollama tabanlı motorların aksine, In-Browser LLM modelleri tarayıcı sekmenizden asla çıkmaz. Model ağırlıkları bir kez indirilir (ve tarayıcı tarafından önbelleğe alınır), ardından çıkarım (inference) tamamen istemci tarafında Transformers.js kullanılarak çalışır — Node.js sunucusu yok, yerel Ollama süreci yok, ilk indirmeden sonra hiçbir ağ isteği yok.
Donanım hızlandırması (WebGPU) mevcut olduğunda, model doğrudan sekmeden ekran kartınızda çalışır; aksi halde CPU üzerinde WASM'a geri döner. Her iki durumda da her şey o tek tarayıcı sekmesinin belleğinde gerçekleşir — sekmeyi kapatmak yüklenen modeli bellekten temizler (indirilen ağırlıkların kendisi bir sonraki sefer için tarayıcı önbelleğinde kalır).
Bu motor, Tarayıcı İçi Modeller (WebGPU) motorunun kardeşidir; o motor WebLLM üzerinde çalışır ve CPU'ya geri dönüşü olmadan gerçek WebGPU desteği gerektirir, karşılığında destekli GPU'larda daha hızlı çıkarım sağlar.
Nereden yapılandırılır
Settings → Agentic → Writer Engine ekranına gidin ve In-Browser LLM (ONNX)'yu seçin. Aşağıdaki listeden bir model seçin, İndir'e tıklayın, hazır olduğunda içerik üretimi için kullanılabilir hale gelir. Ayarların tam referansı için Agentic Ayarları sayfasına bakın.
Altyapı Teknolojisi
Bu motor, Hugging Face'in ONNX Runtime Web üzerine kurulu JavaScript kütüphanesi olan @huggingface/transformers (Transformers.js) üzerine inşa edilmiştir:
- Modeller ONNX formatında,
onnx-community/...depolarından indirilir. - Çalışma zamanı: ONNX Runtime Web — kütüphane, tarayıcının desteğine göre WASM veya WebGPU arka ucunu otomatik olarak seçer.
Farklı bir çalışma zamanı (WebLLM/MLC) ve farklı bir model formatı kullanan kardeş motor için Tarayıcı İçi Modeller (WebGPU) sayfasına bakın.
Mikro ve Ultra-Hafif Modeller
Çok eski veya ekran kartsız bilgisayarlarda bile tarayıcı sekmesini hiç kasmadan, saniyeler içinde inip çalışan başlangıç modelleri:
| Model | Boyut | En uygun kullanım |
|---|---|---|
SmolLM2-135M | ~100 MB | En hızlısı. Kısa hikayeler, basit taslaklar. |
SmolLM2-360M | ~200 MB | Hızlı metin tamamlama, dengeli kalite. |
Qwen2.5-0.5B | ~350 MB | Blog taslakları, iyi talimat takibi. |
Dengeli Tarayıcı Modelleri
Metin üretimi, özetleme ve sohbet görevlerinde hız/akıl yürütme dengesi tarayıcı için ideal olan modeller:
| Model | Boyut | En uygun kullanım |
|---|---|---|
TinyLlama-1.1B | ~630 MB | Bu kademede en iyi kalite. Hikaye ve bloglar için gerçek anlatım. |
Llama-3.2-1B-Instruct | ~750 MB | Meta'nın tarayıcı içi WebGPU dünyasında en çok kullanılan, sohbet yeteneği çok kararlı olan amiral gemisi mini modeli. |
SmolLM2-1.7B | ~1.0 GB | Smol serisinin en akıllı halkası. Tarayıcıda çalışmak üzere optimize edilmiş en popüler modellerden biri. |
Gelişmiş Tarayıcı Modelleri
Tarayıcı sınırlarını biraz zorlayan ama Türkçe anlama, mantık kurma ve teknik işlerde (kodlama gibi) WebGPU üzerindeki en yüksek performansı veren modeller:
| Model | Boyut | En uygun kullanım |
|---|---|---|
Qwen2.5-1.5B-Instruct | ~1.6 GB | 0.5B modelinin bir üstüdür. Tarayıcı içi modeller arasında Türkçe dil becerisi ve muhakeme yeteneği en açık ara en iyi olan modeldir. |
Qwen2.5-Coder-1.5B | ~1.6 GB | Özellikle tarayıcı içi kod tamamlama, kod analizi veya teknik formüllerle uğraşan kullanıcılar için optimize edilmiş versiyon. |
Boyutlarla ilgili not
Gösterilen boyutlar, Transformers.js üzerinden sunulan her modelin ONNX derlemesi (q4 sıkıştırma) için yaklaşık indirme boyutlarıdır — gerçek tarayıcı önbellek kullanımı tarayıcı ve sıkıştırma türüne göre hafifçe değişebilir.
Kategoriye Göre Model Seçimi
Mikro / Düşük Kaynak
SmolLM2-135M, SmolLM2-360M, Qwen2.5-0.5B — eski veya ekran kartsız makineler ya da hızlı bir ilk deneme için en iyisi.
Dengeli Tarayıcı Modelleri
TinyLlama-1.1B, Llama-3.2-1B-Instruct, SmolLM2-1.7B — günlük tarayıcı içi yazı ve sohbet için varsayılan öneri.
Gelişmiş Modeller
Qwen2.5-1.5B-Instruct, Qwen2.5-Coder-1.5B — daha büyük indirme ve bellek kullanımı karşılığında en iyi dil anlama, muhakeme ve kod kalitesi.
Bir Model İndirme
İlk indirme tarayıcı başına bir kez gerçekleşir — sonrasında model tarayıcının kendi önbelleğinden sunulur, bu yüzden sekme değiştirmek veya sayfayı yeniden yüklemek yeniden indirme gerektirmez. Farklı bir modele geçmek yalnızca o model için yeni bir indirmeyi tetikler.
SSS
Llama-3.2-1B-Instruct'tur. Bilgisayarınız çok düşük güçlüyse bunun yerine SmolLM2-135M ile başlayın.