TotalApp Docs

Tarayıcı İçi Modeller (ONNX)

Doğrudan tarayıcı sekmesinin belleğinde ve bilgisayarınızın ekran kartında (WebGPU/WASM üzerinden) çalışan modeller — sunucu yok, Ollama yok, kurulacak hiçbir şey yok.

"Tarayıcı İçi" Ne Anlama Gelir

Ollama tabanlı motorların aksine, In-Browser LLM modelleri tarayıcı sekmenizden asla çıkmaz. Model ağırlıkları bir kez indirilir (ve tarayıcı tarafından önbelleğe alınır), ardından çıkarım (inference) tamamen istemci tarafında Transformers.js kullanılarak çalışır — Node.js sunucusu yok, yerel Ollama süreci yok, ilk indirmeden sonra hiçbir ağ isteği yok.

Donanım hızlandırması (WebGPU) mevcut olduğunda, model doğrudan sekmeden ekran kartınızda çalışır; aksi halde CPU üzerinde WASM'a geri döner. Her iki durumda da her şey o tek tarayıcı sekmesinin belleğinde gerçekleşir — sekmeyi kapatmak yüklenen modeli bellekten temizler (indirilen ağırlıkların kendisi bir sonraki sefer için tarayıcı önbelleğinde kalır).

Bu motor, Tarayıcı İçi Modeller (WebGPU) motorunun kardeşidir; o motor WebLLM üzerinde çalışır ve CPU'ya geri dönüşü olmadan gerçek WebGPU desteği gerektirir, karşılığında destekli GPU'larda daha hızlı çıkarım sağlar.

Nereden yapılandırılır

Settings → Agentic → Writer Engine ekranına gidin ve In-Browser LLM (ONNX)'yu seçin. Aşağıdaki listeden bir model seçin, İndir'e tıklayın, hazır olduğunda içerik üretimi için kullanılabilir hale gelir. Ayarların tam referansı için Agentic Ayarları sayfasına bakın.

Altyapı Teknolojisi

Bu motor, Hugging Face'in ONNX Runtime Web üzerine kurulu JavaScript kütüphanesi olan @huggingface/transformers (Transformers.js) üzerine inşa edilmiştir:

  • Modeller ONNX formatında, onnx-community/... depolarından indirilir.
  • Çalışma zamanı: ONNX Runtime Web — kütüphane, tarayıcının desteğine göre WASM veya WebGPU arka ucunu otomatik olarak seçer.

Farklı bir çalışma zamanı (WebLLM/MLC) ve farklı bir model formatı kullanan kardeş motor için Tarayıcı İçi Modeller (WebGPU) sayfasına bakın.

Mikro ve Ultra-Hafif Modeller

Çok eski veya ekran kartsız bilgisayarlarda bile tarayıcı sekmesini hiç kasmadan, saniyeler içinde inip çalışan başlangıç modelleri:

ModelBoyutEn uygun kullanım
SmolLM2-135M~100 MBEn hızlısı. Kısa hikayeler, basit taslaklar.
SmolLM2-360M~200 MBHızlı metin tamamlama, dengeli kalite.
Qwen2.5-0.5B~350 MBBlog taslakları, iyi talimat takibi.

Dengeli Tarayıcı Modelleri

Metin üretimi, özetleme ve sohbet görevlerinde hız/akıl yürütme dengesi tarayıcı için ideal olan modeller:

ModelBoyutEn uygun kullanım
TinyLlama-1.1B~630 MBBu kademede en iyi kalite. Hikaye ve bloglar için gerçek anlatım.
Llama-3.2-1B-Instruct~750 MBMeta'nın tarayıcı içi WebGPU dünyasında en çok kullanılan, sohbet yeteneği çok kararlı olan amiral gemisi mini modeli.
SmolLM2-1.7B~1.0 GBSmol serisinin en akıllı halkası. Tarayıcıda çalışmak üzere optimize edilmiş en popüler modellerden biri.

Gelişmiş Tarayıcı Modelleri

Tarayıcı sınırlarını biraz zorlayan ama Türkçe anlama, mantık kurma ve teknik işlerde (kodlama gibi) WebGPU üzerindeki en yüksek performansı veren modeller:

ModelBoyutEn uygun kullanım
Qwen2.5-1.5B-Instruct~1.6 GB0.5B modelinin bir üstüdür. Tarayıcı içi modeller arasında Türkçe dil becerisi ve muhakeme yeteneği en açık ara en iyi olan modeldir.
Qwen2.5-Coder-1.5B~1.6 GBÖzellikle tarayıcı içi kod tamamlama, kod analizi veya teknik formüllerle uğraşan kullanıcılar için optimize edilmiş versiyon.

Boyutlarla ilgili not

Gösterilen boyutlar, Transformers.js üzerinden sunulan her modelin ONNX derlemesi (q4 sıkıştırma) için yaklaşık indirme boyutlarıdır — gerçek tarayıcı önbellek kullanımı tarayıcı ve sıkıştırma türüne göre hafifçe değişebilir.

Kategoriye Göre Model Seçimi

Mikro / Düşük Kaynak

SmolLM2-135M, SmolLM2-360M, Qwen2.5-0.5B — eski veya ekran kartsız makineler ya da hızlı bir ilk deneme için en iyisi.

Dengeli Tarayıcı Modelleri

TinyLlama-1.1B, Llama-3.2-1B-Instruct, SmolLM2-1.7B — günlük tarayıcı içi yazı ve sohbet için varsayılan öneri.

Gelişmiş Modeller

Qwen2.5-1.5B-Instruct, Qwen2.5-Coder-1.5B — daha büyük indirme ve bellek kullanımı karşılığında en iyi dil anlama, muhakeme ve kod kalitesi.

Bir Model İndirme

1. Settings → Agentic
2. Writer Engine → In-Browser LLM (ONNX)
3. Bir model seçin
4. İndirin ve kullanın

İlk indirme tarayıcı başına bir kez gerçekleşir — sonrasında model tarayıcının kendi önbelleğinden sunulur, bu yüzden sekme değiştirmek veya sayfayı yeniden yüklemek yeniden indirme gerektirmez. Farklı bir modele geçmek yalnızca o model için yeni bir indirmeyi tetikler.

SSS

Bu, Ollama'dan nasıl farklı?
Ollama, tarayıcının HTTP üzerinden konuştuğu, bilgisayarınızda ayrı bir yerel sunucu süreci olarak çalışır. Tarayıcı İçi modellerin ayrı bir süreci hiç yoktur — Transformers.js kullanarak doğrudan tarayıcı sekmesinin kendi JavaScript motoru ve GPU erişimi içinde çalışırlar. Tarayıcı dışında hiçbir şeyin kurulması gerekmez.
Bu, WebGPU desteği gerektirir mi?
Hayır — WebGPU, tarayıcı ve GPU destekliyorsa daha hızlı çıkarım için kullanılır. WebGPU mevcut değilse, aynı modeller CPU üzerinde WASM ile çalışmaya devam eder, sadece daha yavaş. Yalnızca WebGPU ile çalışan, farklı bir model kataloğuna sahip bir motor istiyorsanız Tarayıcı İçi Modeller (WebGPU) sayfasına bakın.
Verilerim bilgisayarımdan çıkıyor mu?
Hayır. Model ağırlıkları indirildikten sonra, üretim tamamen tarayıcı sekmesi içinde gerçekleşir — çıkarım için hiçbir ağ isteği yapılmaz.
Hangi modelle başlamalıyım?
Çoğu kullanıcı için en yaygın kullanılan ve kararlı tarayıcı içi sohbet modeli Llama-3.2-1B-Instruct'tur. Bilgisayarınız çok düşük güçlüyse bunun yerine SmolLM2-135M ile başlayın.
Bu, Yerel Dil Modelleri (Ollama) kataloğuyla aynı mı?
Hayır. Ayrı Ollama uygulamasının kurulu ve çalışır durumda olmasını gerektiren Ollama tabanlı katalog için Yerel Dil Modelleri sayfasına bakın.