Tarayıcı İçi Modeller (WebGPU)
Doğrudan tarayıcı sekmesi içinde WebLLM kullanarak bilgisayarınızın ekran kartında (WebGPU üzerinden) çalışan modeller — sunucu yok, Ollama yok, kurulacak hiçbir şey yok. ONNX motorunun aksine CPU'ya geri dönüş yoktur: WebGPU zorunludur.
"Tarayıcı İçi (WebGPU)" Ne Anlama Gelir
Ollama tabanlı motorların aksine, In-Browser LLM (WebGPU) modelleri tarayıcı sekmenizden asla çıkmaz. Model ağırlıkları bir kez indirilir (ve tarayıcı tarafından önbelleğe alınır), ardından çıkarım (inference) tamamen istemci tarafında WebLLM (MLC) kullanılarak çalışır — Node.js sunucusu yok, yerel Ollama süreci yok, ilk indirmeden sonra hiçbir ağ isteği yok.
Bu motor, Tarayıcı İçi Modeller (ONNX) motorunun kardeşidir; o motor Transformers.js üzerinde çalışır ve WebGPU mevcut olmadığında CPU üzerinde WASM'a geri döner. WebLLM ise tam tersi bir denge kurar: gerçek WebGPU desteği gerektirir ve WASM'a geri dönüşü yoktur, karşılığında MLC'nin derlenmiş model formatını kullanarak destekli GPU'larda daha hızlı çıkarım sağlar.
Nereden yapılandırılır
Settings → Agentic → Writer Engine ekranına gidin ve In-Browser LLM (WebGPU)'yu seçin. Aşağıdaki listeden bir model seçin, İndir'e tıklayın, hazır olduğunda içerik üretimi için kullanılabilir hale gelir. Ayarların tam referansı için Agentic Ayarları sayfasına bakın.
Altyapı Teknolojisi
Bu motor, MLC-LLM'in tarayıcı portu olan WebLLM (mlc-ai/web-llm) üzerine inşa edilmiştir:
- Modeller MLC formatında dağıtılır — MLC'nin kendi sıkıştırılmış (quantize) formatı, genellikle
q4f16— kardeş motorun kullandığı ONNX formatından farklı olarak. - Çalışma zamanı: özel bir TVM/WebGPU çalışma zamanı — WebGPU'yu Transformers.js'ten farklı şekilde, kendi derleme (compilation) zinciri üzerinden kullanır.
Format ve sıkıştırma farklı olduğu için, aynı temel model genellikle Tarayıcı İçi Modeller (ONNX) sayfasındaki ONNX karşılığından farklı bir indirme boyutuna sahiptir.
Mikro ve Ultra-Hafif Modeller
Hızlıca inip tarayıcı sekmesini hiç kasmadan çalışan başlangıç modelleri:
| Model | Boyut | En uygun kullanım |
|---|---|---|
SmolLM2-360M | ~230 MB | En hızlı WebGPU modeli. Kısa taslaklar. |
Dengeli Tarayıcı Modelleri
Metin üretimi, özetleme ve sohbet görevlerinde hız/akıl yürütme dengesi tarayıcı için ideal olan modeller:
| Model | Boyut | En uygun kullanım |
|---|---|---|
Llama-3.2-1B-Instruct | ~880 MB | Meta'nın GPU hızlandırmalı amiral gemisi mini modeli. |
Gelişmiş Tarayıcı Modelleri
Tarayıcı sınırlarını zorlayan ama dil anlama, mantık kurma ve teknik işlerde en yüksek performansı veren modeller:
| Model | Boyut | En uygun kullanım |
|---|---|---|
Qwen2.5-1.5B-Instruct | ~1.1 GB | En iyi çok dilli ve muhakeme kalitesi, WebGPU hızlandırmalı. |
Phi-3.5-mini-instruct | ~2.2 GB | Microsoft'un yüksek performanslı mini modeli. |
Boyutlarla ilgili not
Gösterilen boyutlar, WebLLM üzerinden sunulan her modelin MLC sıkıştırmalı derlemesi (q4f16_1) için yaklaşık indirme boyutlarıdır — gerçek tarayıcı önbellek kullanımı tarayıcıya göre hafifçe değişebilir.
Kategoriye Göre Model Seçimi
Mikro / Düşük Kaynak
SmolLM2-360M — en hızlı indirme ve çıkarım, herhangi bir WebGPU destekli makinede en iyi ilk deneme.
Dengeli Tarayıcı Modelleri
Llama-3.2-1B-Instruct — WebGPU üzerinde günlük tarayıcı içi yazı ve sohbet için varsayılan öneri.
Gelişmiş Modeller
Qwen2.5-1.5B-Instruct, Phi-3.5-mini-instruct — daha büyük indirme ve GPU belleği kullanımı karşılığında en iyi dil anlama ve muhakeme kalitesi.
Bir Model İndirme
İlk indirme tarayıcı başına bir kez gerçekleşir — sonrasında model tarayıcının kendi önbelleğinden sunulur, bu yüzden sekme değiştirmek veya sayfayı yeniden yüklemek yeniden indirme gerektirmez. Farklı bir modele geçmek yalnızca o model için yeni bir indirmeyi tetikler.
SSS
Llama-3.2-1B-Instruct'tur. Mümkün olan en hızlı indirme ve yanıt süresini istiyorsanız bunun yerine SmolLM2-360M ile başlayın.