TotalApp Docs

Tarayıcı İçi Modeller (WebGPU)

Doğrudan tarayıcı sekmesi içinde WebLLM kullanarak bilgisayarınızın ekran kartında (WebGPU üzerinden) çalışan modeller — sunucu yok, Ollama yok, kurulacak hiçbir şey yok. ONNX motorunun aksine CPU'ya geri dönüş yoktur: WebGPU zorunludur.

"Tarayıcı İçi (WebGPU)" Ne Anlama Gelir

Ollama tabanlı motorların aksine, In-Browser LLM (WebGPU) modelleri tarayıcı sekmenizden asla çıkmaz. Model ağırlıkları bir kez indirilir (ve tarayıcı tarafından önbelleğe alınır), ardından çıkarım (inference) tamamen istemci tarafında WebLLM (MLC) kullanılarak çalışır — Node.js sunucusu yok, yerel Ollama süreci yok, ilk indirmeden sonra hiçbir ağ isteği yok.

Bu motor, Tarayıcı İçi Modeller (ONNX) motorunun kardeşidir; o motor Transformers.js üzerinde çalışır ve WebGPU mevcut olmadığında CPU üzerinde WASM'a geri döner. WebLLM ise tam tersi bir denge kurar: gerçek WebGPU desteği gerektirir ve WASM'a geri dönüşü yoktur, karşılığında MLC'nin derlenmiş model formatını kullanarak destekli GPU'larda daha hızlı çıkarım sağlar.

Nereden yapılandırılır

Settings → Agentic → Writer Engine ekranına gidin ve In-Browser LLM (WebGPU)'yu seçin. Aşağıdaki listeden bir model seçin, İndir'e tıklayın, hazır olduğunda içerik üretimi için kullanılabilir hale gelir. Ayarların tam referansı için Agentic Ayarları sayfasına bakın.

Altyapı Teknolojisi

Bu motor, MLC-LLM'in tarayıcı portu olan WebLLM (mlc-ai/web-llm) üzerine inşa edilmiştir:

  • Modeller MLC formatında dağıtılır — MLC'nin kendi sıkıştırılmış (quantize) formatı, genellikle q4f16 — kardeş motorun kullandığı ONNX formatından farklı olarak.
  • Çalışma zamanı: özel bir TVM/WebGPU çalışma zamanı — WebGPU'yu Transformers.js'ten farklı şekilde, kendi derleme (compilation) zinciri üzerinden kullanır.

Format ve sıkıştırma farklı olduğu için, aynı temel model genellikle Tarayıcı İçi Modeller (ONNX) sayfasındaki ONNX karşılığından farklı bir indirme boyutuna sahiptir.

Mikro ve Ultra-Hafif Modeller

Hızlıca inip tarayıcı sekmesini hiç kasmadan çalışan başlangıç modelleri:

ModelBoyutEn uygun kullanım
SmolLM2-360M~230 MBEn hızlı WebGPU modeli. Kısa taslaklar.

Dengeli Tarayıcı Modelleri

Metin üretimi, özetleme ve sohbet görevlerinde hız/akıl yürütme dengesi tarayıcı için ideal olan modeller:

ModelBoyutEn uygun kullanım
Llama-3.2-1B-Instruct~880 MBMeta'nın GPU hızlandırmalı amiral gemisi mini modeli.

Gelişmiş Tarayıcı Modelleri

Tarayıcı sınırlarını zorlayan ama dil anlama, mantık kurma ve teknik işlerde en yüksek performansı veren modeller:

ModelBoyutEn uygun kullanım
Qwen2.5-1.5B-Instruct~1.1 GBEn iyi çok dilli ve muhakeme kalitesi, WebGPU hızlandırmalı.
Phi-3.5-mini-instruct~2.2 GBMicrosoft'un yüksek performanslı mini modeli.

Boyutlarla ilgili not

Gösterilen boyutlar, WebLLM üzerinden sunulan her modelin MLC sıkıştırmalı derlemesi (q4f16_1) için yaklaşık indirme boyutlarıdır — gerçek tarayıcı önbellek kullanımı tarayıcıya göre hafifçe değişebilir.

Kategoriye Göre Model Seçimi

Mikro / Düşük Kaynak

SmolLM2-360M — en hızlı indirme ve çıkarım, herhangi bir WebGPU destekli makinede en iyi ilk deneme.

Dengeli Tarayıcı Modelleri

Llama-3.2-1B-Instruct — WebGPU üzerinde günlük tarayıcı içi yazı ve sohbet için varsayılan öneri.

Gelişmiş Modeller

Qwen2.5-1.5B-Instruct, Phi-3.5-mini-instruct — daha büyük indirme ve GPU belleği kullanımı karşılığında en iyi dil anlama ve muhakeme kalitesi.

Bir Model İndirme

1. Settings → Agentic
2. Writer Engine → In-Browser LLM (WebGPU)
3. Bir model seçin
4. İndirin ve kullanın

İlk indirme tarayıcı başına bir kez gerçekleşir — sonrasında model tarayıcının kendi önbelleğinden sunulur, bu yüzden sekme değiştirmek veya sayfayı yeniden yüklemek yeniden indirme gerektirmez. Farklı bir modele geçmek yalnızca o model için yeni bir indirmeyi tetikler.

SSS

Bu, Tarayıcı İçi Modeller (ONNX)'den nasıl farklı?
Her ikisi de sunucu olmadan tamamen tarayıcı sekmesi içinde çalışır. ONNX motoru (Transformers.js) her yerde çalışır — mevcut olduğunda WebGPU'yu kullanır, aksi halde CPU üzerinde WASM'a geri döner. WebGPU motoru (WebLLM) gerçek WebGPU desteği gerektirir ve geri dönüşü yoktur, ancak MLC'nin derlenmiş model formatını kullandığı için destekli bir GPU'da genellikle daha hızlıdır. CPU dostu seçenek için Tarayıcı İçi Modeller (ONNX) sayfasına bakın.
Tarayıcım WebGPU desteklemiyorsa ne olur?
Ayarlar ekranında WebGPU'nun kullanılamadığına dair bir uyarı gösterilir ve İndir butonu devre dışı bırakılır. Bunun yerine, WASM geri dönüşü sayesinde her tarayıcıda çalışan Tarayıcı İçi Modeller (ONNX) motorunu kullanın.
Verilerim bilgisayarımdan çıkıyor mu?
Hayır. Model ağırlıkları indirildikten sonra, üretim tamamen tarayıcı sekmesi içinde gerçekleşir — çıkarım için hiçbir ağ isteği yapılmaz.
Hangi modelle başlamalıyım?
WebGPU destekli bir tarayıcısı olan çoğu kullanıcı için önerilen varsayılan Llama-3.2-1B-Instruct'tur. Mümkün olan en hızlı indirme ve yanıt süresini istiyorsanız bunun yerine SmolLM2-360M ile başlayın.
Bu, Yerel Dil Modelleri (Ollama) kataloğuyla aynı mı?
Hayır. Ayrı Ollama uygulamasının kurulu ve çalışır durumda olmasını gerektiren Ollama tabanlı katalog için Yerel Dil Modelleri sayfasına bakın.