Running LLMs on Apple Silicon: Best Settings and Real Speeds (2026)

Local LLM2026-08-16·Topluluk talebinden derlenen içerik

Kısa cevap

Apple Silicon'da LLM hızını belirleyen tek şey bellek bant genişliğidir. O yüzden çip "gücü" değil, RAM miktarı ve bant genişliği önemlidir. 2026 itibarıyla toplulukta doğrulanmış gerçekçi rakamlar aşağıda.

Gerçek hız tablosu (topluluk ölçümleri, Ağustos 2026)

CihazBellekModel (quant)Üretim hızıNot
Mac Mini M4 Pro64GB27B Q4_K_M~15-25 tok/sEn iyi watt/token; sessiz
Mac Studio M4 Max128GB70B Q4_K_M~8-14 tok/s70B'yi tam bellekte tutar
Mac Studio M3 Ultra192GB120B+ Q4~5-8 tok/sBüyük modeller için tek makul seçenek
MacBook Pro M4 Pro48GB27B Q4~12-20 tok/sTaşınabilir; 48GB'ta 27B rahat

Hızı artıran 5 ayar (llama.cpp)

  1. KV cache quant: --cache-type-k q8_0 --cache-type-v q8_0 — hız kaybı neredeyse yok, bellek yarıya iner.
  2. MTP draft (--spec-type draft-mtp): toplulukta %45-73 kabul oranı ölçüldü; üretim hızını gözle görülür artırır.
  3. Doğru quant: 27B için Q4_K_M; 70B için Q4_K_M veya IQ4_XS; bellek varsa Q5_K_M kaliteyi belirgin iyileştirir.
  4. Metal optimizasyonu: -ngl 999 ile her şeyi GPU'ya al; --flash-attn büyük bağlamlarda şart.
  5. Bağlam disiplini: 32K bağlam 8K'nın ~4 katı işlem demektir; gereksiz bağlam = boşa harcanan bant genişliği.

MLX mi llama.cpp mi?

Hangi Mac'i almalı?

Bütçe daha mı kısıtlı? Mac dışı yollar için Qwen 27B'yi ucuza çalıştırma rehberimize bakın — kullanılmış RTX 3090 ve Ryzen AI Max mini PC'ler çoğu senaryoda daha hızlıdır.