News-Tracker

Søgning

AI & LLM · daglig briefing


1 briefing-resultat(er) for »hot-experts«

50% hastighedsboost ved at offloade "hot" experts til VRAM

En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp