News-Tracker

Søgning

AI & LLM · daglig briefing


2 briefing-resultat(er) for »expert-offloading«

Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s

Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …

onsdag 2. september 2026 · Værktøjer & produkter qwen3.8-flash-nextslotstreammlxexpert-offloading

50% hastighedsboost ved at offloade "hot" experts til VRAM

En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp