Søgning
9 briefing-resultat(er) for »mlx«
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
… GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s
Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …
Apple Silicon-inference: "Softwarestakken er et rod"
… vLLM-metal er tættest, mens mlx-lm dropper MTP-heads ved konvertering af Qwen-modeller.
Qwen 3.8-27B op til 3× hurtigere på Apple Silicon med mlx-dspark
Et nyt værktøj udnytter spekulativ dekodning til at accelerere modellen markant på M4 Pro. 8-bit kvalitet opnås med hastighed over 20 tok/s.
Sammenligning af 4-bit kvanttyper på MLX i gang
Brugeren efterlyser erfaringer med OptiQ, Unsloth Dynamic 2.0, oQ og DWQ til Qwen3.6 og Gemma4 på MLX – hvilken kvant bevarer bedst kvalitet?
Nvidias Nemotron Omni kører nu i ren MLX på Mac
En udvikler har porteret vision- og lydtårnene til MLX, så den åbne multimodale model kører lokalt med op til 152 tokens/s på M5 …
Opfølgning: LFM2.5-2.6B klarer 220 tok/s og 128K kontekst på enheden
… parametre, værktøjsbrug og vægte i GGUF, MLX og ONNX – også på Raspberry Pi. [Se briefingen 5. august](/archive/2026-08-05).
Logue: Open-source macOS-app til mødenoter KØRER 100% lokalt
Bitwize har open-sourcet Logue (MIT) – en privatlivsvenlig app til transskription og skrivning på Apple Silicon. Ingen data forlader din maskine som standard.