Søgning
5 research-rapport(er) for »moe«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Ifølge OpenAIs officielle modelkort på HuggingFace [1] er det en MoE-model med 117B parametre totalt og 5,1B aktive parametre per token. Modellen …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Den tætte arkitektur betyder, at alle 27 milliarder parametre er aktive per token, i modsætning til MoE-modeller der kun aktiverer en delmængde — dette …
Qwen 3.8 27b
… På benchmarks opnår Qwen3.6-27B 77,2% på SWE-bench Verified, hvilket slår den tidligere flagskibsmodel Qwen3.5-397B-A17B MoE's 76 …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Accuracy–Efficiency Tradeoffs in Dense and MoE Reasoning Language Models](https://arxiv.org/html/2604.07035v1) 2. [PerfCodeBench: Benchmarking LLMs for System-Level High …
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Huaweis Noah’s Ark Lab afviste en anklage om, at deres Pangu Pro MoE‑model skulle have kopieret Alibabas Qwen 2.5 14B [10 …
50 briefing-resultat(er) for »moe«
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM
Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …
Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B
Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …
Expert expansion med llama.cpp – ny branch til MoE-modeller
En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.
Ant Group åbner Ling-3.0-flash-Fin – finansmodel med 124B parametre
Ant Group frigiver sin første finansforstærkede Ling-model: 5,1B aktiverede parametre, 256K kontekst og træning på højkvalitets finansdata til langtidsholdbare agent-workflows. Vægtene …
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
Upcycling af Gemma4-12B til MoE – bruger kræver officiel 124B-model
En hobbyist har med succes upcyclet Googles Gemma4-12B til en MoE-model ved at tilføje 4 eksperter, og opfordrer Google til at udgive …
To kinesiske AI-labs lander uafhængigt på samme arkitektur
… Konvergensen antyder, at feltet finder et fælles optimalt design for effektive MoE-modeller.
50 PRs fra hurtigere CPU-inference i llama.cpp
… AVX-512, MoE expert-caching, streamede vægte og tiled mul_mat. Community håber på markante hastighedsforbedringer inden årets udgang.
50% hastighedsboost ved at offloade "hot" experts til VRAM
En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …
Opfølgning: Alibaba udgiver Qwen3.8-Flash-Next som forhåndsvisning af Qwen4-arkitekturen
Den nye 125B MoE-model med 6B aktive parametre er multimodal og giver et tidligt indblik i Qwen4. Modellen bygger videre på Qwen3.8 …
N-gram vs. MoE: Qwen4-arkitekturen skifter fokus fra regning til genkald
… for korte fraser og aktiveres via token-hash, hvilket reducerer beregningsbyrden. MoE'er står for ræsonnement, mens n-gram håndterer genkald, hvilket muliggør 125B …
Qwen3.8-Flash-Next: 125B MoE med n-gram-tabel kan blive local-friendly
Arkitekturen har ~6B aktive parametre og en sparsom n-gram-tabel på 51B, hvilket gør 4-bit kvantisering på ~82 GB mulig – ideel til …
M5 Ultra 96GB vs M5 Max 128GB: Hvad er bedst til Qwen3.8-Flash-Next?
… 32 GB mere RAM (Max) til den kommende 125B MoE-model. Napkin-math peger på Ultra til 4-bit kvantisering.
FreeToken: Kør frontlinje-MoE på din gaming-PC
FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …
Opfølgning: Ornith 1.5 slår Qwen 3.8 og Muse Glimmer i benchmark
En community-sammenligning viser, at Ornith-1.5-35B-A3B klarer sig bedst blandt flere MoE-modeller – TielCoder kan være endnu stærkere på kodning.
MobileMoE: Metas nye on-device MoE-model
Meta udgiver MobileMoE med 0,3B-0,9B aktive parametre, <3 GB INT4-vægt og tre varianter – designet til at køre på mobil hardware.
ConvRot-kvantisering nu i llama-cpp-turboquant
… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.
MTP nu understøttet i GLM-4.5-Air via llama.cpp
Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …
dots3-note preview: første open-weight model i familien – 280B parametre
En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.
Opfølgning: Ornith-1.5-familien slår Claude Opus 4.8 på flere benchmarks
Ornith-1.5 fås i 9B, 35B MoE og 397B MoE og opnår state-of-the-art blandt open-source modeller. Modellerne er selvforbedrende …
AntLing open-sourcer base-modeller for Ling-3.0-tiny og flash
Seks checkpoint uden post-training giver forskere fleksible udgangspunkter. Ling-3.0-tiny (7.9B) matcher større modeller på kode, og flash (124B) klarer …
Opfølgning: Fællesskabet venter på Qwen 3.8 35B A3B – og flere størrelser
Reddit-brugere venter utålmodigt på Qwen 3.8 i flere størrelser, især 35B A3B (MoE). Debatter om hvordan fællesskabet kan give Alibaba incitament til …
ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M
… Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE-modeller klarer sig bedre på Vulkan.
Opfølgning: Qwen 3.8 9B på vej – mindre søskende til den store MoE
Efter Qwen 3.8-2.4T og 27B spekulerer miljøet nu i en 9B-variant. En mindre model ville gøre Qwen 3.8-familien …
Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart
Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …
Qwen 3.8 2.4T kører 288.000 tokens/sekund på Nvidia GB300 NVL72
Den enorme MoE-model opnår over 4.000 tokens/sekund per GPU i FP8-præcision på Nvidias 72-GPU-superchip. Det svarer til 350 …
Opfølgning: Qwen 3.8-27B frigivet – open-weight MoE til lokal kørsel
Alibaba udgav Qwen 3.8-27B med åbne vægte under Apache 2.0. Fællesskabet rapporterer om markante forbedringer i kodning og agentiske evner. [briefingen …
Qwen 30B MoE kører med 30 tps på en RTX 3050 med 6 GB VRAM
En bruger i LocalLLaMA deler, at Qwen 30B MoE opnår 30-35 tokens/sek på en gammel RTX 3050 med 90k kontekst. Bevis på …
Opfølgning: Nvidia lancerer Nemotron 3.5 Lightning og varsler trillion-parameter Nemotron 4
Nvidia har udgivet Nemotron 3.5 Lightning, en 30B open-weight MoE-model til agentiske opgaver, og bekræfter planer om Nemotron 4 med op …
Opfølgning: Qwen 3.8-2.4T-A95B udgivet – 2,4 trillion parameter MoE-model
Alibaba har stille frigivet Qwen3.8-2.4T-A95B på Hugging Face, en massiv MoE-model med 95B aktive parametre. Udgivelsen bekræfter Qwen-familiens …
Kimi K3 trimmet til 478 GB ved at fjerne flersproget "fedt"
… komponenter i Kimi K3 og skar modellen fra 711 GB til 478 GB uden at miste intelligens – en nyttig tilgang til store MoE-modeller.
Intel Optane som tredje lagerlag til MoE-modeller diskuteres
En bruger spekulerer i, om udgået Intel Optane-teknologi kan bruges som en tredje hukommelseslag til nestede MoE-modeller mellem RAM og NVMe.
Er Microsoft Phi død? Fællesskabet spekulerer
… Flere håber på en Phi 5 som lille MoE-model – men der er ingen tegn fra Microsoft.
Opfølgning: DeepSeek V4 Flash kører 10-17 t/s på MacBook M5 Pro med SSD-streaming
… 64 GB MacBook via DS4-engineens SSD-streaming, med imponerende hastighed. MoE-modeller bliver stadig mere tilgængelige på almindelig hardware ([briefingen 1. august](/archive …
Opfølgning: Inkling-Small 276B MoE kører med under 10 GB hukommelse
… Store MoE-modeller bliver stadig lettere at køre lokalt ([briefingen 24. juli](/archive/2026-07-24)).
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
… En anden PR cacher "hot" MoE-eksperter på GPU, hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit …
Qwen 3.8-Max lanceret – Alibaba sætter ny standard med 2,4 billioner parametre
Alibaba har udgivet Qwen 3.8-Max, en open-weight MoE-model med 2,4 billioner parametre, der matcher Kimi K3 og DeepSeek V4 …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …
Opfølgning: Qwen 3.8-Max og 27B-model lanceres – open weights på vej
Alibabas 2,4 billioner-parameter MoE-model er live. En 27B-version kommer næste uge. Vægtene bliver åbne. [Se tidligere briefingen 20. juli](/archive …
Opfølgning: DeepSeek V4 Flash kører på RTX 3090 med 12,5 tok/s via CPU-spild
En bruger fik DeepSeek-V4-Flash-0731 til at køre på et enkelt 24 GB-kort ved at lægge MoE-eksperter i system-RAM …
AMD udgiver Instella-MoE-16B-A3B – fuldt åben MoE-model trænet på Instinct
AMD's nye model har 16B parametre, men aktiverer kun 2,8B per token, og alle vægte, data og kode er offentliggjort. Det er …
DeepSeek V4 Flash opdateret – og communityet hungrer efter 70-80B MoE-modeller
DeepSeek har opdateret V4 Flash med store agentiske forbedringer, samtidig med at communityet efterlyser nye 70-80B MoE-modeller til lokal kørsel.
MoE forbedrer rekonstruktion af håndskrift fra IMU-sensorer i digital pen
Forskere bruger Mixture-of-Experts til at rekonstruere håndskriftbaner fra en digital pen, med separate eksperter for berøring og svævning.
Opfølgning: Kimi K3-vægte ude – 2,8 billioner parametre i MXFP4
Vægtene er nu på Hugging Face som lovet. Moonshot planlægger hosting på A100, H200 og B300, men A100 kræver tre noder og mangler FP4 …
Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl
Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …
Opfølgning: Qwen 3.6 35B MoE kører på en Xiaomi 12 Pro med kun 12 GB RAM
En modificeret Xiaomi-telefon kører en 35B MoE-model lokalt med 2,4 tok/s. Konteksten er begrænset til 8k tokens, men det viser …
Poolside udgiver Laguna S 2.1 – en open-weight kodningsmodel med imponerende ydeevne
Poolside lancerer Laguna S 2.1, en 118B MoE-model med kun 8B aktive parametre. Den matcher langt større modeller på SWE-Bench og …
Opfølgning: Alibaba svarer igen med Qwen3.8-Max på 2,4 billioner parametre
Dage efter Kimi K3 præsenterer Alibaba Qwen3.8-Max-Preview, en åben MoE-model på 2,4T parametre. Prisen er 10% af normalen, men …
Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU
En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).