Søgning
25 briefing-resultat(er) for »qwen3.8-flash-next«
Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air
Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
… Forks som halogen-flash-server og strix-llama.cpp når 75-90 % af teorien.
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4
En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.
Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning
Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …
Opfølgning: Qwen3.8 Flash Next-skabeloner testet på SWE-bench
Stock når 99 % på xhigh, Sharp er stabil på 94 % på begge efforts, Fixed følger tæt. Skabelonen ændrer både hastighed og tokenforbrug markant. [Briefingen …
Qwen 3.8 Flash Next Max: stærk til samtale
Brugere oplever, at modellen kender overraskende detaljer om lokale forhold og kaster sig helhjertet over problemer – uden de sædvanlige hallucinationer.
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
Qwen3.8 Flash Next ser "korruption" overalt
Brugere rapporterer at modellen fejlagtigt ser ødelagt tekst i konteksten og scanner git.
Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s
Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …
Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s
En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s
En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …
To kinesiske AI-labs lander uafhængigt på samme arkitektur
Z.ai (GLM-5.3-Flash) og Qwen (Qwen3.8-Flash-Next) har begge sendt næsten identiske modeller: 3:1 lineære hybrider, komprimerede indexere …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
50% hastighedsboost ved at offloade "hot" experts til VRAM
… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.
N-gram-tabel på SSD streamet i SGLang – uden performance-tab?
En bruger spørger, om nogen har testet at offloade Qwen 3.8 Flash Nexts n-gram-opslagstabel til SSD og streame den i SGLang …
AtomicChats GGUF-kvant af Qwen3.8 Flash Next imponerer
En bruger på M4 Max 128GB rapporterer, at AtomicChats kvant af Flash Next bruger pageable PLE-tabel via mmap, hvilket reducerer RAM-forbrug fra …
Opfølgning: Er Qwen3.8 Flash Next værd at køre på 4x3090?
Bruger frustreret over 27B-modellens ubeslutsomhed overvejer Flash Next på 4x3090 med n-gram på SSD. Spørger om arkitekturen er klar nok til local …
Opfølgning: 181 tok/s på Qwen3.8 Flash Next på 2× DGX Spark
En bruger opnår 181 tokens/s aggregeret på tværs af 9 samtidige agentsessioner på to forbundne DGX Spark. Hemmeligheden: PLE-tabel mmap’et fra …
Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged
GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …
Opfølgning: Alibaba udgiver Qwen3.8-Flash-Next som forhåndsvisning af Qwen4-arkitekturen
… Modellen bygger videre på Qwen3.8-familien, som blev dækket i [briefingen 14. august](/archive/2026-08-14).
Qwen3.8-Flash-Next: 125B MoE med n-gram-tabel kan blive local-friendly
Arkitekturen har ~6B aktive parametre og en sparsom n-gram-tabel på 51B, hvilket gør 4-bit kvantisering på ~82 GB mulig – ideel til …
M5 Ultra 96GB vs M5 Max 128GB: Hvad er bedst til Qwen3.8-Flash-Next?
Debat om dobbelt båndbredde (Ultra) vs. 32 GB mere RAM (Max) til den kommende 125B MoE-model. Napkin-math peger på Ultra til 4 …