Søgning
3 research-rapport(er) for »quant«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… TokenMix bekræfter dette som "80GB VRAM Floor" og skriver: "OpenAI's MXFP4 quantization was designed specifically so GPT-OSS-120B fits on a single …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… The Measured Numbers](https://kie.ai/blog/qwen-3-6-27b-deep-dive-benchmarks-quantization) 8. [Qwen3.6-27B: 27B Model Beats 397B on …
Qwen 3.8 27b
… Qwen3.6-27B Quantization Benchmark](https://www.reddit.com/r/LocalLLaMA/comments/1tr9vzn/qwen3627b_quantization_benchmark/)
47 briefing-resultat(er) for »quant«
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen
En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …
Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4
En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.
Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM
Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …
Quant-variation på 150% — community forvirret
Bruger på r/LocalLLaMA påpeger kæmpe forskel i størrelser for Q4KM-kvanter. Kalder det "æbler, appelsiner og mangoer".
Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter
Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.
Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1
Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …
Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?
RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.
Nemotron-3.5-Lightning kører 262K kontekst på 16 GB – med en kvantiserings-fix
En Reddit-bruger fandt en kvantiseringsfejl, der gjorde alle lave GGUF'er af Nemotron-3.5 ubrugelige, og løste den med ShimQuant. Resultatet: 11 …
Opfølgning: Qwen 3.8 Next UD IQ1_S – seks gange langsommere end Q4
En bruger spørger, om Qwen 3.8 Next UD IQ1_S overhovedet giver mening frem for Qwen 3.8 27B UD Q4: IQ1_S …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
AtomicChats GGUF-kvant af Qwen3.8 Flash Next imponerer
En bruger på M4 Max 128GB rapporterer, at AtomicChats kvant af Flash Next bruger pageable PLE-tabel via mmap, hvilket reducerer RAM-forbrug fra …
Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw
Nye GSQ-RCO-kvanter slår alle eksisterende kvanters nøjagtighed ved samme filstørrelse. 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på …
Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang
En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …
Opfølgning: Over 200.000 tokens kontekst på 16 GB VRAM med Qwen 3.8 27B
En bruger kører Qwen 3.8 27B med IQ3_XXS-kvantisering og 200k+ kontekst på 16 GB VRAM. Prompt processing falder til 400 tk …
Opfølgning: Demo af Qwen 27B i 3D Zen Room med kvantiseret model
En bruger demonstrerer Qwen 27B kørende i en 3D Zen Room-demo via en pi-harness. Dette viser potentialet for letvægtslokale modeller, som diskuteret …
Fuld NVFP4-kvantisering af Qwen3.8-27B med QUASAR bevarer næsten BF16-kvalitet
QUASAR QAD træner modellen til W4A4 og opnår 19,7 GB checkpoint-størrelse med kun 0,5% tab på GPQA-Diamond sammenlignet med BF16.
Qwen3.8-27B Q4 mestrer ThreeJS – genererer kode på 3090
Bruger viser, at den kvantiserede 27B-model producerer korrekt ThreeJS-kode med "thinking high" aktiveret.
Kvantiseret Qwen3.8-27B skriver korrekt fysik-simulering på 16 GB GPU
27B-model i IQ3_XXS (10,93 GB) implementerer coherent transfer-matrix-metoden korrekt efter 100 minutter og 108K output-tokens på en Quadro …
Opfølgning: Apple Neural Engine – hvad kører egentlig?
Målinger viser, at placering på ANE afhænger af *hvordan* en beregning udtrykkes, ikke *hvad* den beregner – fp16-modeller kan blive CPU-låst.
Opfølgning: $100 benchmark af Qwen3.8-27B quants
En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.
Opfølgning: Qwen 3.8 27B i ekstreme quants – hvor lavt kan man gå?
En bruger på r/LocalLLaMA deler erfaringer med Qwen 3.8 27B i Unsloth Q3 XXS på en Mac mini M4 med 24 GB …
ConvRot-kvantisering nu i llama-cpp-turboquant
… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.
Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000
Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …
Opfølgning: Q8-kvant Qwen 3.8 27B slår BF16 Qwen 3.6 i kodning
Grundig benchmark viser, at Q8 Qwen 3.8 27B overgår BF16 Qwen 3.6 på instruktionsfølgning og 280k kontekst – men har initiale udfordringer med …
Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM
Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en …
Qwen3.8 27B i 3bit på MacBook Air: 63 timer – men flysimulatoren virkede
En bruger fik agentisk kode til at producere en flysimulator på en M2 med 24 GB. Google AI Studio klarede det på 20 minutter …
Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B
Dynamic v3 giver 10 % højere nøjagtighed for samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM …
Status på 1-bit og ternære modeller: Bonsai, Hy-MT1.5, Maple-Preview og flere
En omfattende opdatering dækker nye PRs for CUDA/Vulkan og optimeringer, der giver 15-40% hastighedsforøgelse.
Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"
En tråd påpeger at Qwen 3.8s imponerende benchmarks gælder uquantiserede modeller, mens næsten alle kører en eller anden quant. Kl-divergens er en …
Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart
Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …
Opfølgning: Tensor-kvantisering bevarer 96,7 % af Gemma 4 E4B's ræsonnement ved IQ2_XXS
Med IQ2_XXS og tensor-allokeret præcision steg reasoning fra 28,9 til 69,5 under samme 3,3 GB-budget – uden post-træning …
Hvad AI's historie kan lære os om kvantecomputingens fremtid
En analyse på SD Times trækker paralleller mellem AI-udviklingen og kvantecomputing, herunder Karpathys "vibe coding"-begreb. Samtidig diskuteres, hvordan universiteter bør håndtere AI …
Fællesskabet udgiver optimerede Muse Glimmer 30B-quants – SoTA i hukommelsesklassen
En studerende researcher udgav nye GGUF-quants af Muse Glimmer 30B med avancerede tensor-mapping-teknikker og påstår, at Q8-quanten er 21 % tættere …
Opfølgning: KLQ – træningsfri rotationskvantisering slår SpinQuant
En solo-sommerforskningspræsentation viser, at KLQ måler ulighed i embeddingsrummet og kvantiserer mere effektivt end eksisterende rotationsmetoder. Metoden kræver ingen gradientnedstigning. [briefingen 7. august …
Kimi K3 trimmet til 478 GB ved at fjerne flersproget "fedt"
En bruger fjernede kun de flersprogede komponenter i Kimi K3 og skar modellen fra 711 GB til 478 GB uden at miste intelligens – en …
Sammenligning af 4-bit kvanttyper på MLX i gang
Brugeren efterlyser erfaringer med OptiQ, Unsloth Dynamic 2.0, oQ og DWQ til Qwen3.6 og Gemma4 på MLX – hvilken kvant bevarer bedst kvalitet?
Benchmarks til DeepSeek Flash 0731 kvant-test efterspurgt
En bruger med flere kvants af DeepSeek Flash 0731 leder efter offentlige benchmarks, der kan måle kvant-effekter med omkring 1 million tokens.
Opfølgning: Gemma 4 QAT er ikke entydigt bedre end Q4_K_L
Omfattende benchmarks viser, at Googles QAT-kvantisering sparer hukommelse, men taber i præcision på visse opgaver. Brugeren foreslår, at Google justerer modellen til q4 …
Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark
En reddit-bruger kører en 2-bit kvantiseret DeepSeek V4 Flash på to RTX 3080 og får perfekt score i et SQL-test. Kun …
Opfølgning: Kimi K3 kvantiseret til GGUF – 1,1 TB på disk, kører på CPU
Fællesskabet har lavet Q3_K_S-kvant af Kimi K3 (2,8T parametre) og kører det på CPU med 4,21 t/s. Q1 …
Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl
Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …
Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6
På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …
Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp
En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …
Forskning: Negativ-bit-kvantisering bryder den fysiske grænse for komprimering
Ved at udnytte fase-inverteret tensor-embedding hævdes det at opnå stabil inferens med negative bit-konfigurationer. Artiklen er satire, men illustrerer grænsen for …
Bonsai 27B kører lokalt på iPhone i kun 3,9GB
PrismML har bygget Bonsai ved at kvantisere Qwen3.6-27B ned til 1-bit, hvilket reducerer størrelsen fra ~54GB til 3,9GB. Modellen bevarer …