News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »quantization«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… TokenMix bekræfter dette som "80GB VRAM Floor" og skriver: "OpenAI's MXFP4 quantization was designed specifically so GPT-OSS-120B fits on a single …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… The Measured Numbers](https://kie.ai/blog/qwen-3-6-27b-deep-dive-benchmarks-quantization) 8. [Qwen3.6-27B: 27B Model Beats 397B on …

fredag 7. august 2026 · research

Qwen 3.8 27b

… Qwen3.6-27B Quantization Benchmark](https://www.reddit.com/r/LocalLLaMA/comments/1tr9vzn/qwen3627b_quantization_benchmark/)

mandag 3. august 2026 · research

38 briefing-resultat(er) for »quantization«

Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund

En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmrtx-3060quantization

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen

En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …

tirsdag 8. september 2026 · Forskning & arkitektur task-aware-quantizationqwen-3.8quantizationreasoning

Bruger beder om benchmark: Qwen3.8-27B Q8 vs Flash Q4

En bruger vil have svar på, om Qwen3.8-Next-Flash er det ekstra kvantiseringsformat værd. Indtil videre ingen definitive tal.

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.8unslothquantizationbenchmark

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Quant-variation på 150% — community forvirret

Bruger på r/LocalLLaMA påpeger kæmpe forskel i størrelser for Q4KM-kvanter. Kalder det "æbler, appelsiner og mangoer".

torsdag 3. september 2026 · Værktøjer & produkter llama.cppquantizationcommunity

Opfølgning: Kaitchup benchmarker Qwen3.8 27B-kvanter fra Q4 til Q1

Resultater viser, at UD Q3_K_XL med 12,8GB giver 100% nøjagtighed og er ideel til 16GB-kort. [Se tidligere briefingen](/archive/2026 …

onsdag 2. september 2026 · Forskning & arkitektur qwen3.8-27bkaitchupquantizationbenchmark

Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?

RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.

onsdag 2. september 2026 · Forskning & arkitektur rtx-3090int8w8a8quantization

Nemotron-3.5-Lightning kører 262K kontekst på 16 GB – med en kvantiserings-fix

En Reddit-bruger fandt en kvantiseringsfejl, der gjorde alle lave GGUF'er af Nemotron-3.5 ubrugelige, og løste den med ShimQuant. Resultatet: 11 …

søndag 30. august 2026 · Nye modeller nemotron-3.5ggufquantizationshimquant

Opfølgning: Qwen 3.8 Next UD IQ1_S – seks gange langsommere end Q4

En bruger spørger, om Qwen 3.8 Next UD IQ1_S overhovedet giver mening frem for Qwen 3.8 27B UD Q4: IQ1_S …

søndag 30. august 2026 · Nye modeller qwen-3.8quantizationiq1-slocal-llm

Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4

En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …

søndag 30. august 2026 · Nye modeller qwen-3.8ggufquantizationlocal-llm

Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw

Nye GSQ-RCO-kvanter slår alle eksisterende kvanters nøjagtighed ved samme filstørrelse. 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på …

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-27bgsq-rcoquantization

Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang

En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …

fredag 28. august 2026 · Værktøjer & produkter qwen-3.8quantizationqatgguf

Opfølgning: Over 200.000 tokens kontekst på 16 GB VRAM med Qwen 3.8 27B

En bruger kører Qwen 3.8 27B med IQ3_XXS-kvantisering og 200k+ kontekst på 16 GB VRAM. Prompt processing falder til 400 tk …

fredag 28. august 2026 · Værktøjer & produkter qwen-3.8long-contextquantizationvram

Opfølgning: Demo af Qwen 27B i 3D Zen Room med kvantiseret model

En bruger demonstrerer Qwen 27B kørende i en 3D Zen Room-demo via en pi-harness. Dette viser potentialet for letvægtslokale modeller, som diskuteret …

torsdag 27. august 2026 · Værktøjer & produkter qwen3d-demolocal-llmquantization

Fuld NVFP4-kvantisering af Qwen3.8-27B med QUASAR bevarer næsten BF16-kvalitet

QUASAR QAD træner modellen til W4A4 og opnår 19,7 GB checkpoint-størrelse med kun 0,5% tab på GPQA-Diamond sammenlignet med BF16.

onsdag 26. august 2026 · Nye modeller qwen3.8-27bmxfp4quasarquantization

Opfølgning: Apple Neural Engine – hvad kører egentlig?

Målinger viser, at placering på ANE afhænger af *hvordan* en beregning udtrykkes, ikke *hvad* den beregner – fp16-modeller kan blive CPU-låst.

tirsdag 25. august 2026 · Forskning & arkitektur apple-neural-enginelocal-deploymentquantizationcoreml

Opfølgning: $100 benchmark af Qwen3.8-27B quants

En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.

tirsdag 25. august 2026 · Forskning & arkitektur qwenquantizationbenchmarkkv-cache

Opfølgning: Qwen 3.8 27B i ekstreme quants – hvor lavt kan man gå?

En bruger på r/LocalLLaMA deler erfaringer med Qwen 3.8 27B i Unsloth Q3 XXS på en Mac mini M4 med 24 GB …

mandag 24. august 2026 · Nye modeller qwen3.8-27bquantizationlocal-llmunsloth

ConvRot-kvantisering nu i llama-cpp-turboquant

Den nye ConvRot-kvantiseringsmetode, der giver Q6-kvalitet tæt på Q8's KLD/PPL, er implementeret i llama-cpp-turboquant. Metoden lover at genvinde …

mandag 24. august 2026 · Forskning & arkitektur convrotquantizationllama.cppturboquant

Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000

Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …

mandag 24. august 2026 · Forskning & arkitektur qwen3.8-27bquantizationatomic-dynamicbenchmark

Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B

Dynamic v3 giver 10 % højere nøjagtighed for samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM …

torsdag 20. august 2026 · Nye modeller qwen-3.8unslothggufquantization

Status på 1-bit og ternære modeller: Bonsai, Hy-MT1.5, Maple-Preview og flere

En omfattende opdatering dækker nye PRs for CUDA/Vulkan og optimeringer, der giver 15-40% hastighedsforøgelse.

onsdag 19. august 2026 · Forskning & arkitektur bitnetternarybonsaiquantization

Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"

En tråd påpeger at Qwen 3.8s imponerende benchmarks gælder uquantiserede modeller, mens næsten alle kører en eller anden quant. Kl-divergens er en …

tirsdag 18. august 2026 · Forskning & arkitektur benchmarkquantizationqwen-3.8local-llm

Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart

Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …

mandag 17. august 2026 · Nye modeller qwen-3.827bquantization12gb-vram

Opfølgning: Tensor-kvantisering bevarer 96,7 % af Gemma 4 E4B's ræsonnement ved IQ2_XXS

Med IQ2_XXS og tensor-allokeret præcision steg reasoning fra 28,9 til 69,5 under samme 3,3 GB-budget – uden post-træning …

søndag 16. august 2026 · Forskning & arkitektur gemma-4quantizationiq2-xxsreasoning

Fællesskabet udgiver optimerede Muse Glimmer 30B-quants – SoTA i hukommelsesklassen

En studerende researcher udgav nye GGUF-quants af Muse Glimmer 30B med avancerede tensor-mapping-teknikker og påstår, at Q8-quanten er 21 % tættere …

onsdag 12. august 2026 · Nye modeller muse-glimmerggufquantizationcommunity

Opfølgning: KLQ – træningsfri rotationskvantisering slår SpinQuant

En solo-sommerforskningspræsentation viser, at KLQ måler ulighed i embeddingsrummet og kvantiserer mere effektivt end eksisterende rotationsmetoder. Metoden kræver ingen gradientnedstigning. [briefingen 7. august …

mandag 10. august 2026 · Forskning & arkitektur klqquantizationrotationtraining-free

Kimi K3 trimmet til 478 GB ved at fjerne flersproget "fedt"

En bruger fjernede kun de flersprogede komponenter i Kimi K3 og skar modellen fra 711 GB til 478 GB uden at miste intelligens – en …

søndag 9. august 2026 · Forskning & arkitektur kimi-k3unslothquantizationmodel-pruning

Sammenligning af 4-bit kvanttyper på MLX i gang

Brugeren efterlyser erfaringer med OptiQ, Unsloth Dynamic 2.0, oQ og DWQ til Qwen3.6 og Gemma4 på MLX – hvilken kvant bevarer bedst kvalitet?

søndag 9. august 2026 · Værktøjer & produkter mlxquantizationqwen-3.6gemma-4

Benchmarks til DeepSeek Flash 0731 kvant-test efterspurgt

En bruger med flere kvants af DeepSeek Flash 0731 leder efter offentlige benchmarks, der kan måle kvant-effekter med omkring 1 million tokens.

søndag 9. august 2026 · Værktøjer & produkter deepseek-v4-flashbenchmarkquantizationevaluation

Opfølgning: Gemma 4 QAT er ikke entydigt bedre end Q4_K_L

Omfattende benchmarks viser, at Googles QAT-kvantisering sparer hukommelse, men taber i præcision på visse opgaver. Brugeren foreslår, at Google justerer modellen til q4 …

fredag 7. august 2026 · Forskning & arkitektur gemma-4qatquantizationgguf

Opfølgning: Kimi K3 kvantiseret til GGUF – 1,1 TB på disk, kører på CPU

Fællesskabet har lavet Q3_K_S-kvant af Kimi K3 (2,8T parametre) og kører det på CPU med 4,21 t/s. Q1 …

torsdag 30. juli 2026 · Nye modeller kimi-k3quantizationgguflocal-llm

Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl

Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …

fredag 24. juli 2026 · Forskning & arkitektur laguna-s-2.1quantizationggufmoe

Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6

På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …

mandag 20. juli 2026 · 🗣️ Stemmer qwen-3.6kv-cachequantizationlocal-llm

Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp

En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …

lørdag 18. juli 2026 · Forskning & arkitektur deepseek-v4-flashquantizationlocal-inferencebenchmark

Forskning: Negativ-bit-kvantisering bryder den fysiske grænse for komprimering

Ved at udnytte fase-inverteret tensor-embedding hævdes det at opnå stabil inferens med negative bit-konfigurationer. Artiklen er satire, men illustrerer grænsen for …

lørdag 18. juli 2026 · Forskning & arkitektur negative-bit-quantizationquantizationllama.cppsatire

Bonsai 27B kører lokalt på iPhone i kun 3,9GB

PrismML har bygget Bonsai ved at kvantisere Qwen3.6-27B ned til 1-bit, hvilket reducerer størrelsen fra ~54GB til 3,9GB. Modellen bevarer …

fredag 17. juli 2026 · Nye modeller bonsai-27bbinary-quantizationmobile-aiprism-ml