News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »gguf«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… 5. [unsloth/Laguna-S-2.1-GGUF · Hugging Face](https://huggingface.co/unsloth/Laguna-S-2.1-GGUF) 6. [poolside/Laguna-S-2.1 …

fredag 7. august 2026 · research

29 briefing-resultat(er) for »gguf«

MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden

… 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.

tirsdag 8. september 2026 · Nye modeller minicpm5openbmbon-deviceapache-2.0

Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs

Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …

lørdag 5. september 2026 · Forskning & arkitektur ternaryq2-b3bitnetllama.cpp

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

MLX på Mac M5: Er det overflødigt?

Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.

torsdag 3. september 2026 · Værktøjer & produkter mlxllama.cppapple-siliconqwen-3.8

Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter

Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.

torsdag 3. september 2026 · Forskning & arkitektur qwen-3.8ap-quantskaitchup

Nemotron-3.5-Lightning kører 262K kontekst på 16 GB – med en kvantiserings-fix

En Reddit-bruger fandt en kvantiseringsfejl, der gjorde alle lave GGUF'er af Nemotron-3.5 ubrugelige, og løste den med ShimQuant. Resultatet: 11 …

søndag 30. august 2026 · Nye modeller nemotron-3.5ggufquantizationshimquant

Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4

En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …

søndag 30. august 2026 · Nye modeller qwen-3.8ggufquantizationlocal-llm

AtomicChats GGUF-kvant af Qwen3.8 Flash Next imponerer

En bruger på M4 Max 128GB rapporterer, at AtomicChats kvant af Flash Next bruger pageable PLE-tabel via mmap, hvilket reducerer RAM-forbrug fra …

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-flash-nextatomicchatquant

Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw

Nye GSQ-RCO-kvanter slår alle eksisterende kvanters nøjagtighed ved samme filstørrelse. 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på …

lørdag 29. august 2026 · Værktøjer & produkter ggufqwen3.8-27bgsq-rcoquantization

Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang

En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …

fredag 28. august 2026 · Værktøjer & produkter qwen-3.8quantizationqatgguf

Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged

GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …

fredag 28. august 2026 · Værktøjer & produkter llama.cppqwen3.8-flash-nextgguf

Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000

Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …

mandag 24. august 2026 · Forskning & arkitektur qwen3.8-27bquantizationatomic-dynamicbenchmark

OpenCode + Qwen3.8-27B Q6_K_XL: kun fiasko indtil videre

Brugeren får ingen respons efter lang tænkning, mens Qwen3.6-35B-A3B fungerer fint. Fejlsøgning pågår. [Se tidligere dækning](/archive/2026-08-17)

lørdag 22. august 2026 · Nye modeller qwen3.8-27bopencodefailuregguf

16 GB VRAM-skærsilden: deling af konfigurationer til Qwen3.8

Brugere deler tips til at køre Qwen3.8-27B på 16 GB VRAM med Q4_XS, CPU-mmproj og begrænset kontekst. [Se tidligere dækning …

lørdag 22. august 2026 · Nye modeller qwen3.8-27b16gb-vramggufoptimization

Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B

Dynamic v3 giver 10 % højere nøjagtighed for samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM …

torsdag 20. august 2026 · Nye modeller qwen-3.8unslothggufquantization

Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp

PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …

onsdag 19. august 2026 · Værktøjer & produkter ling-3.0bailingmoe3llama.cppintel-arc

Qwen3.8-27B one-shot en Super Mario-klon lokalt

En lokal Q8-GGUF på Framework Desktop skrev en Super Mario-klon i ét forsøg. Langsom, men ekstremt kompetent til nattejobs – og MTP-varianter …

søndag 16. august 2026 · Nye modeller qwen3.8-27bggufcodinglocal-llm

Fællesskabet udgiver optimerede Muse Glimmer 30B-quants – SoTA i hukommelsesklassen

En studerende researcher udgav nye GGUF-quants af Muse Glimmer 30B med avancerede tensor-mapping-teknikker og påstår, at Q8-quanten er 21 % tættere …

onsdag 12. august 2026 · Nye modeller muse-glimmerggufquantizationcommunity

Opfølgning: DeepSeek-V4-Flash stopper ved 100K+ tokens i OpenCode

Brugere rapporterer, at Q8_K_XL-versionen af DeepSeek-V4-Flash holder op med at generere ved lange kontekster. "Resume" genstarter, men problemet gentager …

mandag 10. august 2026 · Værktøjer & produkter deepseek-v4ggufopencodecontext-length

Longcat-Flash får GGUF-support i llama.cpp – klar til test

Pull request #19182 tilføjer understøttelse af Longcat-Flash-modellen. En 8B-parameter-udgave er allerede testet; større modeller venter på frivillige.

lørdag 8. august 2026 · Nye modeller longcat-flashllama.cppgguf

Opfølgning: LFM2.5-2.6B klarer 220 tok/s og 128K kontekst på enheden

… parametre, værktøjsbrug og vægte i GGUF, MLX og ONNX – også på Raspberry Pi. [Se briefingen 5. august](/archive/2026-08-05).

fredag 7. august 2026 · Nye modeller lfm2.5-2.6bon-deviceopen-weightstool-calling

Opfølgning: Gemma 4 QAT er ikke entydigt bedre end Q4_K_L

Omfattende benchmarks viser, at Googles QAT-kvantisering sparer hukommelse, men taber i præcision på visse opgaver. Brugeren foreslår, at Google justerer modellen til q4 …

fredag 7. august 2026 · Forskning & arkitektur gemma-4qatquantizationgguf

Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark

En reddit-bruger kører en 2-bit kvantiseret DeepSeek V4 Flash på to RTX 3080 og får perfekt score i et SQL-test. Kun …

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash2-bit-quantsql-benchmarklocal-llm

Opfølgning: DeepSeek V4 Flash kører lossless på en enkelt A100 med 17,7 t/s

Nye benchmarks viser, at den opdaterede V4 Flash kører tabsfrit på 40 GB A100 og matcher Sonnet 5 på DeepSWE. [briefingen 24. juli](/archive …

lørdag 1. august 2026 · Nye modeller deepseek-v4-flashgguflocal-inferencebenchmark

Opfølgning: DeepSeek V4 Flash kører 30 t/s på M5 Max via DS4-engine

En community-medlem har kvantiseret den nye V4 Flash til DS4 DwarfStar og opnår dobbelt hastighed i forhold til llama.cpp. [briefingen 18. juli …

lørdag 1. august 2026 · Værktøjer & produkter deepseek-v4-flashds4dwarfstargguf

Opfølgning: Kimi K3 kvantiseret til GGUF – 1,1 TB på disk, kører på CPU

Fællesskabet har lavet Q3_K_S-kvant af Kimi K3 (2,8T parametre) og kører det på CPU med 4,21 t/s. Q1 …

torsdag 30. juli 2026 · Nye modeller kimi-k3quantizationgguflocal-llm

Minimax M3 og MSA understøttet i llama.cpp – alle GGUFs skal regenereres

En større ændring i llama.cpp kræver, at alle eksisterende GGUFs genskabes. Minimax M3 med Multi-Scale Attention og vision-support er blevet mergeret …

mandag 27. juli 2026 · Nye modeller llama.cppminimax-m3ggufmsa

Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl

Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …

fredag 24. juli 2026 · Forskning & arkitektur laguna-s-2.1quantizationggufmoe