Søgning
1 research-rapport(er) for »gguf«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… 5. [unsloth/Laguna-S-2.1-GGUF · Hugging Face](https://huggingface.co/unsloth/Laguna-S-2.1-GGUF) 6. [poolside/Laguna-S-2.1 …
29 briefing-resultat(er) for »gguf«
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
… 34 benchmarks og leveres med datasæt, checkpoints og Apache 2.0-vægte. GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.
Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs
Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …
Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM
Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Opfølgning: AP-kvanter til Qwen3.8 Flash slår konkurrenter
Opfølgning på [briefingen 2. september](/archive/2026-09-02). Nyt KLD-datasæt forbedrer kvantisering. AgentionAI frigiver AP-GGUF på HuggingFace.
Nemotron-3.5-Lightning kører 262K kontekst på 16 GB – med en kvantiserings-fix
En Reddit-bruger fandt en kvantiseringsfejl, der gjorde alle lave GGUF'er af Nemotron-3.5 ubrugelige, og løste den med ShimQuant. Resultatet: 11 …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
AtomicChats GGUF-kvant af Qwen3.8 Flash Next imponerer
En bruger på M4 Max 128GB rapporterer, at AtomicChats kvant af Flash Next bruger pageable PLE-tabel via mmap, hvilket reducerer RAM-forbrug fra …
Opfølgning: State-of-the-art GGUFs til Qwen3.8-27B – 2,5-3,0 bpw
Nye GSQ-RCO-kvanter slår alle eksisterende kvanters nøjagtighed ved samme filstørrelse. 2,75 bpw (9,3 GB) matcher endda BF16 i gennemsnit på …
Opfølgning: Qwen 3.8 27B QAT Q2 kører i kun 13-14 GB RAM med minimal kvalitetsnedgang
En bruger rapporterer, at QAT-kvantiseret Qwen 3.8 27B i Q2 med DFlash og Q5 KV-cache bruger 13-14 GB RAM og …
Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged
GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …
Opfølgning: Atomic Dynamic-quants af Qwen 3.8 27B testet på RTX 6000
Et team har lavet og benchmarked Atomic Dynamic GGUF-quants af Qwen 3.8 27B – Q4, Q5, Q6 og Q8 – på en RTX 6000 …
OpenCode + Qwen3.8-27B Q6_K_XL: kun fiasko indtil videre
Brugeren får ingen respons efter lang tænkning, mens Qwen3.6-35B-A3B fungerer fint. Fejlsøgning pågår. [Se tidligere dækning](/archive/2026-08-17)
16 GB VRAM-skærsilden: deling af konfigurationer til Qwen3.8
Brugere deler tips til at køre Qwen3.8-27B på 16 GB VRAM med Q4_XS, CPU-mmproj og begrænset kontekst. [Se tidligere dækning …
Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B
Dynamic v3 giver 10 % højere nøjagtighed for samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM …
Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp
PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …
Qwen3.8-27B one-shot en Super Mario-klon lokalt
En lokal Q8-GGUF på Framework Desktop skrev en Super Mario-klon i ét forsøg. Langsom, men ekstremt kompetent til nattejobs – og MTP-varianter …
Fællesskabet udgiver optimerede Muse Glimmer 30B-quants – SoTA i hukommelsesklassen
En studerende researcher udgav nye GGUF-quants af Muse Glimmer 30B med avancerede tensor-mapping-teknikker og påstår, at Q8-quanten er 21 % tættere …
Opfølgning: DeepSeek-V4-Flash stopper ved 100K+ tokens i OpenCode
Brugere rapporterer, at Q8_K_XL-versionen af DeepSeek-V4-Flash holder op med at generere ved lange kontekster. "Resume" genstarter, men problemet gentager …
Longcat-Flash får GGUF-support i llama.cpp – klar til test
Pull request #19182 tilføjer understøttelse af Longcat-Flash-modellen. En 8B-parameter-udgave er allerede testet; større modeller venter på frivillige.
Opfølgning: LFM2.5-2.6B klarer 220 tok/s og 128K kontekst på enheden
… parametre, værktøjsbrug og vægte i GGUF, MLX og ONNX – også på Raspberry Pi. [Se briefingen 5. august](/archive/2026-08-05).
Opfølgning: Gemma 4 QAT er ikke entydigt bedre end Q4_K_L
Omfattende benchmarks viser, at Googles QAT-kvantisering sparer hukommelse, men taber i præcision på visse opgaver. Brugeren foreslår, at Google justerer modellen til q4 …
Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark
En reddit-bruger kører en 2-bit kvantiseret DeepSeek V4 Flash på to RTX 3080 og får perfekt score i et SQL-test. Kun …
Opfølgning: DeepSeek V4 Flash kører lossless på en enkelt A100 med 17,7 t/s
Nye benchmarks viser, at den opdaterede V4 Flash kører tabsfrit på 40 GB A100 og matcher Sonnet 5 på DeepSWE. [briefingen 24. juli](/archive …
Opfølgning: DeepSeek V4 Flash kører 30 t/s på M5 Max via DS4-engine
En community-medlem har kvantiseret den nye V4 Flash til DS4 DwarfStar og opnår dobbelt hastighed i forhold til llama.cpp. [briefingen 18. juli …
Opfølgning: Kimi K3 kvantiseret til GGUF – 1,1 TB på disk, kører på CPU
Fællesskabet har lavet Q3_K_S-kvant af Kimi K3 (2,8T parametre) og kører det på CPU med 4,21 t/s. Q1 …
Minimax M3 og MSA understøttet i llama.cpp – alle GGUFs skal regenereres
En større ændring i llama.cpp kræver, at alle eksisterende GGUFs genskabes. Minimax M3 med Multi-Scale Attention og vision-support er blevet mergeret …
Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl
Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …