Søgning
1 research-rapport(er) for »2-bit-quant«
Qwen 3.8 27b
… Unsloth angiver, at modellen kan køre på 15 GB total hukommelse (RAM+VRAM) ved 4-bit kvantisering, 18 GB ved 6-bit, 24 GB …
9 briefing-resultat(er) for »2-bit-quant«
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM
… i 4-bit+ med acceptable tokens/s på en opsætning med 2x RTX 3090 og DDR5 RAM. Se [tidligere dækning](/archive/2026-08-09).
Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B
… samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM ([briefingen 19. august](/archive/2026-08-19)).
Status på 1-bit og ternære modeller: Bonsai, Hy-MT1.5, Maple-Preview og flere
En omfattende opdatering dækker nye PRs for CUDA/Vulkan og optimeringer, der giver 15-40% hastighedsforøgelse.
Sammenligning af 4-bit kvanttyper på MLX i gang
Brugeren efterlyser erfaringer med OptiQ, Unsloth Dynamic 2.0, oQ og DWQ til Qwen3.6 og Gemma4 på MLX – hvilken kvant bevarer bedst kvalitet?
Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark
En reddit-bruger kører en 2-bit kvantiseret DeepSeek V4 Flash på to RTX 3080 og får perfekt score i et SQL-test. Kun …
Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp
En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …
Forskning: Negativ-bit-kvantisering bryder den fysiske grænse for komprimering
Ved at udnytte fase-inverteret tensor-embedding hævdes det at opnå stabil inferens med negative bit-konfigurationer. Artiklen er satire, men illustrerer grænsen for …
Bonsai 27B kører lokalt på iPhone i kun 3,9GB
PrismML har bygget Bonsai ved at kvantisere Qwen3.6-27B ned til 1-bit, hvilket reducerer størrelsen fra ~54GB til 3,9GB. Modellen bevarer …