News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »2-bit-quant«

Qwen 3.8 27b

… Unsloth angiver, at modellen kan køre på 15 GB total hukommelse (RAM+VRAM) ved 4-bit kvantisering, 18 GB ved 6-bit, 24 GB …

mandag 3. august 2026 · research

9 briefing-resultat(er) for »2-bit-quant«

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM

… i 4-bit+ med acceptable tokens/s på en opsætning med 2x RTX 3090 og DDR5 RAM. Se [tidligere dækning](/archive/2026-08-09).

søndag 23. august 2026 · Værktøjer & produkter deepseek-v4-flashquantlocal-llmllama.cpp

Opfølgning: Unsloth udgiver forbedrede GGUFs til Qwen3.8-27B

… samme størrelse, og 1-bit quants bevarer 77 % nøjagtighed. Modellen kan nu køre på 8 GB RAM ([briefingen 19. august](/archive/2026-08-19)).

torsdag 20. august 2026 · Nye modeller qwen-3.8unslothggufquantization

Status på 1-bit og ternære modeller: Bonsai, Hy-MT1.5, Maple-Preview og flere

En omfattende opdatering dækker nye PRs for CUDA/Vulkan og optimeringer, der giver 15-40% hastighedsforøgelse.

onsdag 19. august 2026 · Forskning & arkitektur bitnetternarybonsaiquantization

Sammenligning af 4-bit kvanttyper på MLX i gang

Brugeren efterlyser erfaringer med OptiQ, Unsloth Dynamic 2.0, oQ og DWQ til Qwen3.6 og Gemma4 på MLX – hvilken kvant bevarer bedst kvalitet?

søndag 9. august 2026 · Værktøjer & produkter mlxquantizationqwen-3.6gemma-4

Opfølgning: DeepSeek V4 Flash 2-bit kvant opnår 100% i SQL-benchmark

En reddit-bruger kører en 2-bit kvantiseret DeepSeek V4 Flash på to RTX 3080 og får perfekt score i et SQL-test. Kun …

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash2-bit-quantsql-benchmarklocal-llm

Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp

En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …

lørdag 18. juli 2026 · Forskning & arkitektur deepseek-v4-flashquantizationlocal-inferencebenchmark

Forskning: Negativ-bit-kvantisering bryder den fysiske grænse for komprimering

Ved at udnytte fase-inverteret tensor-embedding hævdes det at opnå stabil inferens med negative bit-konfigurationer. Artiklen er satire, men illustrerer grænsen for …

lørdag 18. juli 2026 · Forskning & arkitektur negative-bit-quantizationquantizationllama.cppsatire

Bonsai 27B kører lokalt på iPhone i kun 3,9GB

PrismML har bygget Bonsai ved at kvantisere Qwen3.6-27B ned til 1-bit, hvilket reducerer størrelsen fra ~54GB til 3,9GB. Modellen bevarer …

fredag 17. juli 2026 · Nye modeller bonsai-27bbinary-quantizationmobile-aiprism-ml