News-Tracker

Søgning

AI & LLM · daglig briefing


50 briefing-resultat(er) for »llama.cpp«

llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork

En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …

tirsdag 15. september 2026 · Værktøjer & produkter llama.cpp3090ampereoptimization

Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering

En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …

søndag 13. september 2026 · Værktøjer & produkter pi-devcontext-managementqwen-3.8llama.cpp

Gammel GPU kan speede mmproj op til 10x med llama.cpp

Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.

lørdag 12. september 2026 · Værktøjer & produkter llama.cppmmprojgpu-offloadinglocal-llm

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

… giver 2,9× prefill og 1,7× batch-16 throughput mod llama.cpp. Vægten er 425 MB. [Se briefingen fra 1. september](/archive/2026 …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp

Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3llama.cppqwen-3.8inference

Opfølgning: Tips til draft acceptance med MTP i llama.cpp

Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).

mandag 7. september 2026 · Værktøjer & produkter llama.cppmtpdraft-modelqwen-3.6

Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B

Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …

mandag 7. september 2026 · Værktøjer & produkter vllmllama.cppp2pqwen-3.8

Expert expansion med llama.cpp – ny branch til MoE-modeller

En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.

mandag 7. september 2026 · Forskning & arkitektur llama.cppexpert-expansionmoeglm-5.3-flash

Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?

Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …

søndag 6. september 2026 · Værktøjer & produkter llama.cpptensor-parallelismgpu

Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs

Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …

lørdag 5. september 2026 · Forskning & arkitektur ternaryq2-b3bitnetllama.cpp

Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX

Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bollamarocmvulkan

Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde

Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …

lørdag 5. september 2026 · Værktøjer & produkter tokens-per-secondmemory-bandwidthllama.cppkv-cache

Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4

llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …

fredag 4. september 2026 · Værktøjer & produkter llama.cppqwen3expert-cachemoe

Quant-variation på 150% — community forvirret

Bruger på r/LocalLLaMA påpeger kæmpe forskel i størrelser for Q4KM-kvanter. Kalder det "æbler, appelsiner og mangoer".

torsdag 3. september 2026 · Værktøjer & produkter llama.cppquantizationcommunity

MLX på Mac M5: Er det overflødigt?

Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.

torsdag 3. september 2026 · Værktøjer & produkter mlxllama.cppapple-siliconqwen-3.8

Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?

Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.

onsdag 2. september 2026 · Forskning & arkitektur vllmprefillinference-enginellama.cpp

Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf

Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …

tirsdag 1. september 2026 · Værktøjer & produkter llama.cppqwen-3.8memoryperformance

Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s

En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …

tirsdag 1. september 2026 · Nye modeller qwen-3.8performancellama.cppvram

Opfølgning: Ny beellama-fork optimerer KV-cache til 76% hurtigere generation

En ny fork af beellama forbedrer kvarn-kvanters ydeevne ved høj kontekstdybde og giver op til 76% hurtigere token generation. Læs baggrunden i [briefingen …

tirsdag 1. september 2026 · Værktøjer & produkter beellamakvarnkv-cachellama.cpp

Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split

Nyt værktøj beregner præcis `--override-tensor` for at maksimere kontekstlængde på to GPU'er. Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen …

mandag 31. august 2026 · Værktøjer & produkter llama.cppdual-gputensor-splitqwen-3.8

Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring

Bruger overvejer 1x32GB V100 eller 2x16GB V100 som opgradering. Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive …

mandag 31. august 2026 · Værktøjer & produkter v100gpu-comparisonqwen-3.8llama.cpp

50 PRs fra hurtigere CPU-inference i llama.cpp

En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU

… Ti SUPER med 100K kontekst ved 50 tok/s via beellama.cpp og kvarn5/kvarn4 KV-cache. Nøglen er en specialbygget hybrid-kvantisering og …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8llama.cpp16gbkv-cache

50% hastighedsboost ved at offloade "hot" experts til VRAM

En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp

Nyt værktøj: auto-annotér datasæt lokalt med LLM

"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …

lørdag 29. august 2026 · Værktøjer & produkter auto-annotationllmyoloopen-source

Opfølgning: Nvidia opkøber HuggingFace – og dermed også llama.cpp og holdet bag

Nvidia overtager både HuggingFace-platformen og llama.cpp-holdet, hvilket sås tvivl om projektets fremtid som åbent værktøj. Usikkerheden er stor, da Nvidia har …

fredag 28. august 2026 · Branche & politik nvidiahugging-facellama.cppacquisition

Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp

… På en Ryzen 7 7700 opnås 639 tok/s prefill og 25,9 tok/s generation – hurtigere end llama.cpp. [briefingen 25. august](/archive …

fredag 28. august 2026 · Værktøjer & produkter gemma-4c-implementationcpu-inference

Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged

GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …

fredag 28. august 2026 · Værktøjer & produkter llama.cppqwen3.8-flash-nextgguf

ConvRot-kvantisering nu i llama-cpp-turboquant

Den nye ConvRot-kvantiseringsmetode, der giver Q6-kvalitet tæt på Q8's KLD/PPL, er implementeret i llama-cpp-turboquant. Metoden lover at genvinde …

mandag 24. august 2026 · Forskning & arkitektur convrotquantizationllama.cppturboquant

MTP nu understøttet i GLM-4.5-Air via llama.cpp

Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …

mandag 24. august 2026 · Værktøjer & produkter glm-4.5-airmtpllama.cppmoe

Fintunet Gemma 4 12B giver 2,7x forbedring på tool calling

… Vægtene (fp16 → Q4_K_M) er tilgængelige til llama.cpp og Ollama.

søndag 23. august 2026 · Værktøjer & produkter gemma-4-12bfine-tuningtool-callinglocal-llm

Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM

Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en …

søndag 23. august 2026 · Værktøjer & produkter deepseek-v4-flashquantlocal-llmllama.cpp

Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test

Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …

søndag 23. august 2026 · Værktøjer & produkter dflash2speculative-decodingqwen3.8-27bllama.cpplivecodebench

AMD GFX906 får optimeret llama.cpp-fork

En bruger deler en ny fork af llama.cpp optimeret til AMD GFX906 (Mi50, Mi60, Radeon VII) via GCN HIP. Forbedringen gør det muligt …

søndag 23. august 2026 · Værktøjer & produkter llama.cppamdgfx906hipfork

dots3-note preview: første open-weight model i familien – 280B parametre

En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.

lørdag 22. august 2026 · Nye modeller dots3-noteopen-weightsmixture-of-expertsmultimodal

Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens

En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …

lørdag 22. august 2026 · Forskning & arkitektur llama.cppdsparkspeculative-decodingpc-tree

Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision

En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …

lørdag 22. august 2026 · Værktøjer & produkter strix-haloqwen3.8-27bllama.cppoptimization-guide

Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090

Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)

onsdag 19. august 2026 · Værktøjer & produkter dflash2qwen-3.8llama.cppspeculative-decoding

Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp

PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …

onsdag 19. august 2026 · Værktøjer & produkter ling-3.0bailingmoe3llama.cppintel-arc

ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M

Opgraderingen til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE …

mandag 17. august 2026 · Værktøjer & produkter llama.cpprocmradeon-780mvulkan

Kimi-K3-tekstmodel får plads i llama.cpp

En pull request tilføjer Kimi-K3-tekstmodellen til llama.cpp. Dermed kan lokal-LLM-miljøet snart køre Moonshots nyeste model på egen hardware.

søndag 16. august 2026 · Nye modeller kimi-k3llama.cppmoonshotpull-request

llama.cpp Windows Manager: visuel hub til flere lokale modeller

Open-source-appen håndterer flere llama.cpp-runtime, launch-profiler og samtidige modeller bag en fælles OpenAI-kompatibel gateway. Tre måneder efter debuten er …

søndag 16. august 2026 · Værktøjer & produkter llama.cppwindowsopen-sourcemodel-management

Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL

Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …

søndag 16. august 2026 · Værktøjer & produkter intel-arcllama.cppsycllocal-inference

Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090

Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp

tirsdag 11. august 2026 · Nye modeller muse-glimmerspeculative-decodingperformancertx-5090

Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre

En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …

tirsdag 11. august 2026 · Forskning & arkitektur llama.cppparallel-agentsprefillbottleneck

Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0

En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …

lørdag 8. august 2026 · Nye modeller llama.cppq2_0x86-vnnicpu-inference

Longcat-Flash får GGUF-support i llama.cpp – klar til test

Pull request #19182 tilføjer understøttelse af Longcat-Flash-modellen. En 8B-parameter-udgave er allerede testet; større modeller venter på frivillige.

lørdag 8. august 2026 · Nye modeller longcat-flashllama.cppgguf