Søgning
50 briefing-resultat(er) for »llama.cpp«
llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork
En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …
Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering
En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
… GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
… giver 2,9× prefill og 1,7× batch-16 throughput mod llama.cpp. Vægten er 425 MB. [Se briefingen fra 1. september](/archive/2026 …
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
Opfølgning: Tips til draft acceptance med MTP i llama.cpp
Bruger deler konfiguration for at optimere speculative decoding med Qwen3.6-35B-A3B-MTP. [briefingen 30. august](/archive/2026-08-30).
Opfølgning: vllm med P2P-driver vs. llama.cpp til Qwen 3.8 27B
Bruger med fire RTX 4090'er overvejer om P2P-patch gør vllm bedre end llama.cpp til MoE-modeller. [briefingen 30. august](/archive/2026 …
Expert expansion med llama.cpp – ny branch til MoE-modeller
En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs
Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …
Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX
Qwen3.8 27B Q4_K_M gav 34,4 tok/s i Ollama mod 35,8 i llama.cpp; Ollama var bedst til prompt …
Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde
Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …
Opfølgning: Qwen3.8-Flash-Next rammer 37-41 t/s på to 3090'er med DDR4
llama.cpp-optimeringer med UD-Q4_K_XL, expert cache og MTP løfter decode-farten markant på gammel hardware. [Briefingen 31. august](/archive/2026 …
Quant-variation på 150% — community forvirret
Bruger på r/LocalLLaMA påpeger kæmpe forskel i størrelser for Q4KM-kvanter. Kalder det "æbler, appelsiner og mangoer".
MLX på Mac M5: Er det overflødigt?
Bruger finder llama.cpp nu matcher eller overgår MLX på prefill. M5 Pro når 300+ tok/s med Q8 GGUF.
Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?
Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s
En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …
Opfølgning: Ny beellama-fork optimerer KV-cache til 76% hurtigere generation
En ny fork af beellama forbedrer kvarn-kvanters ydeevne ved høj kontekstdybde og giver op til 76% hurtigere token generation. Læs baggrunden i [briefingen …
Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split
Nyt værktøj beregner præcis `--override-tensor` for at maksimere kontekstlængde på to GPU'er. Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen …
Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring
Bruger overvejer 1x32GB V100 eller 2x16GB V100 som opgradering. Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive …
50 PRs fra hurtigere CPU-inference i llama.cpp
En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
… Ti SUPER med 100K kontekst ved 50 tok/s via beellama.cpp og kvarn5/kvarn4 KV-cache. Nøglen er en specialbygget hybrid-kvantisering og …
50% hastighedsboost ved at offloade "hot" experts til VRAM
En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …
Nyt værktøj: auto-annotér datasæt lokalt med LLM
"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …
Opfølgning: Nvidia opkøber HuggingFace – og dermed også llama.cpp og holdet bag
Nvidia overtager både HuggingFace-platformen og llama.cpp-holdet, hvilket sås tvivl om projektets fremtid som åbent værktøj. Usikkerheden er stor, da Nvidia har …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
… På en Ryzen 7 7700 opnås 639 tok/s prefill og 25,9 tok/s generation – hurtigere end llama.cpp. [briefingen 25. august](/archive …
Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged
GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …
ConvRot-kvantisering nu i llama-cpp-turboquant
Den nye ConvRot-kvantiseringsmetode, der giver Q6-kvalitet tæt på Q8's KLD/PPL, er implementeret i llama-cpp-turboquant. Metoden lover at genvinde …
MTP nu understøttet i GLM-4.5-Air via llama.cpp
Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …
Fintunet Gemma 4 12B giver 2,7x forbedring på tool calling
… Vægtene (fp16 → Q4_K_M) er tilgængelige til llama.cpp og Ollama.
Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM
Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en …
Opfølgning: DFlash 2 benchmarkes – 2,26x på rigtige kodeprompts, op til 8x i syntetisk test
Tre dages benchmarking viser DFlash 2 alene giver 2,26x speedup på LiveCodeBench, 4,68x med ét n-gram lookup. N-gram hjælper på …
AMD GFX906 får optimeret llama.cpp-fork
En bruger deler en ny fork af llama.cpp optimeret til AMD GFX906 (Mi50, Mi60, Radeon VII) via GCN HIP. Forbedringen gør det muligt …
dots3-note preview: første open-weight model i familien – 280B parametre
En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.
Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens
En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …
Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision
En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)
Opfølgning: Ling-3.0 (BailingMoE3) understøttes nu officielt i llama.cpp
PR #26608 er merged, og GGUF-kvantiseringer er tilgængelige – benchmarks på Intel Arc B580 viser 114 tk/s. [briefingen 17. august](/archive/2026-08 …
ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M
Opgraderingen til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE …
Kimi-K3-tekstmodel får plads i llama.cpp
En pull request tilføjer Kimi-K3-tekstmodellen til llama.cpp. Dermed kan lokal-LLM-miljøet snart køre Moonshots nyeste model på egen hardware.
llama.cpp Windows Manager: visuel hub til flere lokale modeller
Open-source-appen håndterer flere llama.cpp-runtime, launch-profiler og samtidige modeller bag en fælles OpenAI-kompatibel gateway. Tre måneder efter debuten er …
Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL
Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …
Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090
Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …
Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre
En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …
Longcat-Flash får GGUF-support i llama.cpp – klar til test
Pull request #19182 tilføjer understøttelse af Longcat-Flash-modellen. En 8B-parameter-udgave er allerede testet; større modeller venter på frivillige.