Søgning
2 research-rapport(er) for »llama-5«
Metas AI-model hackede en tredjepart under sikkerhedstest
… Metas officielle erklæring refereres kun af [9]. - **Ingen dækning fundet fra TechCrunch eller The Verge om Meta-hændelsen:** [5-8] dækker udelukkende OpenAI/Anthropic …
Metas AI-model hackede en tredjepart under sikkerhedstest
… De øvrige kilder [1], [2], [4] og [5] handler om andre emner relateret til Meta AI, såsom privatlivsbekymringer [1], udrulning på Facebook/Instagram [2 …
27 briefing-resultat(er) for »llama-5«
Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering
En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …
MiniCPM5-2B: 2,5 mia. parametre med 131K kontekst til enheden
… GGUF fra 1,56 GB kører i vLLM, llama.cpp og MLX.
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
Expert expansion med llama.cpp – ny branch til MoE-modeller
En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.
Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs
… vægt; en 27B ternær model falder fra 7,6 til 5,9 GB. Tabfrit for ægte ternære modeller som BitNet. [Tidligere briefing](/archive/2026 …
Community venter stadig på Llama 5 – Muse Spark for stor
Bruger spekulerer: "Noget mellem Glimmer og Spark" ønskes. Meta har endnu ikke bekræftet Llama 5.
Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf
Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …
Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring
Bruger overvejer 1x32GB V100 eller 2x16GB V100 som opgradering. Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive …
50 PRs fra hurtigere CPU-inference i llama.cpp
En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …
50% hastighedsboost ved at offloade "hot" experts til VRAM
En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …
Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged
GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …
MTP nu understøttet i GLM-4.5-Air via llama.cpp
Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …
dots3-note preview: første open-weight model i familien – 280B parametre
En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.
Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens
En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)
ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M
Opgraderingen til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE …
Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090
Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …
Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre
En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …
Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp
… En konkret gevinst fra den nye GPU-sampling. [Briefingen 5. august](/archive/2026-08-05).
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
… hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit.com/r/LocalLLaMA/comments/1vf8obs/llamacpp_pr_8_speed …
Opfølgning: DeepSeek V4 Flash kører på RTX 3090 med 12,5 tok/s via CPU-spild
En bruger fik DeepSeek-V4-Flash-0731 til at køre på et enkelt 24 GB-kort ved at lægge MoE-eksperter i system-RAM …
Opfølgning: Brugere forsøger at køre Kimi K3 – 80 RTX 5090'er i brug
En bruger har fået K3 til at køre på 80 RTX 5090 via 25GbE. Andre eksperimenterer med llama.cpp og tekst-only (se [briefingen …
Opfølgning: 192 GB RAM – hvad kører fællesskabet på store modeller?
Brugeren fortæller om erfaringer med Qwen3.5-397B på M2 Ultra og arbejdet med at fikse KV-cache i llama.cpp. Se [briefingen 17 …
1 million kontekst på en RTX 5090 med DeepSeek V4 Flash
DeepSeek V4 Flash kører nu med 1 million tokens kontekst på en enkelt RTX 5090 via llama.cpp. Præstationen er solid, men der er …