News-Tracker

Søgning

AI & LLM · daglig briefing


2 research-rapport(er) for »llama-5«

Metas AI-model hackede en tredjepart under sikkerhedstest

… Metas officielle erklæring refereres kun af [9]. - **Ingen dækning fundet fra TechCrunch eller The Verge om Meta-hændelsen:** [5-8] dækker udelukkende OpenAI/Anthropic …

fredag 7. august 2026 · research

Metas AI-model hackede en tredjepart under sikkerhedstest

… De øvrige kilder [1], [2], [4] og [5] handler om andre emner relateret til Meta AI, såsom privatlivsbekymringer [1], udrulning på Facebook/Instagram [2 …

fredag 7. august 2026 · research

27 briefing-resultat(er) for »llama-5«

Opfølgning: Brugere søger pi.dev-plugin til konteksthåndtering

En Qwen3.8 27B-bruger på RTX 5080 kæmper med komprimering, der fejler og afslutter modellen tidligt. Se [briefingen 30. august](/archive/2026-08 …

søndag 13. september 2026 · Værktøjer & produkter pi-devcontext-managementqwen-3.8llama.cpp

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Expert expansion med llama.cpp – ny branch til MoE-modeller

En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.

mandag 7. september 2026 · Forskning & arkitektur llama.cppexpert-expansionmoeglm-5.3-flash

Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs

… vægt; en 27B ternær model falder fra 7,6 til 5,9 GB. Tabfrit for ægte ternære modeller som BitNet. [Tidligere briefing](/archive/2026 …

lørdag 5. september 2026 · Forskning & arkitektur ternaryq2-b3bitnetllama.cpp

Community venter stadig på Llama 5 – Muse Spark for stor

Bruger spekulerer: "Noget mellem Glimmer og Spark" ønskes. Meta har endnu ikke bekræftet Llama 5.

torsdag 3. september 2026 · Værktøjer & produkter muse-sparkllama-5community

Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf

Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …

tirsdag 1. september 2026 · Værktøjer & produkter llama.cppqwen-3.8memoryperformance

Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring

Bruger overvejer 1x32GB V100 eller 2x16GB V100 som opgradering. Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive …

mandag 31. august 2026 · Værktøjer & produkter v100gpu-comparisonqwen-3.8llama.cpp

50 PRs fra hurtigere CPU-inference i llama.cpp

En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU

En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8llama.cpp16gbkv-cache

50% hastighedsboost ved at offloade "hot" experts til VRAM

En udvikler i r/LocalLLaMA har modificeret llama.cpp til kun at offloade de oftest brugte eksperter i MoE-modeller. Giver 20→30 t …

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp

Opfølgning: llama.cpp support til Qwen3.8-Flash-Next er nu merged

GGUF til Qwen3.8-Flash-Next kan nu downloades og kører med 55 tok/s på 4×3090. Samfundet får hurtigt adgang til den …

fredag 28. august 2026 · Værktøjer & produkter llama.cppqwen3.8-flash-nextgguf

MTP nu understøttet i GLM-4.5-Air via llama.cpp

Multi-Token Prediction (MTP) er tilføjet til GLM-4.5-Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til …

mandag 24. august 2026 · Værktøjer & produkter glm-4.5-airmtpllama.cppmoe

dots3-note preview: første open-weight model i familien – 280B parametre

En MoE-model med 16B aktive parametre, 512K kontekst og forståelse af tekst, billeder, video og lyd. Pull request indsendt til llama.cpp.

lørdag 22. august 2026 · Nye modeller dots3-noteopen-weightsmixture-of-expertsmultimodal

Llama.cpp får DSpark PC Tree – op til 29,5 % hurtigere inferens

En implementering af Parent-Conditioned Drafting Tree giver op til 72 % acceptrate på Qwen 3.0, med størst gevinst ved summarisering. Første udkast, men …

lørdag 22. august 2026 · Forskning & arkitektur llama.cppdsparkspeculative-decodingpc-tree

Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090

Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)

onsdag 19. august 2026 · Værktøjer & produkter dflash2qwen-3.8llama.cppspeculative-decoding

ROCm 7.14 i llama.cpp giver 50% hurtigere prompt-processing på Radeon 780M

Opgraderingen til ROCm 7.14 tilføjer officiel understøttelse af Radeon 780M iGPU. Benchmarks viser markant forbedring for tætte modeller sammenlignet med Vulkan, men MoE …

mandag 17. august 2026 · Værktøjer & produkter llama.cpprocmradeon-780mvulkan

Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090

Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …

tirsdag 11. august 2026 · Nye modeller muse-glimmerspeculative-decodingperformancertx-5090

Opfølgning: Parallelle agenter i llama.cpp – decode er fin, men prefill stopper alle andre

En bruger tester 3-5 parallelle agenter i llama.cpp og opdager, at decode kører flydende, men én agents prefill af et websearch-resultat …

tirsdag 11. august 2026 · Forskning & arkitektur llama.cppparallel-agentsprefillbottleneck

Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0

En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …

lørdag 8. august 2026 · Nye modeller llama.cppq2_0x86-vnnicpu-inference

Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp

… En konkret gevinst fra den nye GPU-sampling. [Briefingen 5. august](/archive/2026-08-05).

fredag 7. august 2026 · Værktøjer & produkter llama.cppdual-3090qwen-3.6prompt-processing

Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning

… hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit.com/r/LocalLLaMA/comments/1vf8obs/llamacpp_pr_8_speed …

onsdag 5. august 2026 · Forskning & arkitektur llama.cppgpu-samplingspeed-boostmoe

Opfølgning: DeepSeek V4 Flash kører på RTX 3090 med 12,5 tok/s via CPU-spild

En bruger fik DeepSeek-V4-Flash-0731 til at køre på et enkelt 24 GB-kort ved at lægge MoE-eksperter i system-RAM …

søndag 2. august 2026 · Værktøjer & produkter deepseek-v4-flashlocal-llmrtx-3090llama.cpp

Opfølgning: Brugere forsøger at køre Kimi K3 – 80 RTX 5090'er i brug

En bruger har fået K3 til at køre på 80 RTX 5090 via 25GbE. Andre eksperimenterer med llama.cpp og tekst-only (se [briefingen …

tirsdag 28. juli 2026 · Nye modeller kimi-k3local-llmrtx-5090llama.cpp

Opfølgning: 192 GB RAM – hvad kører fællesskabet på store modeller?

Brugeren fortæller om erfaringer med Qwen3.5-397B på M2 Ultra og arbejdet med at fikse KV-cache i llama.cpp. Se [briefingen 17 …

søndag 19. juli 2026 · Værktøjer & produkter qwen3.5-397blocal-modelsllama.cppkv-cache

1 million kontekst på en RTX 5090 med DeepSeek V4 Flash

DeepSeek V4 Flash kører nu med 1 million tokens kontekst på en enkelt RTX 5090 via llama.cpp. Præstationen er solid, men der er …

fredag 17. juli 2026 · Værktøjer & produkter deepseek-v4-flashllama.cpprtx-5090local-llm