News-Tracker

Søgning

AI & LLM · daglig briefing


50 briefing-resultat(er) for »inference«

Kan AI-inferenceudbydere overhovedet tjene penge?

Debat på r/LocalLLaMA afslører, at udbydere med 10.000 USD månedlig omsætning kun beholder 200 USD i profit – GPU-omkostninger æder alt.

fredag 11. september 2026 · Forskning & arkitektur inference-providersmarginsgpu-costbusiness-model

Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air

Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …

fredag 11. september 2026 · Forskning & arkitektur qwen-3.8apple-siliconinferenceoptimization

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next

Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3qwen3.8-flash-nextcpu-offloadinference

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp

Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.

tirsdag 8. september 2026 · Værktøjer & produkter exllamav3llama.cppqwen-3.8inference

NVIDIA satser på lokal AI og agenter på IFA 2026

NVIDIA og partnere viser hurtigere inference og værktøjer, der gør det lettere at sætte agenter op lokalt med PAIR og RTX Spark. Budskabet er …

fredag 4. september 2026 · Værktøjer & produkter nvidiaifa-2026dgx-sparklocal-ai

Perplexity open-sourcer Mac-inferens til Qwen 3.6

Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.

torsdag 3. september 2026 · Værktøjer & produkter perplexityinference-servermacqwen-3.6

Baseten kortlægger den effektive frontlinje for LLM-inferens

En ny analyse viser afvejningen mellem latency, throughput og omkostninger på tværs af forskellige inferenskonfigurationer.

onsdag 2. september 2026 · Forskning & arkitektur local-inferenceefficient-frontierbaseten

Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache

Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).

onsdag 2. september 2026 · Forskning & arkitektur qwen-3.8r9700mxfp4inference-speed

Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?

Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.

onsdag 2. september 2026 · Forskning & arkitektur vllmprefillinference-enginellama.cpp

Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker

En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …

tirsdag 1. september 2026 · Værktøjer & produkter local-llmedge-inferencemcp

AWS g6 leverer 3,7x throughput vs. g5g til LLM-serving

Gemma 4 E2B i ren JAX på g6.2xlarge vs. g5g.2xlarge. Den ældre instans mister 87% af decode-tiden til dtype-konvertering – uden …

mandag 31. august 2026 · Værktøjer & produkter awsg5gg6gemma-4jaxinference

DeepSeek V4 Flash kører 67-84 tok/s på to GX10'er

En bruger fik DeepSeek V4 Flash til at køre stabilt på to ASUS GX10 DGX-computere med over 65 tok/s sustained og en …

søndag 30. august 2026 · Værktøjer & produkter deepseek-v4dgx-sparklocal-inferencemxfp4

50 PRs fra hurtigere CPU-inference i llama.cpp

En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …

søndag 30. august 2026 · Værktøjer & produkter llama.cppcpu-inferenceoptimizationprs

Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp

En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …

fredag 28. august 2026 · Værktøjer & produkter gemma-4c-implementationcpu-inference

FreeToken: Kør frontlinje-MoE på din gaming-PC

FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …

tirsdag 25. august 2026 · Forskning & arkitektur freetokenmoeedge-inferencecpu-gpu

Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er

En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …

lørdag 22. august 2026 · Værktøjer & produkter vllmqwen3.8-27brtx-3090inference-speed

Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer

Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8inference-optimizationrtx-3090tps

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …

torsdag 20. august 2026 · Nye modeller qwen-3.8dflash2inferenceoptimizationrtx-3090

Opfølgning: Temperatur sænkning løser Qwens "overthinking"-problem

En Reddit-bruger bemærker at default temperature 1.0 får Qwen 3.8 til at overtænke. Sænkning til 0.7 stopper de lange tankestrømme …

tirsdag 18. august 2026 · Forskning & arkitektur qwen-3.8temperatureoverthinkinginference

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

Qwen 3.8 2.4T kører 288.000 tokens/sekund på Nvidia GB300 NVL72

Den enorme MoE-model opnår over 4.000 tokens/sekund per GPU i FP8-præcision på Nvidias 72-GPU-superchip. Det svarer til 350 …

mandag 17. august 2026 · Nye modeller qwen-3.82.4tnvidia-gb300inference

Apple Silicon-inference: "Softwarestakken er et rod"

To ugers test viser, at ingen framework samler prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens …

søndag 16. august 2026 · Værktøjer & produkter apple-siliconmlx-lmvllm-metalinference

Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL

Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …

søndag 16. august 2026 · Værktøjer & produkter intel-arcllama.cppsycllocal-inference

Opfølgning: Mistral udvider europæisk AI-suverænitet med regional inference og 1 GW compute

Mistral tilbyder nu regional inference, adgang til tredjeparts open-weight-modeller og planlægger at tilføje 1 GW compute inden 2030. Strategien sigter mod at …

torsdag 13. august 2026 · 🇪🇺 EU & Europa mistralsovereign-aieuropean-computeinference

Mistral lancerer plan for europæisk AI-suverænitet: 1 GW compute i 2030 og nye regionale inference-løsninger

Mistral annoncerede i dag regionale inference-infrastrukturer, open-weight-modeller og en ambitiøs målsætning om at opføre 1 gigawatt europæisk compute-kapacitet inden 2030 …

onsdag 12. august 2026 · 🇪🇺 EU & Europa mistralsovereign-aiinferenceeuropean-compute

DS4 Flash skrev custom Metal-kernel til Kimi K3 på 50 minutter

En ikke-programmør fik DS4 Flash til at skrive en Metal-kernel til IQ1_0-kvant af Kimi K3 og opnåede ~4 tok/s …

søndag 9. august 2026 · Forskning & arkitektur ds4-flashmetal-kernelkimi-k3local-inference

Intel Optane som tredje lagerlag til MoE-modeller diskuteres

En bruger spekulerer i, om udgået Intel Optane-teknologi kan bruges som en tredje hukommelseslag til nestede MoE-modeller mellem RAM og NVMe.

søndag 9. august 2026 · Værktøjer & produkter intel-optanememory-hierarchymoelocal-inference

Opfølgning: C-baseret BitNet-inference når 36 tok/s på Xeon CPU

En open source-motor i ren C kører 1.58-bit ternære modeller med 95% af teoretisk hukommelsesbåndbredde. Viser potentialet for CPU-only inferens …

søndag 9. august 2026 · Forskning & arkitektur bitnet1.58-bitcpu-inferencec-engine

Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0

En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …

lørdag 8. august 2026 · Nye modeller llama.cppq2_0x86-vnnicpu-inference

Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine

En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …

lørdag 8. august 2026 · Værktøjer & produkter deepseek-v4-flashdgx-sparkvllmlocal-inference

AMD køber Taalas og støber modeller direkte i silicium

AMD overtager Taalas for at styrke AI-inferens ved at lægge vægte i hardwaren. Opkøbet sænker forhåbningerne om forbruger-udskiftelige modelchips og peger entydigt …

fredag 7. august 2026 · Branche & politik amdtaalasinferencesilicon

DS4 Flash: Kan nuværende API-priser overhovedet betale sig?

En r/LocalLLaMA-bruger viser, at egen hosting er dyrere på output end DeepSeek-prisen på $0,28/MTok. Dax hævder, at prisen stiger …

fredag 7. august 2026 · Branche & politik ds4-flashapi-pricinginference-costdeepseek

Opfølgning: Inkling-Small 276B MoE kører med under 10 GB hukommelse

Mference-appen gør det muligt at køre Inkling-Small med kun 9,5 GB footprint på en M5 Mac. Store MoE-modeller bliver stadig …

torsdag 6. august 2026 · Nye modeller inkling-smallmoelocal-llminference

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu

Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token

En C99-inference engine streamer eksperter fra NVMe. 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive …

mandag 3. august 2026 · Forskning & arkitektur kimi-k3cpu-inferencenvme

Opfølgning: DeepSeek V4 Flash kører lossless på en enkelt A100 med 17,7 t/s

Nye benchmarks viser, at den opdaterede V4 Flash kører tabsfrit på 40 GB A100 og matcher Sonnet 5 på DeepSWE. [briefingen 24. juli](/archive …

lørdag 1. august 2026 · Nye modeller deepseek-v4-flashgguflocal-inferencebenchmark

OpenAI sænker prisen på GPT-5.6 Luna med 80 %

OpenAI har brugt GPT-5.6 Sol til at optimere inferenskerner og sænke omkostningerne. Luna koster nu $0,20/mio. input-tokens – billigere end …

fredag 31. juli 2026 · Nye modeller gpt-5-6openaiprice-dropinference-optimization

Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst

En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …

lørdag 25. juli 2026 · Forskning & arkitektur bitnetavx-512kernel-optimizationcpu-inference

MindControl: llama.cpp-fork styrer reasoning-processen via sampling-injection

En ny fork af llama.cpp injicerer selvbevidste statements i modellens tænkeproces for at forhindre evige loops og spild af tokens. Tidlige tests viser …

torsdag 23. juli 2026 · Forskning & arkitektur llama.cppreasoningmindcontrolinference

Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet

… Trafikken ligger på 30-70 MB/s – langt under hvad mange tror er nødvendigt for multi-node-inference.

torsdag 23. juli 2026 · Værktøjer & produkter llama.cppmulti-nodelocal-inferencelaguna

Lokal AI-entusiast spørger: Hvad skal vi stille op med 2T-modeller?

På r/LocalLLaMA sår en bruger med ekstrem hardware tvivl om, hvorvidt trillion-parameter-modeller overhovedet kan køres lokalt i praksis.

mandag 20. juli 2026 · 🗣️ Stemmer local-llminferencehardwarecommunity

FastFlowLM slutter sig til AMD for at fremme AI-inferens

Holdet bag FastFlowLM er nu en del af AMD. Samarbejdet skal accelerere udviklingen af AI-inferens, hvilket kan styrke AMD's position i hardware …

søndag 19. juli 2026 · Værktøjer & produkter amdinferencefastflowlm

Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?

En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …

søndag 19. juli 2026 · Værktøjer & produkter tensor-rtstreaminginference

Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp

En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …

lørdag 18. juli 2026 · Forskning & arkitektur deepseek-v4-flashquantizationlocal-inferencebenchmark

FastFlowLM slutter sig til AMD for at fremme AI-inferens

FastFlowLM's letvægts inferenssoftware bliver en del af AMDs strategi for at forbedre AI-performance og effektivitet på tværs af hardwarestacken.

lørdag 18. juli 2026 · Branche & politik amdfastflowlminferencehpc

Kan RAID0 af SSD'er erstatte VRAM til lokal LLM-inference?

En bruger undersøger, om kombinationen af mange hurtige SSD'er i RAID0 kan give tilstrækkelig båndbredde til at køre store modeller lokalt. Metoden kunne …

fredag 17. juli 2026 · Forskning & arkitektur ssd-raid0local-inferencevram-alternativehardware

Privat lokal AI på NVIDIA DGX Spark med Ollama

… Sætningen erstatter dyre enterprise cloud AI-abonnementer med lokal inference.

fredag 17. juli 2026 · Værktøjer & produkter local-aiollamaopen-webuinvidia-dgx-spark