Søgning
50 briefing-resultat(er) for »inference«
Kan AI-inferenceudbydere overhovedet tjene penge?
Debat på r/LocalLLaMA afslører, at udbydere med 10.000 USD månedlig omsætning kun beholder 200 USD i profit – GPU-omkostninger æder alt.
Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air
Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …
Opfølgning: ExLlamaV3 slår llama.cpp til CPU-offloadet Qwen Flash Next
Med to RTX 3080'ere og 128 GB RAM giver ExLlamaV3 2× decode og 3,2× prefill mod llama.cpp. Fordelen er dog model …
Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine
En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …
ExLlamaV3: Bedre kvantisering og hastighed end llama.cpp
Brugere rapporterer højere kvalitet og lavere KLD med ExLlamaV3-kvanter, især på NVIDIA. CPU-MoE-offload er nyligt tilføjet og gør det mere tilgængeligt.
NVIDIA satser på lokal AI og agenter på IFA 2026
NVIDIA og partnere viser hurtigere inference og værktøjer, der gør det lettere at sætte agenter op lokalt med PAIR og RTX Spark. Budskabet er …
Perplexity open-sourcer Mac-inferens til Qwen 3.6
Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.
Baseten kortlægger den effektive frontlinje for LLM-inferens
En ny analyse viser afvejningen mellem latency, throughput og omkostninger på tværs af forskellige inferenskonfigurationer.
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Hvorfor er prefill enormt hurtigere i vLLM end i andre inferens-engines?
Brugere rapporterer 7500 prefill-tok/s med vLLM mod langt lavere tal i llama.cpp – forskellen skyldes sandsynligvis arkitektoniske valg.
Sliding-window attention slår lineær attention – og kræver ingen træning
… Anbefales som billig løsning til inference.
Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker
En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …
AWS g6 leverer 3,7x throughput vs. g5g til LLM-serving
Gemma 4 E2B i ren JAX på g6.2xlarge vs. g5g.2xlarge. Den ældre instans mister 87% af decode-tiden til dtype-konvertering – uden …
DeepSeek V4 Flash kører 67-84 tok/s på to GX10'er
En bruger fik DeepSeek V4 Flash til at køre stabilt på to ASUS GX10 DGX-computere med over 65 tok/s sustained og en …
50 PRs fra hurtigere CPU-inference i llama.cpp
En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …
FreeToken: Kør frontlinje-MoE på din gaming-PC
FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …
Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer
Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).
Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2
En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …
Opfølgning: Temperatur sænkning løser Qwens "overthinking"-problem
En Reddit-bruger bemærker at default temperature 1.0 får Qwen 3.8 til at overtænke. Sænkning til 0.7 stopper de lange tankestrømme …
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
Qwen 3.8 2.4T kører 288.000 tokens/sekund på Nvidia GB300 NVL72
Den enorme MoE-model opnår over 4.000 tokens/sekund per GPU i FP8-præcision på Nvidias 72-GPU-superchip. Det svarer til 350 …
Apple Silicon-inference: "Softwarestakken er et rod"
To ugers test viser, at ingen framework samler prefix-caching, spekulativ afkodning og paged KV-cache på Apple Silicon. vLLM-metal er tættest, mens …
Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL
Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …
Opfølgning: Mistral udvider europæisk AI-suverænitet med regional inference og 1 GW compute
Mistral tilbyder nu regional inference, adgang til tredjeparts open-weight-modeller og planlægger at tilføje 1 GW compute inden 2030. Strategien sigter mod at …
Mistral lancerer plan for europæisk AI-suverænitet: 1 GW compute i 2030 og nye regionale inference-løsninger
Mistral annoncerede i dag regionale inference-infrastrukturer, open-weight-modeller og en ambitiøs målsætning om at opføre 1 gigawatt europæisk compute-kapacitet inden 2030 …
DS4 Flash skrev custom Metal-kernel til Kimi K3 på 50 minutter
En ikke-programmør fik DS4 Flash til at skrive en Metal-kernel til IQ1_0-kvant af Kimi K3 og opnåede ~4 tok/s …
Intel Optane som tredje lagerlag til MoE-modeller diskuteres
En bruger spekulerer i, om udgået Intel Optane-teknologi kan bruges som en tredje hukommelseslag til nestede MoE-modeller mellem RAM og NVMe.
Opfølgning: C-baseret BitNet-inference når 36 tok/s på Xeon CPU
En open source-motor i ren C kører 1.58-bit ternære modeller med 95% af teoretisk hukommelsesbåndbredde. Viser potentialet for CPU-only inferens …
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
En ny PR tilføjer AVX-VNNI til Q2_0-dotproduktet i llama.cpp, hvilket giver 8B-modeller 8,2 tok/s mod tidligere 2 …
Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine
En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …
AMD køber Taalas og støber modeller direkte i silicium
AMD overtager Taalas for at styrke AI-inferens ved at lægge vægte i hardwaren. Opkøbet sænker forhåbningerne om forbruger-udskiftelige modelchips og peger entydigt …
DS4 Flash: Kan nuværende API-priser overhovedet betale sig?
En r/LocalLLaMA-bruger viser, at egen hosting er dyrere på output end DeepSeek-prisen på $0,28/MTok. Dax hævder, at prisen stiger …
Opfølgning: Inkling-Small 276B MoE kører med under 10 GB hukommelse
Mference-appen gør det muligt at køre Inkling-Small med kun 9,5 GB footprint på en M5 Mac. Store MoE-modeller bliver stadig …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …
Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token
En C99-inference engine streamer eksperter fra NVMe. 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive …
Opfølgning: DeepSeek V4 Flash kører lossless på en enkelt A100 med 17,7 t/s
Nye benchmarks viser, at den opdaterede V4 Flash kører tabsfrit på 40 GB A100 og matcher Sonnet 5 på DeepSWE. [briefingen 24. juli](/archive …
OpenAI sænker prisen på GPT-5.6 Luna med 80 %
OpenAI har brugt GPT-5.6 Sol til at optimere inferenskerner og sænke omkostningerne. Luna koster nu $0,20/mio. input-tokens – billigere end …
Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst
En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …
MindControl: llama.cpp-fork styrer reasoning-processen via sampling-injection
En ny fork af llama.cpp injicerer selvbevidste statements i modellens tænkeproces for at forhindre evige loops og spild af tokens. Tidlige tests viser …
Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet
… Trafikken ligger på 30-70 MB/s – langt under hvad mange tror er nødvendigt for multi-node-inference.
Lokal AI-entusiast spørger: Hvad skal vi stille op med 2T-modeller?
På r/LocalLLaMA sår en bruger med ekstrem hardware tvivl om, hvorvidt trillion-parameter-modeller overhovedet kan køres lokalt i praksis.
FastFlowLM slutter sig til AMD for at fremme AI-inferens
Holdet bag FastFlowLM er nu en del af AMD. Samarbejdet skal accelerere udviklingen af AI-inferens, hvilket kan styrke AMD's position i hardware …
Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?
En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …
Opfølgning: MacBook vs. 2× DGX Spark – DeepSeek V4 Flash i kvantiseringskamp
En bruger testede DeepSeek-V4-Flash på en M5 Max MacBook (2,45 bit kvantisering) mod to DGX Spark (FP8/FP4). Mac'en vandt …
FastFlowLM slutter sig til AMD for at fremme AI-inferens
FastFlowLM's letvægts inferenssoftware bliver en del af AMDs strategi for at forbedre AI-performance og effektivitet på tværs af hardwarestacken.
Kan RAID0 af SSD'er erstatte VRAM til lokal LLM-inference?
En bruger undersøger, om kombinationen af mange hurtige SSD'er i RAID0 kan give tilstrækkelig båndbredde til at køre store modeller lokalt. Metoden kunne …
Privat lokal AI på NVIDIA DGX Spark med Ollama
… Sætningen erstatter dyre enterprise cloud AI-abonnementer med lokal inference.