News-Tracker

Søgning

AI & LLM · daglig briefing


7 research-rapport(er) for »gpu«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… Modellen er designet til at køre på en enkelt 80GB GPU som NVIDIA H100 eller AMD MI300X, og bruger MXFP4-kvantisering [1]. Den har …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… samtidig med at den kan køre på et enkelt 16-24GB GPU. Den tætte arkitektur betyder, at alle 27 milliarder parametre er aktive per …

fredag 7. august 2026 · research

Qwen 3.8 27b

… 2084100707423289643) 4. [Qwen 3.6 27B VRAM & Hardware Requirements — Dense 27B GPU Guide (2026) | Will It Run AI Blog](https://willitrunai.com/blog/qwen …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …

torsdag 30. juli 2026 · research

Mac Studio M5, rygter, Pris, Specs og release dato

… M5 Max forventes med op til 18-core CPU og 40-core GPU, M5 Ultra med op til 36-core CPU og 80-core …

tirsdag 28. juli 2026 · research

skyderiet i Field's i København

… sNHxtSqgPrD6thELIbDbF4uJU36RqZvvHmTSPp2tVKrp&gaa_ts=69e8ba3e&gaa_sig=e-I4yglzvXF_qFZmGDHz1VR7covQNa_BnX3UFyXFvGy9a2KHP025GSc0kGK5-gLZkGMco1E16nwp3_GpupXufA%3D%3D) 16. [OVERBLIK: Det ved vi om skyderiet i Field's …

tirsdag 28. juli 2026 · research

Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?

… M5 Pro har en hukommelsesbåndbredde på 307 GB/s, mens M5 Max leverer op til 614 GB/s (afhængig af GPU-konfiguration) [7][10 …

onsdag 22. juli 2026 · research

42 briefing-resultat(er) for »gpu«

Lorivo: Serverless LoRA-hosting på delte GPU'er

Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.

søndag 13. september 2026 · Værktøjer & produkter loravllmserverlessfine-tuning

Gammel GPU kan speede mmproj op til 10x med llama.cpp

Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.

lørdag 12. september 2026 · Værktøjer & produkter llama.cppmmprojgpu-offloadinglocal-llm

Kan AI-inferenceudbydere overhovedet tjene penge?

Debat på r/LocalLLaMA afslører, at udbydere med 10.000 USD månedlig omsætning kun beholder 200 USD i profit – GPU-omkostninger æder alt.

fredag 11. september 2026 · Forskning & arkitektur inference-providersmarginsgpu-costbusiness-model

Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en

En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmexpert-cacheprefill-optimization

Er 5 t/s brugbart til en lokal model? Ja, siger bruger

… og finder det mere brugbart end 20 t/s på et GPU-setup, fordi systemet forbliver responsivt. Pointen: hastighed er ikke alt, når hardwaren …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmperformanceliability

Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM

Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …

mandag 7. september 2026 · Forskning & arkitektur layerstormexpert-streamingmoeglm-5.3-flash

Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?

Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.

mandag 7. september 2026 · Værktøjer & produkter budget-gpu2080-timi50local-llm

Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?

Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …

søndag 6. september 2026 · Værktøjer & produkter llama.cpptensor-parallelismgpu

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

Reddit spekulerer i NVIDIA-prisfastsættelse: RAM købt til 1/5 af spotpris

… AI-hukommelse til Microsoft, Google og NVIDIA – NVIDIA betaler $300-500 per enhed mod spotpris på $2.100, hvilket kan forklare høje GPU-priser.

tirsdag 1. september 2026 · Branche & politik nvidiapricinghbmsamsung

Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split

Nyt værktøj beregner præcis `--override-tensor` for at maksimere kontekstlængde på to GPU'er. Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen …

mandag 31. august 2026 · Værktøjer & produkter llama.cppdual-gputensor-splitqwen-3.8

Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring

… Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive/2026-08-30)

mandag 31. august 2026 · Værktøjer & produkter v100gpu-comparisonqwen-3.8llama.cpp

Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU

En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8llama.cpp16gbkv-cache

Apple lancerer Mac mini med M6-chip og 4x hurtigere AI-ydeevne

Ny M6-chip har Neural Accelerators i hver GPU-kerne og Dual 16-core Neural Engine. Mac mini starter ved $899 med 16 GB …

onsdag 26. august 2026 · Værktøjer & produkter applem6mac-minineural-engine

Kvantiseret Qwen3.8-27B skriver korrekt fysik-simulering på 16 GB GPU

27B-model i IQ3_XXS (10,93 GB) implementerer coherent transfer-matrix-metoden korrekt efter 100 minutter og 108K output-tokens på en Quadro …

onsdag 26. august 2026 · Nye modeller qwen3.8-27bquantizedtmmphysics

FreeToken: Kør frontlinje-MoE på din gaming-PC

FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …

tirsdag 25. august 2026 · Forskning & arkitektur freetokenmoeedge-inferencecpu-gpu

Opfølgning: $100 benchmark af Qwen3.8-27B quants

En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.

tirsdag 25. august 2026 · Forskning & arkitektur qwenquantizationbenchmarkkv-cache

Nvidia-kunder informeret om AI-relaterede prisstigninger på over 15%

En tråd på r/LocalLLaMA rapporterer, at Nvidia har meddelt kunder om prisstigninger på over 15% på AI-hardware – en udvikling der kan påvirke …

mandag 24. august 2026 · Branche & politik nvidiaprice-hikeshardwaregpu

Fintunet Gemma 4 12B giver 2,7x forbedring på tool calling

En bruger fintuner Gemma 4 12B på en enkelt 16 GB GPU og opnår 2,7x forbedring på tool calling samt 15,7 % flere …

søndag 23. august 2026 · Værktøjer & produkter gemma-4-12bfine-tuningtool-callinglocal-llm

Kan 64k kontekst føles som 300k med rekursive lokale agenter?

En bruger spørger, om man med Qwen 3.8 27B på én GPU kan få en 64k-agent til at håndtere 300k-opgaver via …

søndag 23. august 2026 · Forskning & arkitektur context-managementrecursive-agentsqwen3.8-27blocal-llm

Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er

En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …

lørdag 22. august 2026 · Værktøjer & produkter vllmqwen3.8-27brtx-3090inference-speed

Opfølgning: Ornith-1.5 35B kører 60 tok/s på et enkelt 4070 Ti

Med Q4_K_M og 27 aktive eksperter opnås 50–56 tok/s på en 12 GB GPU. Konteksten er 32K, men modellen er …

torsdag 20. august 2026 · Nye modeller ornith-1.5local-llm4070tiperformance

Qwen3.8-27B løser fluid-simulering efter to forsøg – på 16 GB GPU

Med IQ3_XXS og 96K kontekst byggede modellen en fungerende fluid-simulering på 42 minutter og 62 værktøjskald. Første forsøg fejlede, men modellen rettede …

torsdag 20. august 2026 · Nye modeller qwen-3.8fluid-simulationtool-usereasoning

Alibabas RISC-V CPU XuanTie C950 kører Qwen 3.8 27B med 30 tokens i sekundet

En demonstration viser, at en RISC-V-processor kan inferere store sprogmodeller uden GPU.

onsdag 19. august 2026 · Værktøjer & produkter risc-vxuantie-c950qwen-3.8alibaba

Qwen 3.8 2.4T kører 288.000 tokens/sekund på Nvidia GB300 NVL72

Den enorme MoE-model opnår over 4.000 tokens/sekund per GPU i FP8-præcision på Nvidias 72-GPU-superchip. Det svarer til 350 …

mandag 17. august 2026 · Nye modeller qwen-3.82.4tnvidia-gb300inference

Muse Glimmer 30B: Metas åbne superintelligens-tåge letter – og aktiemarkedet trækker på skuldrene

… 30B-parameter agent-model Muse Glimmer, der kører på én enkelt GPU. Alligevel handles Meta-aktien til beskedne 18 gange indtjeningen, hvilket illustrerer markedets …

onsdag 12. august 2026 · Nye modeller metamuse-glimmeropen-weightssafe-superintelligence

Muse Glimmer: Metas 30B open-weight agent-model kører på én GPU

Meta udgav Muse Glimmer, en 30B open-weight model under Apache 2.0, optimeret til lokale agent-workflows på én consumer GPU. Modellen klarer …

tirsdag 11. august 2026 · Nye modeller muse-glimmermetaopen-weightslocal-ai

Opfølgning: Muse Glimmer 30B slår Qwen 3.6 27B på flere områder – men halter på kode

… Modellen kvantiserer godt og kører på 24 GB GPU. Se [briefingen 9. august](/archive/2026-08-09).

tirsdag 11. august 2026 · Nye modeller muse-glimmerqwen-3.6benchmarklocal-llm

Opfølgning: MiniMax H3 leverer 2K-video med stereo lyd på open weights

… Men lokal kørsel på forbruger-GPU er langsom, så APOB AI tilbyder gratis hosting. [briefingen 4. august](/archive/2026-08-04)

mandag 10. august 2026 · Nye modeller minimax-m3open-weightsvideo-generationstereo-audio

PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM

At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.

søndag 9. august 2026 · Værktøjer & produkter pci-ep2pvllmmulti-gpu

Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp

Ved at flytte prompt processing til GPU'erne steg ydeevnen fra 400 til 1600 tokens/s på Qwen 3.6 27B. En konkret gevinst …

fredag 7. august 2026 · Værktøjer & produkter llama.cppdual-3090qwen-3.6prompt-processing

Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning

En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …

onsdag 5. august 2026 · Forskning & arkitektur llama.cppgpu-samplingspeed-boostmoe

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu

Opfølgning: AMD's MI355X underbyder Nvidias B300 på pris for Kimi K3

Otte MI355X GPU'er kan køre Moonshot AIs 2,8 billioner-parameter model med plads til overs. AMD viser konkurrencedygtig total cost of ownership …

mandag 3. august 2026 · Branche & politik amdmi355xnvidiab300kimi-k3

Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token

… 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive/2026-07-30).

mandag 3. august 2026 · Forskning & arkitektur kimi-k3cpu-inferencenvme

Opfølgning: DeepSeek V4 Flash når 105 t/s på to 4090D – Blackwell-kerner genimplementeret i Triton

En udvikler har skrevet alle Blackwell-eksklusive kernels om i Triton, så DeepSeek V4 Flash kører på Ada GPU'er. Resultatet er 2-3x …

fredag 24. juli 2026 · Forskning & arkitektur deepseek-v4-flashtritonvllmada-gpu

Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet

En bruger viser, at almindeligt ethernet mellem to nodes er nok til at køre Laguna UD-Q2_K_XL på 39,7 GB. Trafikken …

torsdag 23. juli 2026 · Værktøjer & produkter llama.cppmulti-nodelocal-inferencelaguna

Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU

En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).

søndag 19. juli 2026 · Værktøjer & produkter deepseek-v4-flashlocal-llm80gb-vrammoe-offloading

Spørgsmål: Kan Inkling køre med llama.cpp på CPU og RAM alene?

En bruger efterspørger launch-script til at køre Inkling uden GPU.

søndag 19. juli 2026 · Værktøjer & produkter inklingllama.cppcpu-onlylocal-llm

Tutorial: Finjustér Qwen3 med LoRA på én GPU i Google Colab

MarkTechPost viser en komplet workflow med NVIDIA NeMo AutoModel, der lader dig træne Qwen3-0.6B på en enkelt GPU. Nyttig guide for alle …

søndag 19. juli 2026 · Værktøjer & produkter qwen3loranemo-automodelfine-tuning

AI-boomet presser GPU-priserne i vejret

Brugere på r/LocalLLaMA diskuterer de høje priser på GPU'er til lokal AI. Et spring fra RTX 4060 Ti til brugbare modeller koster …

søndag 19. juli 2026 · Værktøjer & produkter gpu-priceslocal-aihardware

6x3090 vs 8x3090: Er opgraderingen værd?

En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …

fredag 17. juli 2026 · Værktøjer & produkter 3090multi-gpulocal-llmpcie