Søgning
7 research-rapport(er) for »gpu«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Modellen er designet til at køre på en enkelt 80GB GPU som NVIDIA H100 eller AMD MI300X, og bruger MXFP4-kvantisering [1]. Den har …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… samtidig med at den kan køre på et enkelt 16-24GB GPU. Den tætte arkitektur betyder, at alle 27 milliarder parametre er aktive per …
Qwen 3.8 27b
… 2084100707423289643) 4. [Qwen 3.6 27B VRAM & Hardware Requirements — Dense 27B GPU Guide (2026) | Will It Run AI Blog](https://willitrunai.com/blog/qwen …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Her anbefales Qwen3.6-27B dense til "real coding agent work" på en enkelt 24GB GPU (RTX 3090Ti). Kilden angiver, at Qwen3.6-27B …
Mac Studio M5, rygter, Pris, Specs og release dato
… M5 Max forventes med op til 18-core CPU og 40-core GPU, M5 Ultra med op til 36-core CPU og 80-core …
skyderiet i Field's i København
… sNHxtSqgPrD6thELIbDbF4uJU36RqZvvHmTSPp2tVKrp&gaa_ts=69e8ba3e&gaa_sig=e-I4yglzvXF_qFZmGDHz1VR7covQNa_BnX3UFyXFvGy9a2KHP025GSc0kGK5-gLZkGMco1E16nwp3_GpupXufA%3D%3D) 16. [OVERBLIK: Det ved vi om skyderiet i Field's …
Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?
… M5 Pro har en hukommelsesbåndbredde på 307 GB/s, mens M5 Max leverer op til 614 GB/s (afhængig af GPU-konfiguration) [7][10 …
42 briefing-resultat(er) for »gpu«
Lorivo: Serverless LoRA-hosting på delte GPU'er
Platformen lader mange LoRA-adaptere dele én GPU-server per basismodel og giver OpenAI-kompatible endpoints. Qwen 3.5 4B er gratis.
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
Kan AI-inferenceudbydere overhovedet tjene penge?
Debat på r/LocalLLaMA afslører, at udbydere med 10.000 USD månedlig omsætning kun beholder 200 USD i profit – GPU-omkostninger æder alt.
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
… og finder det mere brugbart end 20 t/s på et GPU-setup, fordi systemet forbliver responsivt. Pointen: hastighed er ikke alt, når hardwaren …
Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM
Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …
Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?
Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …
Reddit spekulerer i NVIDIA-prisfastsættelse: RAM købt til 1/5 af spotpris
… AI-hukommelse til Microsoft, Google og NVIDIA – NVIDIA betaler $300-500 per enhed mod spotpris på $2.100, hvilket kan forklare høje GPU-priser.
Opfølgning: Dual-GPU tuner til llama.cpp optimerer tensor-split
Nyt værktøj beregner præcis `--override-tensor` for at maksimere kontekstlængde på to GPU'er. Testet med Qwen3.8-27B på ROCm og Vulkan. [briefingen …
Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring
… Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive/2026-08-30)
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
En bruger fik Qwen 3.8 27B til at køre på et RTX 4070 Ti SUPER med 100K kontekst ved 50 tok/s via …
Apple lancerer Mac mini med M6-chip og 4x hurtigere AI-ydeevne
Ny M6-chip har Neural Accelerators i hver GPU-kerne og Dual 16-core Neural Engine. Mac mini starter ved $899 med 16 GB …
Kvantiseret Qwen3.8-27B skriver korrekt fysik-simulering på 16 GB GPU
27B-model i IQ3_XXS (10,93 GB) implementerer coherent transfer-matrix-metoden korrekt efter 100 minutter og 108K output-tokens på en Quadro …
FreeToken: Kør frontlinje-MoE på din gaming-PC
FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …
Opfølgning: $100 benchmark af Qwen3.8-27B quants
En bruger planlægger at bruge $100 på cloud-GPU'er for at teste kvantiseringsniveauer, KV-cache-præcision og kontekst-afvejninger på Qwen3.8-27B.
Nvidia-kunder informeret om AI-relaterede prisstigninger på over 15%
En tråd på r/LocalLLaMA rapporterer, at Nvidia har meddelt kunder om prisstigninger på over 15% på AI-hardware – en udvikling der kan påvirke …
Fintunet Gemma 4 12B giver 2,7x forbedring på tool calling
En bruger fintuner Gemma 4 12B på en enkelt 16 GB GPU og opnår 2,7x forbedring på tool calling samt 15,7 % flere …
Kan 64k kontekst føles som 300k med rekursive lokale agenter?
En bruger spørger, om man med Qwen 3.8 27B på én GPU kan få en 64k-agent til at håndtere 300k-opgaver via …
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …
Opfølgning: Ornith-1.5 35B kører 60 tok/s på et enkelt 4070 Ti
Med Q4_K_M og 27 aktive eksperter opnås 50–56 tok/s på en 12 GB GPU. Konteksten er 32K, men modellen er …
Qwen3.8-27B løser fluid-simulering efter to forsøg – på 16 GB GPU
Med IQ3_XXS og 96K kontekst byggede modellen en fungerende fluid-simulering på 42 minutter og 62 værktøjskald. Første forsøg fejlede, men modellen rettede …
Alibabas RISC-V CPU XuanTie C950 kører Qwen 3.8 27B med 30 tokens i sekundet
En demonstration viser, at en RISC-V-processor kan inferere store sprogmodeller uden GPU.
Qwen 3.8 2.4T kører 288.000 tokens/sekund på Nvidia GB300 NVL72
Den enorme MoE-model opnår over 4.000 tokens/sekund per GPU i FP8-præcision på Nvidias 72-GPU-superchip. Det svarer til 350 …
Muse Glimmer 30B: Metas åbne superintelligens-tåge letter – og aktiemarkedet trækker på skuldrene
… 30B-parameter agent-model Muse Glimmer, der kører på én enkelt GPU. Alligevel handles Meta-aktien til beskedne 18 gange indtjeningen, hvilket illustrerer markedets …
Muse Glimmer: Metas 30B open-weight agent-model kører på én GPU
Meta udgav Muse Glimmer, en 30B open-weight model under Apache 2.0, optimeret til lokale agent-workflows på én consumer GPU. Modellen klarer …
Opfølgning: Muse Glimmer 30B slår Qwen 3.6 27B på flere områder – men halter på kode
… Modellen kvantiserer godt og kører på 24 GB GPU. Se [briefingen 9. august](/archive/2026-08-09).
Opfølgning: MiniMax H3 leverer 2K-video med stereo lyd på open weights
… Men lokal kørsel på forbruger-GPU er langsom, så APOB AI tilbyder gratis hosting. [briefingen 4. august](/archive/2026-08-04)
PCI-E P2P på forbrugergrafikkort giver markant ydelsesløft i VLLM
At slå P2P til mellem to forbrugergrafikkort (4x5060 Ti) gav op til 2x højere tokens per sekund i VLLM – en overset optimering.
Opfølgning: Dual 3090-opsætning firedobler prompt-hastigheden i llama.cpp
Ved at flytte prompt processing til GPU'erne steg ydeevnen fra 400 til 1600 tokens/s på Qwen 3.6 27B. En konkret gevinst …
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.
Opfølgning: AMD's MI355X underbyder Nvidias B300 på pris for Kimi K3
Otte MI355X GPU'er kan køre Moonshot AIs 2,8 billioner-parameter model med plads til overs. AMD viser konkurrencedygtig total cost of ownership …
Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token
… 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive/2026-07-30).
Opfølgning: DeepSeek V4 Flash når 105 t/s på to 4090D – Blackwell-kerner genimplementeret i Triton
En udvikler har skrevet alle Blackwell-eksklusive kernels om i Triton, så DeepSeek V4 Flash kører på Ada GPU'er. Resultatet er 2-3x …
Billig multi-node GPU: 30 tok/s på Laguna med to 4060'ere og USB-ethernet
En bruger viser, at almindeligt ethernet mellem to nodes er nok til at køre Laguna UD-Q2_K_XL på 39,7 GB. Trafikken …
Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU
En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).
Spørgsmål: Kan Inkling køre med llama.cpp på CPU og RAM alene?
En bruger efterspørger launch-script til at køre Inkling uden GPU.
Tutorial: Finjustér Qwen3 med LoRA på én GPU i Google Colab
MarkTechPost viser en komplet workflow med NVIDIA NeMo AutoModel, der lader dig træne Qwen3-0.6B på en enkelt GPU. Nyttig guide for alle …
AI-boomet presser GPU-priserne i vejret
Brugere på r/LocalLLaMA diskuterer de høje priser på GPU'er til lokal AI. Et spring fra RTX 4060 Ti til brugbare modeller koster …
6x3090 vs 8x3090: Er opgraderingen værd?
En bruger overvejer at gå fra seks til otte RTX 3090'ere via en PCIe-splitter for at køre DeepSeek Flash V4 i Q8 …