Søgning
5 research-rapport(er) for »vram«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Best LLM model for 128GB of VRAM?](https://www.reddit.com/r/LocalLLaMA/comments/1qbmtuw/best_llm_model_for_128gb_of_vram/) 14. [r …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Sammenlignet med konkurrenterne har Qwen 3.6 27B en fordel i VRAM-behov. [12] angiver, at Q4_K_M-kvantisering lander på cirka 16 …
Qwen 3.8 27b
… I en kvantiseringssammenligning opnåede Qwen3.6-27B i Q4_K_M-format 17,5 GB VRAM-forbrug med en HumanEval-pass rate på 74 …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… 16,8 GB VRAM – hvilket passer i et RTX 4080 16GB-kort. Ifølge [10] (Hugging Face, udgivet 22. april 2026) er Qwen3.6-27B …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… gemma431b_better_than_qwen3627b/) (brief-arkiv) 31. [Ny teknik muliggør long-context finetuning med begrænset VRAM](https://arxiv.org/abs/2607.15105v1) (brief-arkiv)
35 briefing-resultat(er) for »vram«
Opfølgning: K2-Horizon-7B benchmarket på 16 GB VRAM – halter efter Qwen
IFM/K2-Horizon-7B gennemfører kun 11 af 15 opgaver på en AMD RX7600XT og scorer lavere end Qwen3.8-27B. Modellen snød desuden …
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
Warrior Quest: Lokal LLM spiller kun NPC'er i deterministisk RPG
… Kræver 8 GB VRAM og ingen sky-API.
Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM
Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Hvor meget VRAM til lokalt dokumentmanagement?
… rækker 8-12 GB VRAM til paperless-ai, når man vil stille spørgsmål til egne dokumenter? Fællesskabet peger på 6-10 GB-modeller som …
Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs
Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …
Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM
Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …
Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde
Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
… 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent KV-cache-VRAM. [Tidligere briefing](/archive/2026-08-28).
Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s
En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …
Findes der en god lokal voice-to-voice-model til forbrugergrafikkort?
En Reddit-bruger spørger efter en lokal voice-to-voice-model, der kan køre på 12-24 GB VRAM – noget nyt, ikke to år …
50% hastighedsboost ved at offloade "hot" experts til VRAM
… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.
Opfølgning: Over 200.000 tokens kontekst på 16 GB VRAM med Qwen 3.8 27B
En bruger kører Qwen 3.8 27B med IQ3_XXS-kvantisering og 200k+ kontekst på 16 GB VRAM. Prompt processing falder til 400 tk …
Nyt community: Lokal AI på gammel hardware
r/LowEndLocalAI er skabt til at køre LLM'er på normale laptops, integreret grafik og begrænset VRAM – med fokus på praktiske workflows.
ConvRot-kvantisering nu i llama-cpp-turboquant
… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.
Opfølgning: PowerColor R9700 til Qwen 3.8 27B – reelle tok/s efterlyses
En bruger overvejer et R9700-kort til Qwen 3.8 27B i Q4_K_XL og spørger efter reelle tok/s ved 64K+ kontekst …
Bedste kodningsmodel til 6 GB VRAM og 64 GB RAM?
En bruger med begrænset hardware søger en pålidelig lokal kodningsmodel til C, C++, C# og Python – helst ucensureret til sikkerhedsarbejde – med svar på under …
Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM
Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en …
16 GB VRAM-skærsilden: deling af konfigurationer til Qwen3.8
Brugere deler tips til at køre Qwen3.8-27B på 16 GB VRAM med Q4_XS, CPU-mmproj og begrænset kontekst. [Se tidligere dækning …
Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart
Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …
Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL
Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …
Jagten på en letvægts agent-harness til 8 GB VRAM
En semi-begynder søger et letvægts-harness med websearch, MCP, filsystem og sandboxet kode til små modeller på RTX 5050. LM Studio duer, Hermes …
Qwen 30B MoE kører med 30 tps på en RTX 3050 med 6 GB VRAM
En bruger i LocalLLaMA deler, at Qwen 30B MoE opnår 30-35 tokens/sek på en gammel RTX 3050 med 90k kontekst. Bevis på …
Budget AI-server: RX 9060 XT vs RTX 5060 Ti til 48 GB VRAM
En bruger i Brasilien overvejer 2-3 styk RX 9060 XT 16GB ($490/stk) mod RTX 5060 Ti 16GB ($710/stk) til en dedikeret …
Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning
… En anden PR cacher "hot" MoE-eksperter på GPU, hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit …
Bruger spørger: Bedste setup til lokal LLM på RTX 3090 og 48 GB RAM
Reddit-bruger søger stabilt OS og framework til coding og web-søgning på 24 GB VRAM. Ollama kørte langsomt, Unsloth var hurtigt men ustabilt.
Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6
På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …
Google Cloud lancerer 'Always-On Memory Agent' – erstatter RAG og embeddings
En referenceimplementering på Gemini 3.1 Flash-Lite bruger løbende LLM-konsolidering i stedet for vektordatabase, med SQLite som hukommelse.
Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU
En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).
Gør klar til Qwen 3.8: Forbered VRAM
Opslag på r/LocalLLaMA opfordrer til at gøre plads i hukommelsen. Den kommende store model kræver betydelige ressourcer.
Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?
En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …
Ny teknik muliggør long-context finetuning med begrænset VRAM
Hierarchical Global Attention (HGA) kombinerer segment-wise backpropagation og tiered KV-lagring, så kun aktive segmenter forbliver differentiable i VRAM. På Qwin3-8B med …
Kan RAID0 af SSD'er erstatte VRAM til lokal LLM-inference?
… Metoden kunne være en billigere alternativ til dyrt VRAM, men latency og overhead er ukendte faktorer.