News-Tracker

Søgning

AI & LLM · daglig briefing


5 research-rapport(er) for »vram«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… Best LLM model for 128GB of VRAM?](https://www.reddit.com/r/LocalLLaMA/comments/1qbmtuw/best_llm_model_for_128gb_of_vram/) 14. [r …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Sammenlignet med konkurrenterne har Qwen 3.6 27B en fordel i VRAM-behov. [12] angiver, at Q4_K_M-kvantisering lander på cirka 16 …

fredag 7. august 2026 · research

Qwen 3.8 27b

… I en kvantiseringssammenligning opnåede Qwen3.6-27B i Q4_K_M-format 17,5 GB VRAM-forbrug med en HumanEval-pass rate på 74 …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… 16,8 GB VRAM – hvilket passer i et RTX 4080 16GB-kort. Ifølge [10] (Hugging Face, udgivet 22. april 2026) er Qwen3.6-27B …

torsdag 30. juli 2026 · research

elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links

… gemma431b_better_than_qwen3627b/) (brief-arkiv) 31. [Ny teknik muliggør long-context finetuning med begrænset VRAM](https://arxiv.org/abs/2607.15105v1) (brief-arkiv)

lørdag 18. juli 2026 · research

35 briefing-resultat(er) for »vram«

Opfølgning: K2-Horizon-7B benchmarket på 16 GB VRAM – halter efter Qwen

IFM/K2-Horizon-7B gennemfører kun 11 af 15 opgaver på en AMD RX7600XT og scorer lavere end Qwen3.8-27B. Modellen snød desuden …

onsdag 16. september 2026 · Forskning & arkitektur ifm-k2-horizonbenchmark16gb-vram

Gammel GPU kan speede mmproj op til 10x med llama.cpp

Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.

lørdag 12. september 2026 · Værktøjer & produkter llama.cppmmprojgpu-offloadinglocal-llm

Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM

Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …

mandag 7. september 2026 · Forskning & arkitektur layerstormexpert-streamingmoeglm-5.3-flash

Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090

Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …

søndag 6. september 2026 · Forskning & arkitektur tinkerkv-cacheyarnqwen-3.8

Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?

Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …

søndag 6. september 2026 · Værktøjer & produkter llama.cpptensor-parallelismgpu

Hvor meget VRAM til lokalt dokumentmanagement?

… rækker 8-12 GB VRAM til paperless-ai, når man vil stille spørgsmål til egne dokumenter? Fællesskabet peger på 6-10 GB-modeller som …

søndag 6. september 2026 · Værktøjer & produkter local-llmvramdocument-management

Opfølgning: Base-3-pakning skærer 22 % VRAM fra ternære GGUFs

Q2_B3 gemmer -1/0/+1-vægte direkte i base 3 med 1,75 bit pr. vægt; en 27B ternær model falder fra 7 …

lørdag 5. september 2026 · Forskning & arkitektur ternaryq2-b3bitnetllama.cpp

Opfølgning: 21 kvantvarianter af Qwen3.8 27B benchmarket på 16 GB VRAM

Bartowski IQ4_XS var bedst samlet, huihui-ai abliterated bedst uncensored; KLD-målingerne viser stor kvalitetsspredning mellem kvants. Valg af kvant betyder mere end …

lørdag 5. september 2026 · Værktøjer & produkter qwen3.8-27bggufquantizationbenchmark

Opfølgning: Formel for maksimal tokens/sekund ud fra VRAM-båndbredde

Decode-hastigheden kan estimeres som båndbredde divideret med vægt plus KV-cache; eksempel: 637 GB/s over 16,8 GB giver teoretisk 38 tok …

lørdag 5. september 2026 · Værktøjer & produkter tokens-per-secondmemory-bandwidthllama.cppkv-cache

Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?

… 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent KV-cache-VRAM. [Tidligere briefing](/archive/2026-08-28).

lørdag 5. september 2026 · Værktøjer & produkter ggufkv-cachevramqwen3.8-27b

Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s

En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …

tirsdag 1. september 2026 · Nye modeller qwen-3.8performancellama.cppvram

Findes der en god lokal voice-to-voice-model til forbrugergrafikkort?

En Reddit-bruger spørger efter en lokal voice-to-voice-model, der kan køre på 12-24 GB VRAM – noget nyt, ikke to år …

søndag 30. august 2026 · Værktøjer & produkter voice2voicelocal-aisesame-ainvidia

50% hastighedsboost ved at offloade "hot" experts til VRAM

… Giver 20→30 t/s på Qwen3.8 Flash Next, når modellen ikke passer i VRAM. Endnu kun testet på kodning.

lørdag 29. august 2026 · Forskning & arkitektur moevram-offloadinghot-expertsllama.cpp

Opfølgning: Over 200.000 tokens kontekst på 16 GB VRAM med Qwen 3.8 27B

En bruger kører Qwen 3.8 27B med IQ3_XXS-kvantisering og 200k+ kontekst på 16 GB VRAM. Prompt processing falder til 400 tk …

fredag 28. august 2026 · Værktøjer & produkter qwen-3.8long-contextquantizationvram

Nyt community: Lokal AI på gammel hardware

r/LowEndLocalAI er skabt til at køre LLM'er på normale laptops, integreret grafik og begrænset VRAM – med fokus på praktiske workflows.

tirsdag 25. august 2026 · Værktøjer & produkter low-end-hardwarelocal-llmcommunity

ConvRot-kvantisering nu i llama-cpp-turboquant

… Metoden lover at genvinde kvalitet tabt i turbo-quants og understøtter også MoE-cache til modeller større end VRAM.

mandag 24. august 2026 · Forskning & arkitektur convrotquantizationllama.cppturboquant

Opfølgning: PowerColor R9700 til Qwen 3.8 27B – reelle tok/s efterlyses

En bruger overvejer et R9700-kort til Qwen 3.8 27B i Q4_K_XL og spørger efter reelle tok/s ved 64K+ kontekst …

mandag 24. august 2026 · Værktøjer & produkter r9700qwen3.8-27bbenchmarkvram

Bedste kodningsmodel til 6 GB VRAM og 64 GB RAM?

En bruger med begrænset hardware søger en pålidelig lokal kodningsmodel til C, C++, C# og Python – helst ucensureret til sikkerhedsarbejde – med svar på under …

mandag 24. august 2026 · Værktøjer & produkter coding-model6gb-vramlocal-llmuncensored

Opfølgning: DeepSeek V4 Flash q4+ kører på 128 GB RAM + 60 GB VRAM

Trods forventning om kun q2-kvanter lykkes det en bruger at køre DeepSeek V4 Flash i 4-bit+ med acceptable tokens/s på en …

søndag 23. august 2026 · Værktøjer & produkter deepseek-v4-flashquantlocal-llmllama.cpp

16 GB VRAM-skærsilden: deling af konfigurationer til Qwen3.8

Brugere deler tips til at køre Qwen3.8-27B på 16 GB VRAM med Q4_XS, CPU-mmproj og begrænset kontekst. [Se tidligere dækning …

lørdag 22. august 2026 · Nye modeller qwen3.8-27b16gb-vramggufoptimization

Qwen 3.8 27B Q2 vs Q3 vs MoE på 12 GB VRAM – MoE vinder på fart

Test på en RTX 5070 Ti laptop viser, at Qwen 3.6 35B-A3B MoE (Q4) giver 59 t/s og 6/6 korrekte …

mandag 17. august 2026 · Nye modeller qwen-3.827bquantization12gb-vram

Intel Arc B140: 64 GB VRAM til lokal inferens med SYCL

Et show-off-byg med Intel Arc B140 og 64 GB VRAM kører llama.cpp med SYCL-backend på Ubuntu. Intel-hardware er dermed …

søndag 16. august 2026 · Værktøjer & produkter intel-arcllama.cppsycllocal-inference

Jagten på en letvægts agent-harness til 8 GB VRAM

En semi-begynder søger et letvægts-harness med websearch, MCP, filsystem og sandboxet kode til små modeller på RTX 5050. LM Studio duer, Hermes …

søndag 16. august 2026 · Værktøjer & produkter agentic-harnessmcpsmall-modellm-studio

Qwen 30B MoE kører med 30 tps på en RTX 3050 med 6 GB VRAM

En bruger i LocalLLaMA deler, at Qwen 30B MoE opnår 30-35 tokens/sek på en gammel RTX 3050 med 90k kontekst. Bevis på …

fredag 14. august 2026 · Nye modeller qwen-30b-moelocal-llmrtx-3050community

Budget AI-server: RX 9060 XT vs RTX 5060 Ti til 48 GB VRAM

En bruger i Brasilien overvejer 2-3 styk RX 9060 XT 16GB ($490/stk) mod RTX 5060 Ti 16GB ($710/stk) til en dedikeret …

søndag 9. august 2026 · Værktøjer & produkter rx-9060-xtrtx-5060-tiamdbudget-ai-server

Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning

… En anden PR cacher "hot" MoE-eksperter på GPU, hvilket giver 33→56 tok/s på 8GB VRAM. [Se tidligere briefingen](https://www.reddit …

onsdag 5. august 2026 · Forskning & arkitektur llama.cppgpu-samplingspeed-boostmoe

Bruger spørger: Bedste setup til lokal LLM på RTX 3090 og 48 GB RAM

Reddit-bruger søger stabilt OS og framework til coding og web-søgning på 24 GB VRAM. Ollama kørte langsomt, Unsloth var hurtigt men ustabilt.

søndag 26. juli 2026 · Værktøjer & produkter local-llmrtx-3090ollamaunsloth

Opfølgning: Debat om KV-cache-kvantisering på Qwen 3.6

På r/LocalLLaMA diskuteres afvejningen mellem VRAM-besparelser og kvalitetstab ved kvantisering af KV-cache under Q8. Se [briefingen 19. juli](/archive/2026-07 …

mandag 20. juli 2026 · 🗣️ Stemmer qwen-3.6kv-cachequantizationlocal-llm

Google Cloud lancerer 'Always-On Memory Agent' – erstatter RAG og embeddings

En referenceimplementering på Gemini 3.1 Flash-Lite bruger løbende LLM-konsolidering i stedet for vektordatabase, med SQLite som hukommelse.

søndag 19. juli 2026 · Værktøjer & produkter google-cloudmemory-agentgemini-3.1vram-alternative

Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU

En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).

søndag 19. juli 2026 · Værktøjer & produkter deepseek-v4-flashlocal-llm80gb-vrammoe-offloading

Gør klar til Qwen 3.8: Forbered VRAM

Opslag på r/LocalLLaMA opfordrer til at gøre plads i hukommelsen. Den kommende store model kræver betydelige ressourcer.

søndag 19. juli 2026 · Nye modeller qwenvrammodel-launch

Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?

En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …

søndag 19. juli 2026 · Værktøjer & produkter tensor-rtstreaminginference

Ny teknik muliggør long-context finetuning med begrænset VRAM

Hierarchical Global Attention (HGA) kombinerer segment-wise backpropagation og tiered KV-lagring, så kun aktive segmenter forbliver differentiable i VRAM. På Qwin3-8B med …

fredag 17. juli 2026 · Forskning & arkitektur long-contextfine-tuninghgavram-optimization

Kan RAID0 af SSD'er erstatte VRAM til lokal LLM-inference?

… Metoden kunne være en billigere alternativ til dyrt VRAM, men latency og overhead er ukendte faktorer.

fredag 17. juli 2026 · Forskning & arkitektur ssd-raid0local-inferencevram-alternativehardware