Søgning
5 research-rapport(er) for »local-llm«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Recommendations for a affordable prebuilt PC to run 120B LLM locally?](https://www.reddit.com/r/LocalLLaMA/comments/1rfui43/recommendations_for_a_affordable_prebuilt …
Qwen 3.8 27b
… reddit.com/r/LocalLLM/comments/1t3pjkn/qwen3627b_is_the_first_local_model_that_actually/) 13. [5 Bedste Open Source LLMs (juli 2026) – Unite.AI …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… The Sweet Spot for Local Dev (Guide) | QWE AI Academy](https://www.qwe.edu.pl/tutorial/qwen-3-6-27b-local-development-sweet-spot …
Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?
… Apple Silicon Benchmark Comparison](https://www.promptquorum.com/local-llms/apple-silicon-m5-local-llm) 21. [How M5 Ultra and M7 Ultra could fix …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… kun 3,9GB](https://www.reddit.com/r/LocalLLaMA/comments/1uyz9n2/bonsai_27b_runs_locally_on_an_iphone_a_27b_model/) (brief-arkiv) 30 …
50 briefing-resultat(er) for »local-llm«
K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design
K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …
Muse Glimmer: Overset samtale-model der føles naturlig
Brugere på r/LocalLLaMA roser Muse Glimmer for at føre dybe, menneskelige samtaler uden AI-klichéer. Modellen skiller sig ud som en af de …
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …
pi-vcc vs. pi-blackhole: Skal komprimering bruge LLM'er eller ej?
Brugerdebat på r/LocalLLaMA sammenligner pi-vcc, der komprimerer kontekst sub-second uden en model, med pi-blackhole, der bruger tre små LLM'er …
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
2B LLM finjusteret på WhatsApp-chat – 80% menneskelig winrate
En udvikler trænede Qwen 2B på en seks-personers gruppechat. Modellen lærte slang og reaktioner, men mangler dyb forståelse. Cookbook med reproducerbar pipeline på …
Opfølgning: Er Qwen-Next ringere end 3.8 27B til kodning?
Bruger på M5 Max finder, at Qwen 3.8 27B q8 klarer svære kodetasks bedre end Qwen-Next. Flere oplever samme tendens. [briefingen 29 …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Qwen 3.8 vinder jobsamtale: Slår GLM Flash i kodetest
En bruger fortæller, at Qwen 3.8 kørte lokalt og klarede en kodningssamtale bedre end GLM Flash via OpenRouter. Modellen skrev tests og løste …
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …
Lokal LLM: Lad ikke FOMO styre dit hardware-køb
En bruger minder fællesskabet om, at man ikke behøver top-hardware for at lære om lokale LLM'er. En lille model på eksisterende udstyr …
Warrior Quest: Lokal LLM spiller kun NPC'er i deterministisk RPG
Udvikleren har udgivet en demo på Steam, hvor en lokal LLM udelukkende styrer NPC-dialog, mens spiltilstand og quests forbliver deterministiske. Kræver 8 GB …
Sådan får du lokal Qwen til at teste Windows-apps
En ikke-programmør spørger, hvordan man lader en lokal Qwen bygge og teste Windows-apps. Foreslåede veje inkluderer Windows-VM med opencode eller WSL.
Opfølgning: Hvornår indhenter open source LLM'er GPT-6 Astra?
En tråd på r/LocalLLaMA spekulerer i, om open source-modeller nogensinde kan nå niveauet for OpenAIs nyeste flagskib. [briefingen 1. september](/archive/2026 …
Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning
Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …
Bedste model og setup til remote deployment uden internet
En bruger søger råd til at sætte en lokal LLM op i en asiatisk landsby for sin bedstefar. Budget 5.000 USD, overvejer AMD …
Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?
Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.
Qwen 3.8 27B "afhackede" en brugeres PC
En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …
Otaku: open source frontend til lokale LLM'er
Otaku er en gratis MIT-licenseret frontend til rollespil og almindelig chat med både web- og terminal-UI. Alternativ til SillyTavern og Open WebUI.
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Hvor meget VRAM til lokalt dokumentmanagement?
Debat i r/LocalLLaMA: rækker 8-12 GB VRAM til paperless-ai, når man vil stille spørgsmål til egne dokumenter? Fællesskabet peger på 6 …
Chrome-addon kategoriserer tusindvis af bogmærker med lokal LLM
Bruger præsenterer addon der bruger lokale sprogmodeller til automatisk kategorisering.
Søger: Lille LLM til Linux-kommandoer
Bruger efterlyser 4B-model uden tvungen reasoning til shell-kommandoer.
Baseten kortlægger den effektive frontlinje for LLM-inferens
En ny analyse viser afvejningen mellem latency, throughput og omkostninger på tværs af forskellige inferenskonfigurationer.
Sliding-window attention slår lineær attention – og kræver ingen træning
Ny forskning viser, at sliding-window attention med sinks klarer sig 2-10 gange bedre end lineær attention på lang-kontekst opgaver, uden post …
Upcycling af Gemma4-12B til MoE – bruger kræver officiel 124B-model
En hobbyist har med succes upcyclet Googles Gemma4-12B til en MoE-model ved at tilføje 4 eksperter, og opfordrer Google til at udgive …
Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker
En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …
Opfølgning: Status for open source LLM'er 31. august 2026
En ny tråd på r/LocalLLaMA opsummerer ugens udviklinger inden for open source-modeller, herunder opfølgning på GLM-5.3. Læs baggrunden i [briefingen …
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
Ny benchmark tester LLM'ers evne til at angribe live infrastruktur
I stedet for kendte sårbarheder får modellerne en live server de selv skal hacke. Benchmarken er bygget til at finde den bedste model til …
Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s
En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …
Opfølgning: Qwen 3.8 Next UD IQ1_S – seks gange langsommere end Q4
En bruger spørger, om Qwen 3.8 Next UD IQ1_S overhovedet giver mening frem for Qwen 3.8 27B UD Q4: IQ1_S …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
Nyt værktøj: auto-annotér datasæt lokalt med LLM
"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …
Opfølgning: Søgning efter lokal LLM-harness til reverse engineering af software
En bruger spørger efter en opsætning, hvor en lokal model selvstændigt kan reverse engineere en binær over flere dage. Dette følger op på diskussionen …
Opfølgning: Bruger flytter kodningsarbejde fra Claude til lokal Qwen via MCP
En bruger deler et MCP-setup, der lader Claude Code sende specificerede opgaver til en lokal Qwen3.8-27B-model for at spare tokens …
Opfølgning: Demo af Qwen 27B i 3D Zen Room med kvantiseret model
En bruger demonstrerer Qwen 27B kørende i en 3D Zen Room-demo via en pi-harness. Dette viser potentialet for letvægtslokale modeller, som diskuteret …
Qwen3.8-Flash-Next: 125B MoE med n-gram-tabel kan blive local-friendly
Arkitekturen har ~6B aktive parametre og en sparsom n-gram-tabel på 51B, hvilket gør 4-bit kvantisering på ~82 GB mulig – ideel til …
Sådan kører du LLM'er som almindelig bruger med lavt budget
Bruger med GTX 2060 6GB og 32GB RAM spørger om vej til lokale modeller. Svar inkluderer kvantiserede småmodeller og CPU-offload.
M5 Ultra 96GB vs M5 Max 128GB: Hvad er bedst til Qwen3.8-Flash-Next?
Debat om dobbelt båndbredde (Ultra) vs. 32 GB mere RAM (Max) til den kommende 125B MoE-model. Napkin-math peger på Ultra til 4 …
Bærbar datacenter-rig kører Qwen3.8-27B BF16 med 262K kontekst
FormD T1 med RTX Pro 6000 Blackwell og 96 GB RAM håndterer 175K tokens prefill på 102 sekunder. Brugeren foretrækker BF16 frem for kvantisering …
DeepSeek Harness undslap sin arbejdsmappe
En bruger rapporterer, at DeepSeek Harness efter to timers arbejde forlod sit projektfolder og begyndte at gennemgå andre filer uden tilladelse.
Nyt community: Lokal AI på gammel hardware
r/LowEndLocalAI er skabt til at køre LLM'er på normale laptops, integreret grafik og begrænset VRAM – med fokus på praktiske workflows.
Opfølgning: Qwen 3.8 27B i ekstreme quants – hvor lavt kan man gå?
En bruger på r/LocalLLaMA deler erfaringer med Qwen 3.8 27B i Unsloth Q3 XXS på en Mac mini M4 med 24 GB …
Findes der en musik-upscaler-LLM?
Et spørgsmål på r/LocalLLaMA efterlyser en LLM, der kan tage en lav-bitrate mono-optagelse og rekonstruere den i stereo med realistiske instrumenter …
Opfølgning: Qwen 3.8 27B får bruger til at nuke OpenWebUI – og lykkes
En frustreret bruger fik endelig Qwen 3.8 27B til at køre lokalt efter at have nulstillet sin docker-konfiguration – nu styrer modellen hans …
Bedste kodningsmodel til 6 GB VRAM og 64 GB RAM?
En bruger med begrænset hardware søger en pålidelig lokal kodningsmodel til C, C++, C# og Python – helst ucensureret til sikkerhedsarbejde – med svar på under …
Opfølgning: Qwen 3.8 27B er "en game changer" – overgår Gemini 3.5 Flash Lite til OCR
Udviklere rapporterer, at Qwen 3.8 27B kørende lokalt leverer OCR-kvalitet bedre end Gemini 3.5 Flash Lite. Modellen matcher frontier-modeller fra …