Søgning
7 research-rapport(er) for »llm«
Metas AI-model hackede en tredjepart under sikkerhedstest
… Improving LLM Safety with Multi-round Automatic Red-Teaming | Research - AI at Meta](https://ai.meta.com/research/publications/mart-improving-llm-safety-with …
Metas AI-model hackede en tredjepart under sikkerhedstest
… But its amped-up AI agents are confusing Facebook users](https://apnews.com/article/meta-ai-assistant-llama3-large-language-models-llm-229b386ebfbdc23f0e9245a68f7eb2d0)
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Best LLM model for 128GB of VRAM?](https://www.reddit.com/r/LocalLLaMA/comments/1qbmtuw/best_llm_model_for_128gb_of_vram/) 14. [r …
Qwen 3.8 27b
… Hvordan får du adgang til Alibabas nyeste open source LLM? - CometAPI - Alle AI-modeller i én API](https://www.cometapi.com/da/qwen-3 …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Benchmarking LLMs for System-Level High-Performance Code Optimization](https://arxiv.org/html/2605.15222) 3. [Evidence-backed assessment: Gemma 4 12B versus Qwen …
Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?
… Apple Silicon Benchmark Comparison](https://www.promptquorum.com/local-llms/apple-silicon-m5-local-llm) 21. [How M5 Ultra and M7 Ultra could fix …
elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links
… 3391700) 28. [XPengs nye L03-SUV udfordrer Tesla og BMW med LLM-styring](https://motortrend.com/news/xpeng-mona-l03-chinese-suv-first-look …
50 briefing-resultat(er) for »llm«
K2 Horizon benchmark: Imponerende intelligens, men grimt KV-cache-design
K2 Horizon-modellerne scorer højt på Artificial Analysis, men kræver uforholdsmæssigt meget RAM til kontekst. Sammenlignet med Qwen3.6 og MiniCPM5 er de mindre …
Muse Glimmer: Overset samtale-model der føles naturlig
… Modellen skiller sig ud som en af de bedste til chat blandt lokale LLM'er. [Opfølgning: se [briefingen 6. september](/archive/2026-09-06)]
Opfølgning: 14 nye papirer kortlægger jailbreak-landskabet – fra multi-turn til forsvar
En række nye forskningsartikler systematiserer multi-turn jailbreak-angreb mod multimodale LLM'er og præsenterer forsvar som TRYLOCK og Attention Slipping. Angrebene udnytter, at …
Opfølgning: Qwen3.8 27b bygger spil på 5 timer – open source på RTX 3090
En bruger tester Qwen3.8 27b's maksimale ydeevne ved at lade modellen bygge et helt spil på fem timer. Projektet bliver open source …
pi-vcc vs. pi-blackhole: Skal komprimering bruge LLM'er eller ej?
Brugerdebat på r/LocalLLaMA sammenligner pi-vcc, der komprimerer kontekst sub-second uden en model, med pi-blackhole, der bruger tre små LLM'er …
Opfølgning: Adaptiv probe-styring gør jailbreaks mere robuste
Ny forskning viser, at adaptive prober kan finde og manipulere refusal-retningen i LLM'ers interne repræsentationer og dermed jailbreake modeller mere pålideligt. Se …
Ny oversigt samler LLM-agenters hukommelsesarkitekturer
Surveyen kortlægger modulære hukommelsesstrategier for langtidshorisonter, herunder et neuro-symbolsk dobbelt-hukommelsesframework.
Opfølgning: ICE-Guard afslører systematisk bias i LLM-beslutninger
Frameworket tester interventionskonsistens og finder, at navneændringer kan vende domme – et tegn på spurielle features. Se [briefingen 12. september](/archive/2026-09-12).
Gammel GPU kan speede mmproj op til 10x med llama.cpp
Ét flag – `--mmdev CUDA1` – kan lade en sekundær, langsom GPU håndtere vision mmproj og frigøre VRAM til inferens. Praktisk hack til lokal multi-GPU.
2B LLM finjusteret på WhatsApp-chat – 80% menneskelig winrate
En udvikler trænede Qwen 2B på en seks-personers gruppechat. Modellen lærte slang og reaktioner, men mangler dyb forståelse. Cookbook med reproducerbar pipeline på …
Opfølgning: Er Qwen-Next ringere end 3.8 27B til kodning?
Bruger på M5 Max finder, at Qwen 3.8 27B q8 klarer svære kodetasks bedre end Qwen-Next. Flere oplever samme tendens. [briefingen 29 …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
Qwen 3.8 vinder jobsamtale: Slår GLM Flash i kodetest
En bruger fortæller, at Qwen 3.8 kørte lokalt og klarede en kodningssamtale bedre end GLM Flash via OpenRouter. Modellen skrev tests og løste …
Qwen 3.8 27B kører på RTX 3060 med 10-20 tokens/sekund
En bruger får Qwen 3.8 27B til at køre på en enkelt RTX 3060 med IQ3-kvantisering og opnår 10-20 t/s …
Er 5 t/s brugbart til en lokal model? Ja, siger bruger
En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …
Lokal LLM: Lad ikke FOMO styre dit hardware-køb
En bruger minder fællesskabet om, at man ikke behøver top-hardware for at lære om lokale LLM'er. En lille model på eksisterende udstyr …
Warrior Quest: Lokal LLM spiller kun NPC'er i deterministisk RPG
Udvikleren har udgivet en demo på Steam, hvor en lokal LLM udelukkende styrer NPC-dialog, mens spiltilstand og quests forbliver deterministiske. Kræver 8 GB …
Sådan får du lokal Qwen til at teste Windows-apps
En ikke-programmør spørger, hvordan man lader en lokal Qwen bygge og teste Windows-apps. Foreslåede veje inkluderer Windows-VM med opencode eller WSL.
Opfølgning: Hvornår indhenter open source LLM'er GPT-6 Astra?
En tråd på r/LocalLLaMA spekulerer i, om open source-modeller nogensinde kan nå niveauet for OpenAIs nyeste flagskib. [briefingen 1. september](/archive/2026 …
Opfølgning: DeepSeek V4 Flash vs. Qwen3.8 Flash Next – praktisk sammenligning
Brugerrapport viser, at DeepSeek V4 Flash er 40% langsommere men fuldfører opgaver dobbelt så hurtigt som Qwen3.8 Flash Next. [briefingen 31. august](/archive …
Bedste model og setup til remote deployment uden internet
En bruger søger råd til at sætte en lokal LLM op i en asiatisk landsby for sin bedstefar. Budget 5.000 USD, overvejer AMD …
Råd til billig GPU til lokal LLM – 2080 Ti 22 GB eller MI50 32 GB?
Bruger med 700 USD budget overvejer modificerede GPU'er fra Kina til at køre Qwen 3.8 27B Q4_K_M.
BASE Search Marketing lancerer nyt klientportal og fokuserer på LLM SEO
Virksomheden annoncerer opdateringer til deres portal og skriver om vigtigheden af LLM SEO i 2026.
Qwen 3.8 27B "afhackede" en brugeres PC
En r/LocalLLaMA-bruger fik en RAT installeret via et ondsindet site og brugte Qwen 3.8 27B til at rense maskinen. Lokale modeller …
Otaku: open source frontend til lokale LLM'er
Otaku er en gratis MIT-licenseret frontend til rollespil og almindelig chat med både web- og terminal-UI. Alternativ til SillyTavern og Open WebUI.
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Hvor meget VRAM til lokalt dokumentmanagement?
Debat i r/LocalLLaMA: rækker 8-12 GB VRAM til paperless-ai, når man vil stille spørgsmål til egne dokumenter? Fællesskabet peger på 6 …
Opfølgning: GPT-6 Astra ruller nu ud via API og OpenRouter
API-modellen får navnet gpt-6-astra; latent.space kalder det OpenAIs største LLM-lancering nogensinde. Simon Willison og OpenRouter bekræfter adgang. [Tidligere briefing …
Chrome-addon kategoriserer tusindvis af bogmærker med lokal LLM
Bruger præsenterer addon der bruger lokale sprogmodeller til automatisk kategorisering.
Søger: Lille LLM til Linux-kommandoer
Bruger efterlyser 4B-model uden tvungen reasoning til shell-kommandoer.
Baseten kortlægger den effektive frontlinje for LLM-inferens
En ny analyse viser afvejningen mellem latency, throughput og omkostninger på tværs af forskellige inferenskonfigurationer.
Sliding-window attention slår lineær attention – og kræver ingen træning
Ny forskning viser, at sliding-window attention med sinks klarer sig 2-10 gange bedre end lineær attention på lang-kontekst opgaver, uden post …
Upcycling af Gemma4-12B til MoE – bruger kræver officiel 124B-model
En hobbyist har med succes upcyclet Googles Gemma4-12B til en MoE-model ved at tilføje 4 eksperter, og opfordrer Google til at udgive …
Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker
En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …
Opfølgning: Status for open source LLM'er 31. august 2026
En ny tråd på r/LocalLLaMA opsummerer ugens udviklinger inden for open source-modeller, herunder opfølgning på GLM-5.3. Læs baggrunden i [briefingen …
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
Ny benchmark tester LLM'ers evne til at angribe live infrastruktur
I stedet for kendte sårbarheder får modellerne en live server de selv skal hacke. Benchmarken er bygget til at finde den bedste model til …
Benchmark måler time-to-first-token på tværs af hele voice-stakken
Undersøgelsen dækker LLM, speech-to-text, text-to-speech og speech-to-speech. Voice-agents fejler på latency længe før de fejler på intelligens.
LLM-moats fordamper – åbne vægte gør forskellen
Hackaday argumenterer for at konkurrencefordele baseret på proprietære sprogmodeller hurtigt forsvinder. Åbne vægte og faldende træningsomkostninger udvisker forskellen.
Opfølgning: Qwen 3.8 Flash Next kører på mobil – 3,5 tok/s
En 80B-model kører på en Android-telefon til 400-500 dollars. Kraftig kvantisering på den tætte del gør det muligt på 12 GB …
AWS g6 leverer 3,7x throughput vs. g5g til LLM-serving
Gemma 4 E2B i ren JAX på g6.2xlarge vs. g5g.2xlarge. Den ældre instans mister 87% af decode-tiden til dtype-konvertering – uden …
Google WikiSkill giver AI-agenter en hukommelse, der lærer af fejl
Inspireret af Andrej Karpathys "LLM Wiki" giver WikiSkill agenter en vedvarende wiki, der opdateres med erfaringer, så en 9B-model kan overgå en 27B …
Opfølgning: Qwen 3.8 Next UD IQ1_S – seks gange langsommere end Q4
En bruger spørger, om Qwen 3.8 Next UD IQ1_S overhovedet giver mening frem for Qwen 3.8 27B UD Q4: IQ1_S …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
En bruger frigav imatrix-quants til Qwen3.8-Flash-Next, der sparer 20-30 GB disk og RAM sammenlignet med Unsloth/AesSedai Q4, med …
Nyt værktøj: auto-annotér datasæt lokalt med LLM
"llmog" lader dig bruge lokale LLM'er (llama.cpp, vLLM) til automatisk at annotere datasæt og reklassificere YOLO-datasæt – helt uden cloud. Open source …
Opfølgning: AI-penetrationstestning – hvordan prompt injection udnytter LLM'ers arkitektur
En ny guide forklarer, hvordan instruktioner og brugerinput deler samme kanal, hvilket er roden til prompt injection. Agent-værktøjer gør problemet værre, da et …
Opfølgning: gemma4.c – en moderne LLM på 700 linjer C, hurtigere end llama.cpp
En udvikler har skrevet en komplet inferens-runtime til Gemma 4 E2B i 700 linjer C. På en Ryzen 7 7700 opnås 639 tok …
Opfølgning: Søgning efter lokal LLM-harness til reverse engineering af software
En bruger spørger efter en opsætning, hvor en lokal model selvstændigt kan reverse engineere en binær over flere dage. Dette følger op på diskussionen …
Opfølgning: Bruger flytter kodningsarbejde fra Claude til lokal Qwen via MCP
En bruger deler et MCP-setup, der lader Claude Code sende specificerede opgaver til en lokal Qwen3.8-27B-model for at spare tokens …
Opfølgning: Demo af Qwen 27B i 3D Zen Room med kvantiseret model
En bruger demonstrerer Qwen 27B kørende i en 3D Zen Room-demo via en pi-harness. Dette viser potentialet for letvægtslokale modeller, som diskuteret …