News-Tracker

Søgning

AI & LLM · daglig briefing


5 research-rapport(er) for »performance«

Qwen 3.8 27b

… ThinkingCap Performance - Geeky Gadgets](https://www.geeky-gadgets.com/thinkingcap-local-coding-model/) 8. [Qwen3: Think Deeper, Act Faster | Qwen](https://qwenlm.github.io …

mandag 3. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Benchmarking LLMs for System-Level High-Performance Code Optimization](https://arxiv.org/html/2605.15222) 3. [Evidence-backed assessment: Gemma 4 12B versus Qwen …

torsdag 30. juli 2026 · research

Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?

… M7 Ultra targets 1.5TB of memory and Blackwell-class AI performance, report claims — monster 2028 offering would depend on memory shortage easing | Tom …

onsdag 22. juli 2026 · research

bedste elbil under 300000 kr i danmark 2026

… 405 km [4][29] | 435 hk [3][29] | Hatchback | Med — ekstrem performance under 300.000 kr. | | Hyundai Kona Electric Standard Range | 219.995 kr …

lørdag 18. juli 2026 · research

elbiler i danmark med 270+ hk, ikke over 550K DKK, og ikke nogen Tesla eller SUV. Lav oversigt med links

… Med – 421 hk, 4WD, 596 km rækkevidde | | **Polestar 2 Prime Edition Performance (476 hk)** | 476 hk [9] | 444.900 kr. [9] | Fastback | Med – 476 …

lørdag 18. juli 2026 · research

14 briefing-resultat(er) for »performance«

Er 5 t/s brugbart til en lokal model? Ja, siger bruger

En bruger kører Qwen 3.8 27B på en iGPU og DDR5 med 5 t/s og finder det mere brugbart end 20 t …

torsdag 10. september 2026 · Forskning & arkitektur qwen-3.8local-llmperformanceliability

Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?

Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …

søndag 6. september 2026 · Værktøjer & produkter llama.cpptensor-parallelismgpu

Opfølgning: llama.cpp ændrer standard for --lazy-mode – giver hastighedsstraf

Fra b10726 lægges store tabeller som Qwen 3.8 Flash Nexts PLE-embedding ikke længere i RAM som standard, hvilket gav 50% prefill-straf …

tirsdag 1. september 2026 · Værktøjer & produkter llama.cppqwen-3.8memoryperformance

Opfølgning: Qwen3.8 Flash Next testet fra CPU til 96 GB VRAM – 109 tok/s

En detaljeret benchmark af Qwen3.8 Flash Next i llama.cpp viser 109 tok/s på 96 GB VRAM og 8,34 tok/s …

tirsdag 1. september 2026 · Nye modeller qwen-3.8performancellama.cppvram

N-gram-tabel på SSD streamet i SGLang – uden performance-tab?

En bruger spørger, om nogen har testet at offloade Qwen 3.8 Flash Nexts n-gram-opslagstabel til SSD og streame den i SGLang …

lørdag 29. august 2026 · Forskning & arkitektur qwen3.8-flash-nextn-gramssd-offloadingsolana

450M VLM finetunet på 50.000 browserscreenshots – fra 1% til 44%

En bruger på r/LocalLLaMA deler resultater af at fine-tune en 450M vision-language-model på 50.000 browserscreenshots, hvilket løftede performance fra …

mandag 24. august 2026 · Forskning & arkitektur fine-tuningvlmbrowser-screenshots450m

Opfølgning: Qwen3.8-27B når 45+ tps på M-series efter tuning

Bruger deler optimeringsargs, der giver 45+ tokens/sekund på Apple Silicon. [briefingen 17. august](/archive/2026-08-17).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8optimizationm-seriesperformance

Opfølgning: Ornith-1.5 35B kører 60 tok/s på et enkelt 4070 Ti

Med Q4_K_M og 27 aktive eksperter opnås 50–56 tok/s på en 12 GB GPU. Konteksten er 32K, men modellen er …

torsdag 20. august 2026 · Nye modeller ornith-1.5local-llm4070tiperformance

Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090

Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …

tirsdag 11. august 2026 · Nye modeller muse-glimmerspeculative-decodingperformancertx-5090

Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM

På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …

tirsdag 11. august 2026 · Nye modeller ling-3.0-flashstrix-halovllmperformance

Opfølgning: Tokenisering afslører Qwens kode-fordel over Gemma

Samme kode på 330 linjer blev til 1609 tokens i Qwen 35B mod 4258 i Gemma 26B. Qwen behandler kode som et specifikt inputformat …

søndag 9. august 2026 · Forskning & arkitektur tokenizationqwengemmacoding-performance

FastFlowLM slutter sig til AMD for at fremme AI-inferens

FastFlowLM's letvægts inferenssoftware bliver en del af AMDs strategi for at forbedre AI-performance og effektivitet på tværs af hardwarestacken.

lørdag 18. juli 2026 · Branche & politik amdfastflowlminferencehpc

Kimi K3 slår Claude Sonnet 5 på Simple Bench

Kimi K3 (max) har demonstreret overlegen performance ved at slå Claude Sonnet 5 på Simple Bench. Resultatet understøtter Moonshot AI's påstande om, at …

fredag 17. juli 2026 · Nye modeller kimi-k3benchmarkmoonshot-ai

Claude Platform Docs opdateret med modeloversigt

Anthropic har opdateret dokumentationen med en oversigt over tilgængelige Claude-modeller og deres performance-sammenligninger.

fredag 17. juli 2026 · Forskning & arkitektur claude-modelsanthropicmodel-comparison