Søgning
11 briefing-resultat(er) for »rtx-5090«
Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090
Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …
Vision-støtte gør Qwen 3.8 27B til en bedre kodeassistent
… Kører lokalt på en RTX 5090.
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
… 8-27B NVFP4 kører 1.048.576 tokens kontekst på to 5090'er – 119 tok/s med MTP. vLLM's MTP-acceptance falder til …
FreeToken: Kør frontlinje-MoE på din gaming-PC
… s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B på en RTX 5090.
Bruger skifter fra Claude til lokal Qwen3.8 – 'jeg er fri'
En Reddit-bruger rapporterer at have erstattet Claude Pro med en lokal Qwen3.8-27B på en RTX 5090M, og oplever kun få kompromiser.
Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090
Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)
Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090
Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …
Muse Glimmers reasoning traces er kaotiske og repetitive sammenlignet med Qwen og Gemma
… Til gengæld er modellen meget hurtig med DFlash på en RTX 5090.
Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5
En reddit-bruger får fuld 1M kontekst til at køre på en RTX 5090 med 256 GB DDR5 ved hjælp af CPU/RAM-offloading …
Opfølgning: Brugere forsøger at køre Kimi K3 – 80 RTX 5090'er i brug
En bruger har fået K3 til at køre på 80 RTX 5090 via 25GbE. Andre eksperimenterer med llama.cpp og tekst-only (se [briefingen …
1 million kontekst på en RTX 5090 med DeepSeek V4 Flash
DeepSeek V4 Flash kører nu med 1 million tokens kontekst på en enkelt RTX 5090 via llama.cpp. Præstationen er solid, men der er …