News-Tracker

Søgning

AI & LLM · daglig briefing


11 briefing-resultat(er) for »rtx-5090«

Opfølgning: NInfer-fork skubber 555k kontekst på en enkelt 5090

Ny fork leverer 555k kontekst i FP4 på en RTX 5090 med NVFP4 KV-cache, Hadamard-rotation og YaRN – 45 % mindre VRAM uden kvalitetstab …

søndag 6. september 2026 · Forskning & arkitektur tinkerkv-cacheyarnqwen-3.8

Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork

… 8-27B NVFP4 kører 1.048.576 tokens kontekst på to 5090'er – 119 tok/s med MTP. vLLM's MTP-acceptance falder til …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8tinker1m-contextrtx-5090

FreeToken: Kør frontlinje-MoE på din gaming-PC

… s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B på en RTX 5090.

tirsdag 25. august 2026 · Forskning & arkitektur freetokenmoeedge-inferencecpu-gpu

Bruger skifter fra Claude til lokal Qwen3.8 – 'jeg er fri'

En Reddit-bruger rapporterer at have erstattet Claude Pro med en lokal Qwen3.8-27B på en RTX 5090M, og oplever kun få kompromiser.

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8local-llmclaudecoding

Opfølgning: DFlash2 giver Qwen 3.8 27B op til 200 tk/s på RTX 5090

Ny spekulativ dekodningsteknik i llama.cpp øger hastigheden markant på kodegenerering, men kræver mere hukommelse. [briefingen 8. august](/archive/2026-08-08)

onsdag 19. august 2026 · Værktøjer & produkter dflash2qwen-3.8llama.cppspeculative-decoding

Opfølgning: Muse Glimmer 30B rammer 280 t/s med spekulativ dekodning på RTX 5090

Muse Glimmer 30B (Q6_K_XL) med DFlash spekulativ dekodning opnår op til 287 tokens/sek på en enkelt RTX 5090 i llama.cpp …

tirsdag 11. august 2026 · Nye modeller muse-glimmerspeculative-decodingperformancertx-5090

Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5

En reddit-bruger får fuld 1M kontekst til at køre på en RTX 5090 med 256 GB DDR5 ved hjælp af CPU/RAM-offloading …

onsdag 5. august 2026 · Forskning & arkitektur deepseek-v4-flash1m-contextrtx-5090local-llm

Opfølgning: Brugere forsøger at køre Kimi K3 – 80 RTX 5090'er i brug

En bruger har fået K3 til at køre på 80 RTX 5090 via 25GbE. Andre eksperimenterer med llama.cpp og tekst-only (se [briefingen …

tirsdag 28. juli 2026 · Nye modeller kimi-k3local-llmrtx-5090llama.cpp

1 million kontekst på en RTX 5090 med DeepSeek V4 Flash

DeepSeek V4 Flash kører nu med 1 million tokens kontekst på en enkelt RTX 5090 via llama.cpp. Præstationen er solid, men der er …

fredag 17. juli 2026 · Værktøjer & produkter deepseek-v4-flashllama.cpprtx-5090local-llm