Søgning
2 briefing-resultat(er) for »1m-context«
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
… vLLM's MTP-acceptance falder til nul ved 262K; NInfer holder ~55-60% helt til 1M. [briefingen 17. august](/archive/2026-08-17)
Opfølgning: DeepSeek V4 Flash kører med 1M kontekst på en enkelt RTX 5090 + DDR5
En reddit-bruger får fuld 1M kontekst til at køre på en RTX 5090 med 256 GB DDR5 ved hjælp af CPU/RAM-offloading …