Søgning
7 briefing-resultat(er) for »tps«
llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork
En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …
Opfølgning: Qwen3.8-27B når 45+ tps på M-series efter tuning
Bruger deler optimeringsargs, der giver 45+ tokens/sekund på Apple Silicon. [briefingen 17. august](/archive/2026-08-17).
Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer
Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).
Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2
En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …
Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"
… Kl-divergens er en dårlig proxy for egentlig opgaveperformance. [Forrige briefing dækkede 82 tps på RTX 3090](/archive/2026-08-17).
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
Qwen 30B MoE kører med 30 tps på en RTX 3050 med 6 GB VRAM
En bruger i LocalLLaMA deler, at Qwen 30B MoE opnår 30-35 tokens/sek på en gammel RTX 3050 med 90k kontekst. Bevis på …