News-Tracker

Søgning

AI & LLM · daglig briefing


7 briefing-resultat(er) for »tps«

llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork

En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …

tirsdag 15. september 2026 · Værktøjer & produkter llama.cpp3090ampereoptimization

Opfølgning: Qwen3.8-27B når 45+ tps på M-series efter tuning

Bruger deler optimeringsargs, der giver 45+ tokens/sekund på Apple Silicon. [briefingen 17. august](/archive/2026-08-17).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8optimizationm-seriesperformance

Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer

Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).

fredag 21. august 2026 · Værktøjer & produkter qwen-3.8inference-optimizationrtx-3090tps

Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2

En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …

torsdag 20. august 2026 · Nye modeller qwen-3.8dflash2inferenceoptimizationrtx-3090

Opfølgning: Reddit benchmarker quants – "vi benchmarker modeller ingen kører"

… Kl-divergens er en dårlig proxy for egentlig opgaveperformance. [Forrige briefing dækkede 82 tps på RTX 3090](/archive/2026-08-17).

tirsdag 18. august 2026 · Forskning & arkitektur benchmarkquantizationqwen-3.8local-llm

Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090

En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …

mandag 17. august 2026 · Værktøjer & produkter qwen-3.8rtx-3090vllmoptimization

Qwen 30B MoE kører med 30 tps på en RTX 3050 med 6 GB VRAM

En bruger i LocalLLaMA deler, at Qwen 30B MoE opnår 30-35 tokens/sek på en gammel RTX 3050 med 90k kontekst. Bevis på …

fredag 14. august 2026 · Nye modeller qwen-30b-moelocal-llmrtx-3050community