Søgning
1 research-rapport(er) for »optimization«
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Benchmarking LLMs for System-Level High-Performance Code Optimization](https://arxiv.org/html/2605.15222) 3. [Evidence-backed assessment: Gemma 4 12B versus Qwen …
13 briefing-resultat(er) for »optimization«
llamAmpere: 90+ TPS på en RTX 3090 med specialiseret llama.cpp-fork
En custom fork af llama.cpp optimeret til Ampere-arkitekturen leverer API-hastigheder lokalt på en 3090 med op til 240K kontekst. Et kvantespring …
Opfølgning: 22 tokens/sek – Qwen3.8 Flash Next på 32GB MacBook Air
Cherenkov-inference engine slår rekord på Apple Silicon ved at streame eksperter prædiktivt fra SSD og falde tilbage til lavere kvantisering ved pres. [Se …
Qwen3.8-Flash-Next: 2,5x hurtigere prefill ved at smide expert-cache ud af GPU'en
En bruger opnår 2,2-2,5x hurtigere prefill på Qwen3.8-Flash-Next ved at rydde expert-cachen fra GPU'en under prompt …
50 PRs fra hurtigere CPU-inference i llama.cpp
En liste over åbne PRs til llama.cpp viser massiv aktivitet omkring CPU/RAM/hybrid-optimering: AVX-512, MoE expert-caching, streamede vægte og …
Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision
En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …
16 GB VRAM-skærsilden: deling af konfigurationer til Qwen3.8
Brugere deler tips til at køre Qwen3.8-27B på 16 GB VRAM med Q4_XS, CPU-mmproj og begrænset kontekst. [Se tidligere dækning …
Opfølgning: Qwen3.8-27B når 45+ tps på M-series efter tuning
Bruger deler optimeringsargs, der giver 45+ tokens/sekund på Apple Silicon. [briefingen 17. august](/archive/2026-08-17).
Opfølgning: Qwen3.8-27B når 381 tps på RTX 3090 med nye optimeringer
Bruger opnår 382 tps ved at forlænge verify-blokke og bruge int8 KV-cache. [briefingen 20. august](/archive/2026-08-20).
Opfølgning: Qwen3.8-27B når 138 tps på RTX 3090 med DFlash2
En hyperoptimeret inference-engine med DFlash2-drafter og int4-kvantisering presser ydelsen til 138 tok/s. Opfølgning i lange samtaler koster nu kun ét …
Opfølgning: Qwen 3.8 27B kører 82 tps på en enkelt RTX 3090
En bruger har optimeret inference til 82 tokens/sekund på en 3090 med W4A16-kvantisering og fp8 KV-cache – op til 672 tps peak …
OpenAI sænker prisen på GPT-5.6 Luna med 80 %
OpenAI har brugt GPT-5.6 Sol til at optimere inferenskerner og sænke omkostningerne. Luna koster nu $0,20/mio. input-tokens – billigere end …
Opfølgning: 29x kernel-hastighed gav kun 6–10 % reel gevinst
En udvikler optimerede en matmul-kernel til BitNet 29x isoleret set, men end-to-end-forbedringen var minimal pga. hukommelsesflaskehals. En vigtig lektion i …
Ny teknik muliggør long-context finetuning med begrænset VRAM
Hierarchical Global Attention (HGA) kombinerer segment-wise backpropagation og tiered KV-lagring, så kun aktive segmenter forbliver differentiable i VRAM. På Qwin3-8B med …