News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »throughput«

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Flere unikke detaljer optræder kun i enkelte kilder. [7] indeholder specifikke throughput-målinger på Apple Silicon: MTPLX v2 når 82,8 t/s på …

fredag 7. august 2026 · research

4 briefing-resultat(er) for »throughput«

Opfølgning: Qwen3.5 0.8B kører 2,9× hurtigere på CPU med custom engine

En bruger har bygget et C++-engine og 4-bit-format, der giver 2,9× prefill og 1,7× batch-16 throughput mod llama …

tirsdag 8. september 2026 · Forskning & arkitektur qwen-3.5cpu-inferencequantizationcustom-engine

Baseten kortlægger den effektive frontlinje for LLM-inferens

En ny analyse viser afvejningen mellem latency, throughput og omkostninger på tværs af forskellige inferenskonfigurationer.

onsdag 2. september 2026 · Forskning & arkitektur local-inferenceefficient-frontierbaseten

AWS g6 leverer 3,7x throughput vs. g5g til LLM-serving

Gemma 4 E2B i ren JAX på g6.2xlarge vs. g5g.2xlarge. Den ældre instans mister 87% af decode-tiden til dtype-konvertering – uden …

mandag 31. august 2026 · Værktøjer & produkter awsg5gg6gemma-4jaxinference

Opfølgning: 181 tok/s på Qwen3.8 Flash Next på 2× DGX Spark

En bruger opnår 181 tokens/s aggregeret på tværs af 9 samtidige agentsessioner på to forbundne DGX Spark. Hemmeligheden: PLE-tabel mmap’et fra …

lørdag 29. august 2026 · Værktøjer & produkter dgx-sparkqwen3.8-flash-nextmulti-nodethroughput