News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »strix-halo«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… Model recommendations for 128GB Strix Halo and other big unified RAM machines?](https://www.reddit.com/r/LocalLLaMA/comments/1oy1v7q/model_recommendations_for_128gb …

fredag 7. august 2026 · research

5 briefing-resultat(er) for »strix-halo«

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4

… Inkluderer en separat ROCmFP4-build til AMD/Strix Halo. [briefingen 26. august](/archive/2026-08-26)

søndag 30. august 2026 · Nye modeller qwen-3.8ggufquantizationlocal-llm

MTP nu understøttet i GLM-4.5-Air via llama.cpp

… Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til maskiner med meget RAM men begrænset compute som Strix Halo.

mandag 24. august 2026 · Værktøjer & produkter glm-4.5-airmtpllama.cppmoe

Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision

En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …

lørdag 22. august 2026 · Værktøjer & produkter strix-haloqwen3.8-27bllama.cppoptimization-guide

Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM

På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …

tirsdag 11. august 2026 · Nye modeller ling-3.0-flashstrix-halovllmperformance