Søgning
1 research-rapport(er) for »strix-halo«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Model recommendations for 128GB Strix Halo and other big unified RAM machines?](https://www.reddit.com/r/LocalLLaMA/comments/1oy1v7q/model_recommendations_for_128gb …
5 briefing-resultat(er) for »strix-halo«
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
Brugerbenchmarks viser, at officiel llama.cpp kun rammer 50 % af hardwarepotentialet på Strix Halo. Forks som halogen-flash-server og strix-llama.cpp når …
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
… Inkluderer en separat ROCmFP4-build til AMD/Strix Halo. [briefingen 26. august](/archive/2026-08-26)
MTP nu understøttet i GLM-4.5-Air via llama.cpp
… Air (106B MoE, 12B aktiv) i llama.cpp, hvilket giver markant speedup – ideelt til maskiner med meget RAM men begrænset compute som Strix Halo.
Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision
En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …
Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM
På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …