Søgning
5 briefing-resultat(er) for »inference-server«
Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode
… Forks som halogen-flash-server og strix-llama.cpp når 75-90 % af teorien.
Perplexity open-sourcer Mac-inferens til Qwen 3.6
Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.
Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker
En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …
Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine
En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …
Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090
En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …