News-Tracker

Søgning

AI & LLM · daglig briefing


5 briefing-resultat(er) for »inference-server«

Strix Halo: Alternativer til llama.cpp giver op til 60 tok/s decode

… Forks som halogen-flash-server og strix-llama.cpp når 75-90 % af teorien.

tirsdag 8. september 2026 · Værktøjer & produkter strix-halollama.cppqwen3.8-flash-nextinference

Perplexity open-sourcer Mac-inferens til Qwen 3.6

Perplexity udgiver "lily" – en inferensserver optimeret til Apple Silicon.

torsdag 3. september 2026 · Værktøjer & produkter perplexityinference-servermacqwen-3.6

Gammel telefon bliver lokal LLM-server – og MCP-forlængelse overrasker

En XDA-skribent forvandlede sin gamle telefon til en lokal LLM-server og fandt, at MCP (Model Context Protocol) kan udvide en lokal models …

tirsdag 1. september 2026 · Værktøjer & produkter local-llmedge-inferencemcp

Opfølgning: DeepSeek V4 Flash kører på 2x DGX Spark – RAM-hovedpine

En bruger serverer 304B DeepSeek V4 Flash på tværs af to DGX Spark med 128 GB unified memory hver, men kæmper med OS-hukommelse …

lørdag 8. august 2026 · Værktøjer & produkter deepseek-v4-flashdgx-sparkvllmlocal-inference

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

En bruger har fået DeepSeek V4 Flash (284B MoE) til at køre på en gammel quad-Xeon DDR4-server med to RTX 3090'ere …

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu