News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »cpu-gpu«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… 80GB GPU anbefales til produktionsbrug [1][6] - **Minimal kørsel**: Muligt på langsommere CPU-only opsætninger med nok system-RAM [8][12] ## Kun bragt af …

fredag 7. august 2026 · research

Mac Studio M5, rygter, Pris, Specs og release dato

… M5 Max forventes med op til 18-core CPU og 40-core GPU, M5 Ultra med op til 36-core CPU og 80-core …

tirsdag 28. juli 2026 · research

Mac Studio M5 hvornår kommer den? båndbredde på hukommelsen? og hvad med rygtet omkring at M6 springes over og de går til M7 i stedet og går efter højere memory båndbredde?

… M5 Pro har en hukommelsesbåndbredde på 307 GB/s, mens M5 Max leverer op til 614 GB/s (afhængig af GPU-konfiguration) [7][10 …

onsdag 22. juli 2026 · research

8 briefing-resultat(er) for »cpu-gpu«

Opfølgning: V100 vs. 5060 Ti til Qwen 3.8 – begrænset PCIe giver udfordring

… Kun 2x x4 PCIe-linjer til rådighed begrænser CPU-GPU kommunikation. [briefingen 30. august](/archive/2026-08-30)

mandag 31. august 2026 · Værktøjer & produkter v100gpu-comparisonqwen-3.8llama.cpp

FreeToken: Kør frontlinje-MoE på din gaming-PC

FreeToken muliggør 39 tok/s med Qwen3.6 35B på en RTX 4060 laptop og 22-25 tok/s med DeepSeek-V4-Flash 284B …

tirsdag 25. august 2026 · Forskning & arkitektur freetokenmoeedge-inferencecpu-gpu

Alibabas RISC-V CPU XuanTie C950 kører Qwen 3.8 27B med 30 tokens i sekundet

En demonstration viser, at en RISC-V-processor kan inferere store sprogmodeller uden GPU.

onsdag 19. august 2026 · Værktøjer & produkter risc-vxuantie-c950qwen-3.8alibaba

Opfølgning: Llama.cpp PR flytter sampling til GPU – 8% hastighedsstigning

En PR til llama.cpp rykker CPU-sampling til GPU og giver 8% flere tok/s med MTP aktiveret. En anden PR cacher "hot …

onsdag 5. august 2026 · Forskning & arkitektur llama.cppgpu-samplingspeed-boostmoe

Opfølgning: DeepSeek V4 Flash kører på brugt serverhardware – 33 tok/s på to RTX 3090

… Løsningen koster omkring 6.000 dollars og viser, at CPU-GPU-hybridarkitekturer kan være et alternativ til dyr unified memory.

tirsdag 4. august 2026 · Nye modeller deepseek-v4-flashinferencertx-3090cpu-gpu

Opfølgning: Kimi K3 kører på én CPU med 8 GB RAM – 33 sekunder per token

… 176 KB binary, ingen GPU. Ikke praktisk, men imponerende ingeniørarbejde. [Se tidligere briefingen 30. juli](/archive/2026-07-30).

mandag 3. august 2026 · Forskning & arkitektur kimi-k3cpu-inferencenvme

Opfølgning: DeepSeek V4 Flash kører på 80 GB VRAM med MoE-lag på CPU

En Reddit-bruger deler detaljeret opsætning med tre GPU'er og offloading af ekspertlag til CPU. Se [briefingen 17. juli](/archive/2026-07-17).

søndag 19. juli 2026 · Værktøjer & produkter deepseek-v4-flashlocal-llm80gb-vrammoe-offloading

Spørgsmål: Kan Inkling køre med llama.cpp på CPU og RAM alene?

En bruger efterspørger launch-script til at køre Inkling uden GPU.

søndag 19. juli 2026 · Værktøjer & produkter inklingllama.cppcpu-onlylocal-llm