Søgning
1 research-rapport(er) for »amd«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Modellen er designet til at køre på en enkelt 80GB GPU som NVIDIA H100 eller AMD MI300X, og bruger MXFP4-kvantisering [1]. Den har …
17 briefing-resultat(er) for »amd«
Benchmarks fra 4x Radeon AI Pro R9700-builds efterspurgt
En bruger overvejer en 4x R9700-server til DeepSeek V4 Flash og Qwen 3.8 Flash og spørger om erfaringer.
Bedste model og setup til remote deployment uden internet
… Budget 5.000 USD, overvejer AMD AI Pro 9700.
Bosgame Gorgon Halo: 192 GB RAM mini-pc i oktober
Bosgame lancerer Gorgon Halo i oktober med AMD Ryzen AI Max Pro 495 og op til 192 GB RAM. 128 GB-udgaven koster 3 …
AMD Threadripper Halo: 576 GB HBM3e og 16 TB/s til lokal AI
Arbejdsstationen har 96 kerner og to flydende kølede MI350P-acceleratorer og kan efter AMD's udsagn køre trillion-parameter-modeller på skrivebordet. Dyre, men …
Opfølgning: Ollama ROCm matcher næsten llama.cpp Vulkan på RX 7900 XTX
… llama.cpp; Ollama var bedst til prompt processing ved 64K kontekst. AMD-brugere kan beholde Ollama uden stort tab. [Tidligere briefing](/archive/2026-09 …
VoxGen: Rust-baseret TTS optimeret til AMD
Ny inferensmotor for VoxCPM2 bruger Vulkan compute. Ingen Python-afhængighed, men kun Windows binaries pt.
Opfølgning: Qwen3.8 Flash Quants – 20-30 GB mindre end Unsloth Q4
… Inkluderer en separat ROCmFP4-build til AMD/Strix Halo. [briefingen 26. august](/archive/2026-08-26)
AMD GFX906 får optimeret llama.cpp-fork
En bruger deler en ny fork af llama.cpp optimeret til AMD GFX906 (Mi50, Mi60, Radeon VII) via GCN HIP. Forbedringen gør det muligt …
Strix Halo-guide: Qwen3.8-27B i Q8 med 256K kontekst og vision
En detaljeret guide til at opsætte et LLM API-endpoint på AMD Strix Halo med opskrifter til kvalitet, balance og hastighed – bygget med pi …
Ling 3.0 Flash overgår Qwen-122b på Strix Halo i vLLM
På AMD Strix Halo med vLLM ROCm/HiP og 4-bit komprimering slår Ling 3.0 Flash Qwen-122b i hastighed. Tool calling virker …
Budget AI-server: RX 9060 XT vs RTX 5060 Ti til 48 GB VRAM
… RX 9060 XT 16GB ($490/stk) mod RTX 5060 Ti 16GB ($710/stk) til en dedikeret AI-server – AMD sparer $650 for 48 GB.
Opfølgning: llama.cpp 3–3.6x hurtigere på CPU med VNNI-optimering til Q2_0
… 2 tok/s mod tidligere 2,4 tok/s på en AMD EPYC. Optimeringen afslører også et stille problem på Intels 12.-14. gen …
AMD køber Taalas og støber modeller direkte i silicium
AMD overtager Taalas for at styrke AI-inferens ved at lægge vægte i hardwaren. Opkøbet sænker forhåbningerne om forbruger-udskiftelige modelchips og peger entydigt …
Opfølgning: AMD's MI355X underbyder Nvidias B300 på pris for Kimi K3
… Moonshot AIs 2,8 billioner-parameter model med plads til overs. AMD viser konkurrencedygtig total cost of ownership. [Se tidligere briefingen 22. juli](/archive …
AMD udgiver Instella-MoE-16B-A3B – fuldt åben MoE-model trænet på Instinct
… Det er et stort skridt for åbne modeller på AMD-hardware.
FastFlowLM slutter sig til AMD for at fremme AI-inferens
Holdet bag FastFlowLM er nu en del af AMD. Samarbejdet skal accelerere udviklingen af AI-inferens, hvilket kan styrke AMD's position i hardware …
FastFlowLM slutter sig til AMD for at fremme AI-inferens
FastFlowLM's letvægts inferenssoftware bliver en del af AMDs strategi for at forbedre AI-performance og effektivitet på tværs af hardwarestacken.