Søgning
1 research-rapport(er) for »mxfp4«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Modellen er designet til at køre på en enkelt 80GB GPU som NVIDIA H100 eller AMD MI300X, og bruger MXFP4-kvantisering [1]. Den har …
8 briefing-resultat(er) for »mxfp4«
Opfølgning: 280 tok/s på Qwen3.8 27B med to R9700’ere og 940K KV-cache
Udvikler opnår rekordhastighed med MXFP4-kerner og DFlash2, hvilket presser hardwaren til det yderste. [Se tidligere briefingen](/archive/2026-08-24).
Opfølgning: Flash Next vs. 27B – hurtigere, men med ny fejltype
Flash Next er hurtigere og fejlfri på JSON og injection, men 27B vinder på symbolsk ræsonnement. Flash Next har en ny fejl: den lover …
GLM 5.3 Flash slår DeepSeek V4 Flash på HumanEval på 2x DGX Spark
En bruger benchmarkede GLM 5.3 Flash (NVFP4) mod DeepSeek V4 Flash 0731 på to DGX Spark: GLM vandt med 97,0% mod 94 …
DeepSeek V4 Flash kører 67-84 tok/s på to GX10'er
En bruger fik DeepSeek V4 Flash til at køre stabilt på to ASUS GX10 DGX-computere med over 65 tok/s sustained og en …
Fuld NVFP4-kvantisering af Qwen3.8-27B med QUASAR bevarer næsten BF16-kvalitet
QUASAR QAD træner modellen til W4A4 og opnår 19,7 GB checkpoint-størrelse med kun 0,5% tab på GPQA-Diamond sammenlignet med BF16.
Opfølgning: Motif 3 NVFP4 – den oversete konkurrent til DeepSeek V4 Flash
Communityet anbefaler Motif 3 NVFP4 som et alternativ til DeepSeek V4 Flash 0731 med bedre samtale-flow. Modellen blev overskygget af DeepSeek-lanceringen dagen …
Ny forskning: CKA-guided destillation bevarer intern geometri i NVFP4-modeller
Forskere viser, at output-matching alene maskerer intern forringelse i lavpræcisionsdestillation. CKA-QAD forbedrer ræsonnement og kodning med moderat træningsoverhead.
Opfølgning: Kimi K3-vægte ude – 2,8 billioner parametre i MXFP4
Vægtene er nu på Hugging Face som lovet. Moonshot planlægger hosting på A100, H200 og B300, men A100 kræver tre noder og mangler FP4 …