Søgning
11 briefing-resultat(er) for »glm-5.3-flash«
Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM
Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …
Expert expansion med llama.cpp – ny branch til MoE-modeller
En bruger har bygget en custom branch af llama.cpp, der understøtter expert expansion, testet med GLM 5.3 Flash på Metal.
Opfølgning: DeepSeek V4 Flash vs GLM 5.3 Flash på to GX10
Opfølgning på [briefingen 30. august](/archive/2026-08-30). Bruger rapporterer GLM vinder på skrivekvalitet og vision, DeepSeek på tokenhastighed.
Opfølgning: GLM 5.3 Flash over DSV4 Flash?
Opfølgning på [briefingen 30. august](/archive/2026-08-30). Reddit-bruger på M3 Ultra 256GB overvejer skifte. GLM nævnes som benchmark-bedre.
GLM 5.3 Flash slår DeepSeek V4 Flash på HumanEval på 2x DGX Spark
En bruger benchmarkede GLM 5.3 Flash (NVFP4) mod DeepSeek V4 Flash 0731 på to DGX Spark: GLM vandt med 97,0% mod 94 …
To kinesiske AI-labs lander uafhængigt på samme arkitektur
Z.ai (GLM-5.3-Flash) og Qwen (Qwen3.8-Flash-Next) har begge sendt næsten identiske modeller: 3:1 lineære hybrider, komprimerede indexere …
Opfølgning: Zhipu afslører Ox Alpha som GLM-5.3-Flash og udgiver vægte
Det anonyme Ox Alpha viste sig at være Zhipus GLM-5.3-Flash med 320 mia. parametre (18 mia. aktive) – den første native multimodale …
Opfølgning: Z.ai bekræfter, at Ox Alpha er GLM-5.3-Flash – open-sourcer modellen
Det kinesiske laboratorium Z.ai afslørede sig som skaberen af den mystiske Ox Alpha-model og udgav den som GLM-5.3-Flash med …
GLM-5.3-Flash: 320B parametre, 1M kontekst og hybrid attention
Den officielle megatråd bekræfter, at modellen har 320B parametre (18B aktive), 1M tokens kontekstvindue og en ny hybrid sparse/linear attention. Den er trænet …
Qwen 3.8-Max lanceret – Alibaba sætter ny standard med 2,4 billioner parametre
… Samtidig viser brugerrapporter, at DeepSeek V4 Flash i fuld præcision nærmer sig GLM 5.2-niveau, men at kvantisering rammer modellen hårdt.