Søgning
5 briefing-resultat(er) for »streaming«
Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM
Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …
Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s
Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …
Praktisk guide: Byg en reasoning-fokuseret LLM med SupraLabs korpus
En tutorial viser komplet workflow fra streaming af data til fine-tuning af SmolLM2-135M med LoRA – en tilgængelig metode til specialiserede små modeller.
Opfølgning: DeepSeek V4 Flash kører 10-17 t/s på MacBook M5 Pro med SSD-streaming
En bruger fik DeepSeek V4 Flash til at køre på en 64 GB MacBook via DS4-engineens SSD-streaming, med imponerende hastighed. MoE-modeller …
Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?
En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …