News-Tracker

Søgning

AI & LLM · daglig briefing


5 briefing-resultat(er) for »streaming«

Opfølgning: LayerStoRm – open source expert-streaming kører 186 GiB MoE på 96 GB VRAM

Ny MIT-licenseret inferensmotor streamer eksperter fra RAM og opnår 24,5 tok/s ved 1M kontekst på fire RTX 50-serie GPU'er …

mandag 7. september 2026 · Forskning & arkitektur layerstormexpert-streamingmoeglm-5.3-flash

Opfølgning: Kør 104GB Qwen3.8-model på 48GB Mac med ~12 tok/s

Slotstream muliggør kørsel af den 125B store Qwen3.8-Flash-Next på Mac med SSD-streaming af eksperter og MLX-native Swift-kode. [Se …

onsdag 2. september 2026 · Værktøjer & produkter qwen3.8-flash-nextslotstreammlxexpert-offloading

Praktisk guide: Byg en reasoning-fokuseret LLM med SupraLabs korpus

En tutorial viser komplet workflow fra streaming af data til fine-tuning af SmolLM2-135M med LoRA – en tilgængelig metode til specialiserede små modeller.

lørdag 15. august 2026 · Forskning & arkitektur fine-tuningreasoning-corpussupralabslora

Opfølgning: DeepSeek V4 Flash kører 10-17 t/s på MacBook M5 Pro med SSD-streaming

En bruger fik DeepSeek V4 Flash til at køre på en 64 GB MacBook via DS4-engineens SSD-streaming, med imponerende hastighed. MoE-modeller …

torsdag 6. august 2026 · Nye modeller deepseek-v4-flashssd-streaminglocal-llmmacbook

Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?

En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …

søndag 19. juli 2026 · Værktøjer & produkter tensor-rtstreaminginference