Søgning
3 briefing-resultat(er) for »tensor-rt«
Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?
RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.
Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork
En bruger forked NInfer og tilføjede tensor-parallel og YaRN ×4 rope scaling, så Qwen3.8-27B NVFP4 kører 1.048.576 tokens kontekst …
Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?
En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …