News-Tracker

Søgning

AI & LLM · daglig briefing


3 briefing-resultat(er) for »tensor-rt«

Hvorfor ser vi ikke flere INT8 W8A8-modeller til RTX 3090?

RTX 3090 har native INT8-tensorcores, men de fleste vælger FP8 eller mindre kvanter – debatten om hvorfor fortsætter.

onsdag 2. september 2026 · Forskning & arkitektur rtx-3090int8w8a8quantization

Opfølgning: Qwen 3.8 27B kører 1M kontekst på to RTX 5090'er via NInfer fork

En bruger forked NInfer og tilføjede tensor-parallel og YaRN ×4 rope scaling, så Qwen3.8-27B NVFP4 kører 1.048.576 tokens kontekst …

søndag 30. august 2026 · Værktøjer & produkter qwen-3.8tinker1m-contextrtx-5090

Kan Tensor-RT LLM køre fuld præcision uden nok VRAM?

En bruger på r/LocalLLaMA spørger, om frameworks som Tensor-RT LLM eller DeepSpeed kan streame vægte for store MoE-modeller som Hy3. Svarene …

søndag 19. juli 2026 · Værktøjer & produkter tensor-rtstreaminginference