Søgning
2 briefing-resultat(er) for »tensor-parallelism«
Opfølgning: Bland Ampere og Blackwell til lokale LLM'er?
Bruger overvejer 3090 FE for de ekstra 8 GB VRAM, men frygter TP-performancehit ved at blande Ampere og Blackwell i llama.cpp. [Briefingen …
Opfølgning: Hvordan fordeler man GGUF-model og kontekst over to GPU'er?
Bruger spørger, om konteksten skal ligge på det andet 16 GB-kort, eller om højere kvants med tensor-parallelisme er bedre; modelkort angiver sjældent …