Søgning
2 briefing-resultat(er) for »beellama«
Opfølgning: Ny beellama-fork optimerer KV-cache til 76% hurtigere generation
En ny fork af beellama forbedrer kvarn-kvanters ydeevne ved høj kontekstdybde og giver op til 76% hurtigere token generation. Læs baggrunden i [briefingen …
Opfølgning: Qwen 3.8 27B kører 50 tok/s med 100K kontekst på 16 GB GPU
… 4070 Ti SUPER med 100K kontekst ved 50 tok/s via beellama.cpp og kvarn5/kvarn4 KV-cache. Nøglen er en specialbygget hybrid-kvantisering …