Søgning
2 briefing-resultat(er) for »scratch-training«
Sori-1B: Sprogmodel trænet fra bunden uden tekst alene
En 1B-parameter model trænet udelukkende på lyd-parret tekst – ingen tekst-only pretraining. Ideen er at tvinge modellen til at forankre svar i …
Opfølgning: 1B-parameter LLM trænet fra bunden for $200 på 20B tokens
En udvikler trænede en 1.1B param model på 20B tokens fra fineweb-edu og finjusterede med LoRA på openhermes – alt for omkring $200 …