hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
Hvad kilderne siger
Flere kilder beskriver 120B-modeller (modeller med omkring 120 milliarder parametre) som velegnede til lokal hosting med 128GB hukommelse, primært på grund af Mixture-of-Experts (MoE) arkitekturen, der reducerer de aktive parametre per token.
GPT-OSS 120B er den mest omtalte model i denne kategori. Ifølge OpenAIs officielle modelkort på HuggingFace [1] er det en MoE-model med 117B parametre totalt og 5,1B aktive parametre per token. Modellen er designet til at køre på en enkelt 80GB GPU som NVIDIA H100 eller AMD MI300X, og bruger MXFP4-kvantisering [1]. Den har 128K context-vindue og understøtter chain-of-thought reasoning [1]. TokenMix skriver, at modellen kan køre på en enkelt H100 med 80GB VRAM, og at den er priset til omkring $0,09 input / $0,40 output per million tokens via aggregatore [6].
NVIDIA Nemotron 3 Super er en anden 120B-model, som Medium beskriver som "et direkte forsøg på at ændre den ligning" [4]. Den har 120B parametre men holder kun 12B aktive per token [4]. Modellen adresserer både "thinking tax" (reasoning-modeller der genererer mange "thinking tokens") og "context explosion" (den kvadratiske vækst i attention-cost) [4].
Minimax M2.5 nævnes af Reddit-brugere som et alternativ til 120B-klassen. En bruger på r/LocalLLaMA skriver: "go for 128gb (2x64gb) ram so you can run Minimax M2.5, which runs about as fast or not much slower than 120b class MoE models, but is a much stronger model" [10].
Praktikerfællesskabet på Reddit bekræfter, at 128GB RAM er i "kinda a bad spot" fordi 200B+ modeller ikke realistisk passer, men at "gpt oss 120b is the strongest model I've been able to run in this range" [9]. En anden bruger bekræfter, at de har kørt GPT-OSS 120B lokalt på en Ryzen 7 med 64GB RAM PC [12].
Hvor kilderne skiller sig
Der er en markant forskel i, hvordan kilderne beskriver hardware-krav til GPT-OSS 120B:
OpenAI skriver selv, at modellen kræver "a single 80GB GPU (like NVIDIA H100 or AMD MI300X)" [1]. TokenMix bekræfter dette som "80GB VRAM Floor" og skriver: "OpenAI's MXFP4 quantization was designed specifically so GPT-OSS-120B fits on a single H100" [6].
Men cybernews.com rapporterer et eksperiment, hvor en Reddit-bruger (Wrong-Historian) påstod, at modellen kan køres på en PC med kun 8GB GPU [8]. Artiklen hedder: "My mind was blown: running a 120B parameter AI model on a budget GPU at home" [8]. Her beskrives MoE-teknikken som "the secret sauce" der gør det muligt at køre selv på forbrugerhardware [8].
En praktiker på r/LocalLLaMA bekræfter at have kørt modellen på en Ryzen 7 / 64GB RAM PC [12], hvilket tyder på at det er muligt med CPU-kørsel, men med begrænset hastighed.
Denne forskel skyldes sandsynligvis en distinktion mellem: - Optimal ydeevne: 80GB GPU anbefales til produktionsbrug [1][6] - Minimal kørsel: Muligt på langsommere CPU-only opsætninger med nok system-RAM [8][12]
Kun bragt af enkelte medier
Minimax M2.5 nævnes kun på Reddit som et alternativ, der kan køre på 128GB RAM og være "a much stronger model" end 120B MoE-modeller [10]. Denne model er ikke detaljeret i de øvrige kilder.
NVIDIA Nemotron 3 Super er kun beskrevet i én kilde (Medium-artiklen) [4], og det er uklart hvordan den præcist forholder sig til de andre 120B-modeller mht. hardware-krav.
Goliath 120b nævnes kort på Reddit som en 120B-model, men en bruger stiller spørgsmålstegn ved om "two 70b parameter models combined" ville give 140B parametre i stedet for 120B [11].
Ubekræftet
Ingen af kilderne giver en komplet liste over alle 120B-modeller, der er tilgængelige. Der er ingen officiel primærkilde, der sammenligner alle modeller i denne størrelsesklasse direkte.
Specifikke benchmark-sammenligninger mellem GPT-OSS 120B, Nemotron 3 Super og Minimax M2.5 er ikke tilgængelige i de fundne kilder.
Det er uklart præcis hvordan Nemotron 3 Super præsterer sammenlignet med GPT-OSS 120B, da kun én kilde beskriver Nemotron-modellen.
Kilder
- openai/gpt-oss-120b · Hugging Face
- openai/gpt-oss-120b · 🚀 Best Practices for Evaluating GPT-OSS Models: Speed & Benchmark Testing Guide
- LLM Parameter Size Guide: 1B to 1T Explained | Iternal
- NVIDIA Just Released a 120B Model That Only Uses 12B. Here’s Why That Changes Everything | by AIwithMaha | Medium
- r/ollama on Reddit: Is there a chart that's shows for xx Billion parameter model, this hardware is needed?
- GPT-OSS-120B Review: Open Source OpenAI? 2026 Benchmark - TokenMix Blog
- How to Run a 120B LLM on Your PC | Hardware & Tips
- Experiment: I ran a 120 billion parameter AI model on a budget GPU
- r/LocalLLaMA on Reddit: Best open coding model for 128GB RAM? [2026]
- r/LocalLLaMA on Reddit: Recommendations for a affordable prebuilt PC to run 120B LLM locally?
- r/LocalLLaMA on Reddit: How do 120B models work?
- r/LocalLLaMA on Reddit: I successfully ran GPT-OSS 120B locally on a Ryzen 7 / 64 GB RAM PC — and published the full analysis (w/ DOI)
- r/LocalLLaMA on Reddit: Best LLM model for 128GB of VRAM?
- r/LocalLLaMA on Reddit: Model recommendations for 128GB Strix Halo and other big unified RAM machines?