Søgning
3 research-rapport(er) for »reasoning«
hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting
… Den har 128K context-vindue og understøtter chain-of-thought reasoning [1]. TokenMix skriver, at modellen kan køre på en enkelt H100 med 80GB …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… og global attention (48 lag i 1:3 forhold), og native reasoning-support med interleaved thinking. [6] angiver, at NVFP4-vægtene fylder cirka 71 …
Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1
… Accuracy–Efficiency Tradeoffs in Dense and MoE Reasoning Language Models](https://arxiv.org/html/2604.07035v1) 2. [PerfCodeBench: Benchmarking LLMs for System-Level High …
28 briefing-resultat(er) for »reasoning«
Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen
En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …
Opfølgning: GPT-6 Astra får 62,7 % på ARC-AGI-3 med standard harness
… 99,9 % på ARC-AGI-3 kun med OpenAIs egen "Provider Adapter"-harness, der bevarer skjult reasoning-state. [Briefingen 2. september](/archive/2026-09 …
Søger: Lille LLM til Linux-kommandoer
Bruger efterlyser 4B-model uden tvungen reasoning til shell-kommandoer.
Tencent Hy4 Preview: 770B parametre, 49B aktive, 1M kontekst
… Simon Willison noterer, at modellen kun har to reasoning-effort-niveauer: "high" og "no_think".
Hvad hvis Chain-of-Thought var reversibelt?
En ny idé undersøger bløde reversible transformationer (Toffoli/Fredkin) i reasoning: cyklisk konsistens giver fejldetektion uden ekstra model, Bennett-stil uncomputation kan reducere KV …
Qwen 3.8 Low og Medium knuser benchmarks – over-tænkning var ikke nødvendig
Artificial Analysis viser, at de lavere reasoning-presets leverer konkurrencedygtige scores, hvilket bekræfter, at modellens styrke ikke kun skyldes over-tænkning. [Se tidligere dækning …
Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er
En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …
Qwen3.8’s low-preset slår Qwen 3.7 Plus – forskellige tænkeniveauer testet
Selv det laveste reasoning-preset er bedre end Qwen 3.7 Plus eller Qwen3.6-27B’s reasoning. [Se tidligere dækning](/archive/2026-08 …
Qwen3.8-27B løser fluid-simulering efter to forsøg – på 16 GB GPU
Med IQ3_XXS og 96K kontekst byggede modellen en fungerende fluid-simulering på 42 minutter og 62 værktøjskald. Første forsøg fejlede, men modellen rettede …
Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot
En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …
Qwen 3.8 27B imponerer – men over-tænker alt som standard
Alibabas nye 27B-model er fremragende på papiret, men dens standard-indstilling "xhigh" for reasoning-effort får den til at overanalysere selv simple spørgsmål …
Opfølgning: Qwen3.8-27B mestrer ray-tracer i BASIC – 3.6 gav op
… Det er et konkret eksempel på det spring i reasoning, som [briefingen 15. august](/archive/2026-08-15) fandt.
Opfølgning: Tensor-kvantisering bevarer 96,7 % af Gemma 4 E4B's ræsonnement ved IQ2_XXS
Med IQ2_XXS og tensor-allokeret præcision steg reasoning fra 28,9 til 69,5 under samme 3,3 GB-budget – uden post-træning …
Formodning: Qwen 3.8-27B har beskåret generel viden til fordel for kodning
En bruger observerer, at modellen har svært ved genkendelse af lokale vartegn, hvilket tyder på bevidst pruning af faktuel viden for at styrke kodning …
Opfølgning: Kæmpe forskel i reasoning effort på Qwen 3.8-27B
"xhigh" reasoning effort genererer op til 40.000 tanketokens mod "medium"s få tusinde. Forskellen er langt større end hos forgængeren. [briefingen 8. august …
Praktisk guide: Byg en reasoning-fokuseret LLM med SupraLabs korpus
En tutorial viser komplet workflow fra streaming af data til fine-tuning af SmolLM2-135M med LoRA – en tilgængelig metode til specialiserede små modeller.
Opfølgning: DeepSeek V4 Pro 0813 ude på OpenRouter – ingen officiel annoncering
… Modellen viser markant forskellige resultater på tværs af reasoning-niveauer.
Enkelt global krypteringsnøgle blottede AI-reasoning fra Anthropic, OpenAI og Google
Forskere dechiffrerede 315.320 offentliggjorte session-logs og genfandt 182 developer credentials, fordi alle tre udbydere brugte samme globale nøgle i stedet for per …
Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller
Forskere har vist, at de krypterede "chain-of-thought"-blokke fra OpenAI, Anthropic og Google kan genses i svagere modeller fra samme familie og …
Muse Glimmers reasoning traces er kaotiske og repetitive sammenlignet med Qwen og Gemma
Brugere observerer, at Muse Glimmers reasoning-traces er usædvanligt uorganiserede, repetitive og indeholder mærkelige policy-henvisninger. Til gengæld er modellen meget hurtig med DFlash …
DASH: adaptiv tæt supervision til reasoning-modeller
Nyt papir foreslår DASH, der lader token-niveau-distillationsvægte følge divergenshistorikken i stedet for faste koefficienter. Fem relaterede OPSD-papirer viser, at området er …
Opfølgning: LLM 0.32 udgivet med reasoning-traces og server-side tools
Simon Willisons kommandolinjeværktøj understøtter nu visning af reasoning-spor, OpenAI's CodeInterpreter og Anthropic MCP. GPT-5.6 Luna er ny standardmodel ([briefingen 31 …
Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl
Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …
Opfølgning: Laguna S 2.1 får rettet reasoning-mode – community finder fejl i chat-template
Poolside har opdateret chat-templaten to gange på 24 timer efter brugerrapporter om, at reasoning-fasen ikke startede. Løsningen var at sammenligne med Qwens …
MindControl: llama.cpp-fork styrer reasoning-processen via sampling-injection
… Tidlige tests viser markant bedre reasoning fra små modeller som Qwen3.6-27B.
RLVR og GRPO anvendes til molekylær design med LLM'er
Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.
Hvordan LLM'er lærer at styre ræsonnementets dybde
Sebastian Raschka gennemgår, hvordan sprogmodeller kan trænes til at arbejde i low-, medium- og high-effort-tilstande. Forståelsen er afgørende for at balancere hastighed …
Frontier-modeller fejler stadig i matematiske beviser
En ny benchmark viser, at selv de bedste LLM'er har store problemer med at konstruere og verificere komplekse matematiske beviser. Thinking Machines åbnede …