News-Tracker

Søgning

AI & LLM · daglig briefing


3 research-rapport(er) for »reasoning«

hvilke 120b modeller er der kommet og hvordan klarer de sig .... det er vist den range af modeller som er bedst til 128gb memory til lokal hosting

… Den har 128K context-vindue og understøtter chain-of-thought reasoning [1]. TokenMix skriver, at modellen kan køre på en enkelt H100 med 80GB …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… og global attention (48 lag i 1:3 forhold), og native reasoning-support med interleaved thinking. [6] angiver, at NVFP4-vægtene fylder cirka 71 …

fredag 7. august 2026 · research

Qwen 3.6 27b undersøg hvorfor den er så god til lokal kogning og hold den op med nogle af de nye Feks Gemma 4 og Laguna 2.1

… Accuracy–Efficiency Tradeoffs in Dense and MoE Reasoning Language Models](https://arxiv.org/html/2604.07035v1) 2. [PerfCodeBench: Benchmarking LLMs for System-Level High …

torsdag 30. juli 2026 · research

28 briefing-resultat(er) for »reasoning«

Task-aware kvantisering: 99 % af BF16-ræsonnering til 15 % af størrelsen

En bruger har bygget TAK, en task-specifik kvantiseringspipeline, der med Qwen3.8-27B scorer 82,81 % i ræsonnering mod BF16's 83,59 …

tirsdag 8. september 2026 · Forskning & arkitektur task-aware-quantizationqwen-3.8quantizationreasoning

Opfølgning: GPT-6 Astra får 62,7 % på ARC-AGI-3 med standard harness

… 99,9 % på ARC-AGI-3 kun med OpenAIs egen "Provider Adapter"-harness, der bevarer skjult reasoning-state. [Briefingen 2. september](/archive/2026-09 …

fredag 4. september 2026 · Forskning & arkitektur arc-agi-3gpt-6-astrareasoningbenchmark

Søger: Lille LLM til Linux-kommandoer

Bruger efterlyser 4B-model uden tvungen reasoning til shell-kommandoer.

torsdag 3. september 2026 · Værktøjer & produkter small-llmslinuxcommand-line

Tencent Hy4 Preview: 770B parametre, 49B aktive, 1M kontekst

… Simon Willison noterer, at modellen kun har to reasoning-effort-niveauer: "high" og "no_think".

søndag 30. august 2026 · Nye modeller hy4tencentopen-weightsreasoning

Hvad hvis Chain-of-Thought var reversibelt?

En ny idé undersøger bløde reversible transformationer (Toffoli/Fredkin) i reasoning: cyklisk konsistens giver fejldetektion uden ekstra model, Bennett-stil uncomputation kan reducere KV …

søndag 23. august 2026 · Forskning & arkitektur chain-of-thoughtreversible-logickv-cachelocal-llm

Qwen 3.8 Low og Medium knuser benchmarks – over-tænkning var ikke nødvendig

Artificial Analysis viser, at de lavere reasoning-presets leverer konkurrencedygtige scores, hvilket bekræfter, at modellens styrke ikke kun skyldes over-tænkning. [Se tidligere dækning …

lørdag 22. august 2026 · Nye modeller qwen3.8-27bartificial-analysisbenchmarklow-medium

Fra LM Studio til vLLM: 143 tok/s på Qwen3.8 med to RTX 3090’er

En bruger deler sin opgradering, der gjorde Qwen3.8’s reasoning tålelig, og GPU-temperaturerne faldt fra 70°C til 35°C. [Se tidligere …

lørdag 22. august 2026 · Værktøjer & produkter vllmqwen3.8-27brtx-3090inference-speed

Qwen3.8’s low-preset slår Qwen 3.7 Plus – forskellige tænkeniveauer testet

Selv det laveste reasoning-preset er bedre end Qwen 3.7 Plus eller Qwen3.6-27B’s reasoning. [Se tidligere dækning](/archive/2026-08 …

lørdag 22. august 2026 · Nye modeller qwen3.8-27breasoning-levelslow-presetqwen3.7

Qwen3.8-27B løser fluid-simulering efter to forsøg – på 16 GB GPU

Med IQ3_XXS og 96K kontekst byggede modellen en fungerende fluid-simulering på 42 minutter og 62 værktøjskald. Første forsøg fejlede, men modellen rettede …

torsdag 20. august 2026 · Nye modeller qwen-3.8fluid-simulationtool-usereasoning

Lokal agentic coding benchmark: Qwen 3.8 27B medium reasoning er sweet spot

En omfattende benchmark viser at medium reasoning mode i Qwen 3.8 27B giver højest score med markant færre tokens end xhigh mode. Kører …

tirsdag 18. august 2026 · Forskning & arkitektur qwen-3.8agentic-codingbenchmarkreasoning-effort

Qwen 3.8 27B imponerer – men over-tænker alt som standard

Alibabas nye 27B-model er fremragende på papiret, men dens standard-indstilling "xhigh" for reasoning-effort får den til at overanalysere selv simple spørgsmål …

mandag 17. august 2026 · Nye modeller qwen-3.827breasoning-effortlocal-llm

Opfølgning: Qwen3.8-27B mestrer ray-tracer i BASIC – 3.6 gav op

… Det er et konkret eksempel på det spring i reasoning, som [briefingen 15. august](/archive/2026-08-15) fandt.

søndag 16. august 2026 · Nye modeller qwen3.8-27bqwen3.6-27bagentic-harnesscoding

Opfølgning: Tensor-kvantisering bevarer 96,7 % af Gemma 4 E4B's ræsonnement ved IQ2_XXS

Med IQ2_XXS og tensor-allokeret præcision steg reasoning fra 28,9 til 69,5 under samme 3,3 GB-budget – uden post-træning …

søndag 16. august 2026 · Forskning & arkitektur gemma-4quantizationiq2-xxsreasoning

Formodning: Qwen 3.8-27B har beskåret generel viden til fordel for kodning

En bruger observerer, at modellen har svært ved genkendelse af lokale vartegn, hvilket tyder på bevidst pruning af faktuel viden for at styrke kodning …

lørdag 15. august 2026 · Nye modeller qwen-3.8knowledge-pruningreasoning

Opfølgning: Kæmpe forskel i reasoning effort på Qwen 3.8-27B

"xhigh" reasoning effort genererer op til 40.000 tanketokens mod "medium"s få tusinde. Forskellen er langt større end hos forgængeren. [briefingen 8. august …

lørdag 15. august 2026 · Nye modeller qwen-3.8reasoning-effortthinking-tokens

Praktisk guide: Byg en reasoning-fokuseret LLM med SupraLabs korpus

En tutorial viser komplet workflow fra streaming af data til fine-tuning af SmolLM2-135M med LoRA – en tilgængelig metode til specialiserede små modeller.

lørdag 15. august 2026 · Forskning & arkitektur fine-tuningreasoning-corpussupralabslora

Opfølgning: DeepSeek V4 Pro 0813 ude på OpenRouter – ingen officiel annoncering

… Modellen viser markant forskellige resultater på tværs af reasoning-niveauer.

torsdag 13. august 2026 · Nye modeller deepseek-v4-proopenrouterapichina

Enkelt global krypteringsnøgle blottede AI-reasoning fra Anthropic, OpenAI og Google

Forskere dechiffrerede 315.320 offentliggjorte session-logs og genfandt 182 developer credentials, fordi alle tre udbydere brugte samme globale nøgle i stedet for per …

torsdag 13. august 2026 · Sikkerhed & jailbreaks encryptionreasoning-tracesanthropicopenaigoogle

Nyt papir: Krypterede reasoning-traces fra GPT-5.6 og Claude kan stjæles – og dekrypteres via svagere modeller

Forskere har vist, at de krypterede "chain-of-thought"-blokke fra OpenAI, Anthropic og Google kan genses i svagere modeller fra samme familie og …

onsdag 12. august 2026 · Sikkerhed & jailbreaks reasoning-tracesjailbreakchain-of-thoughtencryption

Muse Glimmers reasoning traces er kaotiske og repetitive sammenlignet med Qwen og Gemma

Brugere observerer, at Muse Glimmers reasoning-traces er usædvanligt uorganiserede, repetitive og indeholder mærkelige policy-henvisninger. Til gengæld er modellen meget hurtig med DFlash …

tirsdag 11. august 2026 · Nye modeller muse-glimmerreasoningtracescomparison

DASH: adaptiv tæt supervision til reasoning-modeller

Nyt papir foreslår DASH, der lader token-niveau-distillationsvægte følge divergenshistorikken i stedet for faste koefficienter. Fem relaterede OPSD-papirer viser, at området er …

fredag 7. august 2026 · Forskning & arkitektur dashopsdself-distillationrlvr

Opfølgning: LLM 0.32 udgivet med reasoning-traces og server-side tools

Simon Willisons kommandolinjeværktøj understøtter nu visning af reasoning-spor, OpenAI's CodeInterpreter og Anthropic MCP. GPT-5.6 Luna er ny standardmodel ([briefingen 31 …

torsdag 6. august 2026 · Værktøjer & produkter llm-clisimon-willisonreasoning-tracesgpt-5-6

Opfølgning: Laguna S-2.1s "thinking forever"-loop er en kvantiseringsfejl

Communityet finder, at de uendelige reasoning-loops i Laguna S 2.1 skyldes dårlig kvantisering, ikke modellen. En APEX-Kvant (Q6_K shared expert …

fredag 24. juli 2026 · Forskning & arkitektur laguna-s-2.1quantizationggufmoe

Opfølgning: Laguna S 2.1 får rettet reasoning-mode – community finder fejl i chat-template

Poolside har opdateret chat-templaten to gange på 24 timer efter brugerrapporter om, at reasoning-fasen ikke startede. Løsningen var at sammenligne med Qwens …

torsdag 23. juli 2026 · Nye modeller laguna-s-2.1poolsidecodingopen-weights

MindControl: llama.cpp-fork styrer reasoning-processen via sampling-injection

… Tidlige tests viser markant bedre reasoning fra små modeller som Qwen3.6-27B.

torsdag 23. juli 2026 · Forskning & arkitektur llama.cppreasoningmindcontrolinference

RLVR og GRPO anvendes til molekylær design med LLM'er

Ny forskning anvender Reinforcement Learning with Verifiable Rewards (RLVR) og GRPO til at generere molekyler med specifikke egenskaber. Metoden lover mere præcis lægemiddeldesign.

onsdag 22. juli 2026 · Forskning & arkitektur reinforcement-learningrlvrmolecular-generationgrpo

Hvordan LLM'er lærer at styre ræsonnementets dybde

Sebastian Raschka gennemgår, hvordan sprogmodeller kan trænes til at arbejde i low-, medium- og high-effort-tilstande. Forståelsen er afgørende for at balancere hastighed …

søndag 19. juli 2026 · Forskning & arkitektur reasoning-effortllmlow-efforthigh-effort

Frontier-modeller fejler stadig i matematiske beviser

En ny benchmark viser, at selv de bedste LLM'er har store problemer med at konstruere og verificere komplekse matematiske beviser. Thinking Machines åbnede …

søndag 19. juli 2026 · Forskning & arkitektur mathematical-reasoningfrontier-modelsthinking-machines-lab