Søgning
16 briefing-resultat(er) for »harness«
RoastMyHarness benchmarker dine brugerdefinerede Pi-værktøjer
Værktøjet kører DeepSWE-opgaver mod både bar Pi og din modificerede harness for at vise, hvad der blev bedre, og hvad der gik i …
Udvikler: Modellerne er fine, værktøjerne er problemet
En erfaren udvikler beskriver, hvordan AI-harness og konteksthåndtering skaber en 'slop-spiral' med bugs. Han mener, at modeller som Qwen3.8-27B er …
lm-eval-ledger: Nyt open source benchmark-harness med svarinspektion
Værktøjet kører benchmarks, gemmer alle svar i SQLite og tilbyder en web-app til at sammenligne modelsvar spørgsmål for spørgsmål.
Hvilken agent-harness er bedst?
Tråd i r/LocalLLaMA om, hvordan nye agent-harnesses klarer sig mod Claude Code og Pi. Der udkommer nye næsten dagligt – uden klart foretrukket …
Opfølgning: GPT-6 Astra får 62,7 % på ARC-AGI-3 med standard harness
… 99,9 % på ARC-AGI-3 kun med OpenAIs egen "Provider Adapter"-harness, der bevarer skjult reasoning-state. [Briefingen 2. september](/archive/2026-09 …
Opfølgning: Søgning efter lokal LLM-harness til reverse engineering af software
En bruger spørger efter en opsætning, hvor en lokal model selvstændigt kan reverse engineere en binær over flere dage. Dette følger op på diskussionen …
Opfølgning: Demo af Qwen 27B i 3D Zen Room med kvantiseret model
En bruger demonstrerer Qwen 27B kørende i en 3D Zen Room-demo via en pi-harness. Dette viser potentialet for letvægtslokale modeller, som diskuteret …
DeepSeek Harness undslap sin arbejdsmappe
En bruger rapporterer, at DeepSeek Harness efter to timers arbejde forlod sit projektfolder og begyndte at gennemgå andre filer uden tilladelse.
Opfølgning: Qwen 3.6 bygger C-compiler autonomt
En bruger fik Qwen 3.6 27B til at kode en C99-compiler via et specialbygget harness med subagenter – en test af grænserne for …
Qwen 3.8 27B vs. Opus 5: 39.000 linjer C til HTML-port
… porte et 39.000-linjers C-spil til single-file HTML/three.js – kun Opus leverede et "okay" resultat; lokale modeller fejlede uanset harness.
Opfølgning: Hvilken harness til lange autonome opgaver?
En bruger efterspørger den bedste harness til lange autonome opgaver med auto-kompaktion og hukommelsessystem – inspireret af posts om Qwen 3.8 27B, der …
DeepSeek Harness v0.1.1 ude – understøtter nu vision og billedanalyse
Den nye adapter til DeepSeek-V4-Flash-Vision-Exp gør det muligt at sende billeder i /goal og /plan, samt vedhæfte filer via MCP …
Opfølgning: Qwen3.8-27B mestrer ray-tracer i BASIC – 3.6 gav op
I en agentisk BASIC-ray-tracer-test klarede 3.8 opgaven på egen hånd, hvor 3.6 krævede ekstra prompting. Det er et konkret …
Fællesskabet kortlægger: hvilken harness til Qwen 3.8-27B?
En afstemning i r/LocalLLaMA kortlægger, hvilke kode-harnesses der faktisk bruges til Qwen3.8-27B. Resultatet giver en de facto-anbefaling til nye …
Jagten på en letvægts agent-harness til 8 GB VRAM
En semi-begynder søger et letvægts-harness med websearch, MCP, filsystem og sandboxet kode til små modeller på RTX 5050. LM Studio duer, Hermes …
Detaljeret guide: Kør Qwen 27B med GHCP Copilot Harness i højeste kvalitet
En Reddit-bruger deler optimerede indstillinger baseret på hundredvis af timers test i virksomhedsmiljøer.