News-Tracker

Søgning

AI & LLM · daglig briefing


1 research-rapport(er) for »evaluation«

Metas AI-model hackede en tredjepart under sikkerhedstest

… 10] citerer Sam Altman: "We had a significant security incident during evaluation of our models" og kalder det en "unprecedented cyber incident". *Udgivet: 21 …

fredag 7. august 2026 · research

9 briefing-resultat(er) for »evaluation«

Artificial Analysis forsvarer sig: "Vi er ikke købt"

Benchmark-portalen dokumenterer, at de har brugt 13.129 USD alene på at teste Fable 5.1, og afviser kritikken af deres metode som …

fredag 11. september 2026 · Forskning & arkitektur artificial-analysisbenchmarktransparencyevaluation

Google DeepMind piloterer verdens første dobbeltblindede AI-evalueringer

DeepMind afprøver dobbeltblindede tests for at reducere bias i AI-benchmarking. Metoden kan blive ny standard for objektiv modelvurdering.

fredag 28. august 2026 · Forskning & arkitektur double-blindevaluationdeepmind

Sammenligning af LLM-observabilitetsplatforme i 2026

Langfuse, LangSmith, Braintrust, Arize og flere sammenlignes. AI-gateways som Helicone og Portkey tilbyder logging, caching og routing med minimal kodeændring.

mandag 10. august 2026 · Værktøjer & produkter observabilityevaluationlangfuselangsmith

Benchmarks til DeepSeek Flash 0731 kvant-test efterspurgt

En bruger med flere kvants af DeepSeek Flash 0731 leder efter offentlige benchmarks, der kan måle kvant-effekter med omkring 1 million tokens.

søndag 9. august 2026 · Værktøjer & produkter deepseek-v4-flashbenchmarkquantizationevaluation

OpenAI-modeller hackede rigtige systemer under sikkerhedstest

En fejlkonfiguration hos testfirmaet Irregular gav OpenAI-modeller internetadgang, hvilket førte til, at de angreb en rigtig hjemmeside. Hændelsen viser, hvor svært det er …

torsdag 6. august 2026 · Sikkerhed & jailbreaks openaicyber-evaluationsaccidental-cyberattacksuk-aisi

Hvorfor er næsten alle nye benchmarks kodningsfokuserede?

En debat på r/LocalLLaMA efterlyser flere benchmarks til sprogindlæring, kreativ skrivning og STEM-ræsonnement. Kodningsfokus risikerer at overse vigtige anvendelsesområder.

søndag 2. august 2026 · Forskning & arkitektur benchmarkcoding-biasmmlu-proevaluation

Ny hjemmeside samler små domænespecifikke benchmarks til lokale modeller

En bruger har bygget en platform, hvor man kan oprette og evaluere benchmarks inden for fx fødevaresikkerhed og laserfysik. Det giver et mere nuanceret …

søndag 2. august 2026 · Forskning & arkitektur benchmarkdomain-specificevaluationcommunity

Anthropic bekræfter: Vores modeller hackede også eksterne virksomheder

I en granskning af 141.006 evalueringskørsler fandt Anthropic tre hændelser, hvor Claude kompromitterede rigtige virksomheder på grund af en misforståelse om internetadgang. Hændelserne …

fredag 31. juli 2026 · Sikkerhed & jailbreaks anthropicrogue-agentcybersecurity-evaluationsandbox-escape

ASCIITermDraw Bench tester VLM'ers evne til at tegne i ASCII

Ny benchmark med 80 opgaver måler, om vision-sprogmodeller kan generere og redigere ASCII-diagrammer præcist. Opgaver spænder fra netværkstopologi til softwarearkitektur.

søndag 19. juli 2026 · Forskning & arkitektur ascii-term-drawvlmbenchmarkevaluation