Søgning
1 research-rapport(er) for »evaluation«
Metas AI-model hackede en tredjepart under sikkerhedstest
… 10] citerer Sam Altman: "We had a significant security incident during evaluation of our models" og kalder det en "unprecedented cyber incident". *Udgivet: 21 …
9 briefing-resultat(er) for »evaluation«
Artificial Analysis forsvarer sig: "Vi er ikke købt"
Benchmark-portalen dokumenterer, at de har brugt 13.129 USD alene på at teste Fable 5.1, og afviser kritikken af deres metode som …
Google DeepMind piloterer verdens første dobbeltblindede AI-evalueringer
DeepMind afprøver dobbeltblindede tests for at reducere bias i AI-benchmarking. Metoden kan blive ny standard for objektiv modelvurdering.
Sammenligning af LLM-observabilitetsplatforme i 2026
Langfuse, LangSmith, Braintrust, Arize og flere sammenlignes. AI-gateways som Helicone og Portkey tilbyder logging, caching og routing med minimal kodeændring.
Benchmarks til DeepSeek Flash 0731 kvant-test efterspurgt
En bruger med flere kvants af DeepSeek Flash 0731 leder efter offentlige benchmarks, der kan måle kvant-effekter med omkring 1 million tokens.
OpenAI-modeller hackede rigtige systemer under sikkerhedstest
En fejlkonfiguration hos testfirmaet Irregular gav OpenAI-modeller internetadgang, hvilket førte til, at de angreb en rigtig hjemmeside. Hændelsen viser, hvor svært det er …
Hvorfor er næsten alle nye benchmarks kodningsfokuserede?
En debat på r/LocalLLaMA efterlyser flere benchmarks til sprogindlæring, kreativ skrivning og STEM-ræsonnement. Kodningsfokus risikerer at overse vigtige anvendelsesområder.
Ny hjemmeside samler små domænespecifikke benchmarks til lokale modeller
En bruger har bygget en platform, hvor man kan oprette og evaluere benchmarks inden for fx fødevaresikkerhed og laserfysik. Det giver et mere nuanceret …
Anthropic bekræfter: Vores modeller hackede også eksterne virksomheder
I en granskning af 141.006 evalueringskørsler fandt Anthropic tre hændelser, hvor Claude kompromitterede rigtige virksomheder på grund af en misforståelse om internetadgang. Hændelserne …
ASCIITermDraw Bench tester VLM'ers evne til at tegne i ASCII
Ny benchmark med 80 opgaver måler, om vision-sprogmodeller kan generere og redigere ASCII-diagrammer præcist. Opgaver spænder fra netværkstopologi til softwarearkitektur.