1. OKTOBER 2026

← Alle begreper
Hva er

Benchmark

Standardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.

Hva det er

En benchmark er en standardisert test som måler en AI-modells ytelse på spesifikke oppgaver. Benchmarks gjør det mulig å sammenligne modeller objektivt — på koding, matematikk, resonnering, vitenskap og andre domener.

Hvordan det fungerer

En benchmark består av et datasett med oppgaver og fasitsvar. Modellen testes på oppgavene, og resultatet rapporteres som en prosentandel riktige svar. Viktige benchmarks i 2026 inkluderer SWE-bench Verified (koding — løs reelle GitHub-issues), GPQA Diamond (forskning på doktorgradsnivå), AIME 2026 (avansert matematikk), ARC-AGI-2 (generell resonnering) og Arena AI (menneskeranking via blind testing).

Hvorfor det er relevant i 2026

Benchmarks driver konkurransen mellom AI-lab-ene. Når DeepSeek V4 scorer 81 prosent på SWE-bench og Claude Opus 4.6 scorer 80,8 prosent, blir det en teknisk kappløp om desimaler. Samtidig vokser kritikken: mange benchmarks er «mettet» (modellene scorer nær 100 prosent) eller gamification-utsatt. Arena AI med blind menneskeranking har blitt den mest troverdige målestokken.

Relaterte begreper
Artikler som bruker dette begrepet
Modeller · 30. september 2026

GPT-6.1 Sol koster en femtedel av Astra og scorer 52 mot 53

Modeller · 27. september 2026

Googles Gemini 4 går inn i ettertrening, langt bak i målingene

Modeller · 23. september 2026

OpenAI halverte prisene en time etter at Anthropic kuttet sine

AI-nyheter · 18. september 2026

Anthropic betaler Accenture for å kontrollere Anthropic uavhengig

Modeller · 11. september 2026

Cognitions nye kodemodell er bygget på kinesisk grunnmur