Sist oppdatert: 2026-09-23

AI-benchmark på norsk: dagens beste modeller

Over 350 AI-modeller evalueres hver morgen — de beste på norsk språkkvalitet, hastighet og verdi presenteres her.

Les ukesrapporter → Sammenlign modeller → ChatGPT vs Claude → Gemini vs ChatGPT →

Slik leser du benchmarken

Benchmarken er laget for praktiske valg, ikke bare rangering. Se først på oppgaven din, deretter på språk, pris, fart og stabilitet.

Skal du skrive eller jobbe på norsk?

Start med språk-score og hvilkenAI-score. Høy totalscore er nyttig, men språk-kvalitet bør veie tyngst når svaret skal publiseres eller sendes videre.

Skal du bruke AI ofte eller via API?

Se på pris per million tokens og verdi-score. En rimelig modell kan være best når du kjører mange oppgaver eller bygger produkt.

Trenger du raske svar?

Se på tokens per sekund og stabilitet. Rask modell gir bedre flyt i chat, kundeservice, automasjoner og verktøy der ventetid merkes.

Beste i sin klasse

🏆
Høyest score
Anthropic: Claude Opus 5.5
8.4/10
🇳🇴
Best på norsk
Anthropic: Claude Sonnet 5
9.3/10
Raskest
DeepSeek: DeepSeek V4.1 Flash
920 t/s
💰
Billigst (score ≥ 3)
Meta: Llama 4 Maverick
$0.19/1M
📊
Beste verdi
IBM: Granite 4.0 Micro
Verdi 322.3
🔗
Beste orkestrator
Anthropic: Claude Opus 5.5
Orch 9.3/10

Er premium verdt det?

Premium norsk-score
8.7/10
Mid-range norsk-score
8.8/10
Prisforskjell
~5×

For norsk tekst og enkle oppgaver holder mid-range svært godt. Premium lønner seg ved kompleks resonnering, lange dokumenter og når presisjon er kritisk.

Alle resultater

# Modell Tier t/s TTFT norsk Instr Score Orch. Verdi EU Pris/1M
1
Anthropic: Claude Sonnet 5
anthropic
Stabil
Mid-range 234 116 ms 9.3 10.0 8.4 9.3 4.8 🇪🇺 EU $2.00
≈19 kr
2
Anthropic: Claude Opus 5.5
anthropic
Premium 220 57 ms 9.3 10.0 8.4 9.3 2.4 🇪🇺 EU $4.00
≈38 kr
3
IBM: Granite 4.0 Micro
ibm-granite
Stabil
Budsjett 189 143 ms 9.3 10.0 6.9 9.3 322.3 $0.02
≈0 kr
4
Meta: Llama 4 Maverick
meta-llama
Stabil
Mid-range 115 129 ms 9.3 10.0 8.1 9.3 48.3 $0.19
≈2 kr
5
Cohere: Command R+ (08-2024)
cohere
Stabil
Premium 235 98 ms 9.0 10.0 8.2 9.0 3.8 $2.50
≈24 kr
6
Google: Gemini 3.5 Flash Lite
google
Stabil
Mid-range 156 91 ms 9.0 10.0 8.0 9.0 30.6 ~EU $0.30
≈3 kr
7
Cohere: Command R7B (12-2024)
cohere
Budsjett 312 56 ms 9.0 8.7 6.4 7.8 176.6 $0.04
≈0 kr
8
OpenAI: o1
openai
Stabil
Premium 479 26 ms 8.3 10.0 7.8 8.3 0.6 $15.00
≈142 kr
9
Perplexity: Sonar Pro Search
perplexity
Stabil
Premium 27 571 ms 8.0 10.0 7.0 8.0 3.0 ~EU $3.00
≈28 kr
10
OpenAI: GPT-5.6 Terra Pro
openai
Mid-range 768 22 ms 7.3 10.0 7.0 7.3 4.3 $2.00
≈19 kr
11
Meta: Llama 3.2 1B Instruct
meta-llama
Stabil
Budsjett 355 44 ms 5.7 6.0 2.7 3.4 145.8 $0.03
≈0 kr
12
DeepSeek: DeepSeek V4.1 Flash
deepseek
Budsjett 920 13 ms 5.0 6.7 4.2 3.3 83.3 $0.06
≈1 kr

Responstid siste 14 dager

Slik tester vi

Vi evaluerer over 350 AI-modeller og presenterer de beste resultatene hver morgen. Scoren kombinerer språkforståelse, kvalitet, hastighet, pris og stabilitet. Den nøyaktige vektingen er proprietær.

Les mer om metodikken →

Vanlige spørsmål

Vi evaluerer over 350 tilgjengelige modeller og presenterer de beste resultatene fra siste benchmark. Utvalget oppdateres dynamisk når markedet endrer seg.

Språk-scoren viser hvor godt modellen leverer svar på riktig språk og med god språkkvalitet. Scoren vises som et normalisert tall.

Instruksjons-scoren viser hvor godt modellen følger oppgaven den får. Vi viser resultatet som en enkel, normalisert score.

Scoren kombinerer språkforståelse, kvalitet, hastighet, pris og stabilitet. Den nøyaktige vektingen er proprietær.

Beste verdi peker på modeller som gir sterke resultater i forhold til pris. Den nøyaktige beregningen er proprietær.