{
  "id": 8518359,
  "title": "Stor test: AI-chatboter bommet på over halvparten av økonomispørsmålene",
  "url": "https://urgent.news/2026/09/19/stor-test-ai-chatboter-bommet-pa-over-halvparten-av-konomisp-rsmalene",
  "topic": "ai",
  "section": "AI",
  "published": "2026-09-19T19:12:06.000Z",
  "source": {
    "name": "E24 Norway",
    "slug": "e24-norway",
    "url": "https://e24.no/privatoekonomi/i/wroO1o/ai-chatboter-bommet-paa-over-halvparten-av-oekonomispoersmaalene"
  },
  "original_language": "en",
  "account": "AI-chatboter mislykket på over halvparten av økonomispørsmålene i en storskatteverdig undersøkelse utført av Saturn på 121 spørsmål. Modellene fra ChatGPT, Claude, Copilot, Grok og Gemini hadde feil på 57 prosent av svar på average. De mest komplekse spørsmålene, som inkluderte mer enn en utregning, tok modellene feil på 88 prosent av. Google Gemini 3.5 Flash og Claude Haiku 4.5 hadde feil på 99 prosent av spørsmålene. De gratis versjonene hadde feil på 63 prosent av, mens betalingsversjonene hadde feil på 49 prosent. Den beste modellen, Claude Opus 5 Reasoning, feil på 39 prosent av spørsmålene. Selv investeringsdirektør i Nordea Robert Næss var skeptisk overfor fielen, men advarte om å teste resultater av AI-modellene.",
  "summary": "Modellene gjorde blant annet regnefeil, og ignorerte kommende skatteregler, har en ny undersøkelse…",
  "key_points": [
    "Over 50% of economic questions answered incorrectly by AI chatbots",
    "Claude Opus 5 Reasoning had lowest error rate at 39%",
    "Investing director Robert Næss skeptical but urges testing"
  ],
  "editors_take": null,
  "illustration": null,
  "coverage": {
    "outlets": 1,
    "also_reported_by": []
  },
  "ai_generated": true,
  "disclaimer": "Summaries, key points and the editor’s take are written by software from other outlets’ reporting and may contain errors — always check the linked original."
}