Urgent.News

What's breaking now, across thousands of outlets.

AI

Stor test: AI-chatboter bommet på over halvparten av økonomispørsmålene

Modellene gjorde blant annet regnefeil, og ignorerte kommende skatteregler, har en ny undersøkelse…

Stor test: AI-chatboter bommet på over halvparten av økonomispørsmålene

AI-chatboter mislykket på over halvparten av økonomispørsmålene i en storskatteverdig undersøkelse utført av Saturn på 121 spørsmål. Modellene fra ChatGPT, Claude, Copilot, Grok og Gemini hadde feil på 57 prosent av svar på average. De mest komplekse spørsmålene, som inkluderte mer enn en utregning, tok modellene feil på 88 prosent av.

Google Gemini 3.5 Flash og Claude Haiku 4.5 hadde feil på 99 prosent av spørsmålene. De gratis versjonene hadde feil på 63 prosent av, mens betalingsversjonene hadde feil på 49 prosent. Den beste modellen, Claude Opus 5 Reasoning, feil på 39 prosent av spørsmålene. Selv investeringsdirektør i Nordea Robert Næss var skeptisk overfor fielen, men advarte om å teste resultater av AI-modellene.

Written by urgent.news from E24 Norway's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.

Read the original at e24.no →

More in AI

More from Saturday 19 September →