Grok 4.5 topper agenttest, støtter Musks Opus-Class påstand

  • Grok 4.5 topper uavhengig agent-benchmark, støtter Musks kostnadspåstander
  • Modellen oppnådde 51,4 % på AutomationBench-AA, med lavest kostnad blant lederne.
  • Modellen registrerte imidlertid også 0,63 regelbrudd per oppgave, mer enn konkurrentene.

Elon Musk kalte Grok 4.5 en Opus-klasse modell som kjører raskere og koster mindre. En uavhengig, agentisk benchmark gir nå reell støtte til dette utsagnet.

På Artificial Analysis sin AutomationBench-AA fikk Grok 4.5 førsteplass med en score på 51,4 % og kostet kun $ 0,34 per oppgave. Den slo både Claude Fable 5 (48,6 %) og Claude Opus 4.8 (48,5 %).

AutomationBench-AA poengsum for AI-modeller.
AutomationBench-AA poengsum for AI-modeller. Kilde: Artificial Analysis

En uavhengig vurdering av Elon Musks påstand

SpaceXAI gjorde Grok 4.5 offentlig denne uken, bygget på selskapets V9-grunnlag med 1,5 billioner parametere. Musks presentasjon bygget på tidlige interne evalueringer.

AutomationBench-AA endrer dette. Artificial Analysis kjører benchmarken uavhengig og holder sitt utvalg av oppgaver hemmelig for å unngå forhåndstilpasning.

Testen omfatter 657 oppgaver fordelt på 40 simulerte apper, inkludert Gmail, Slack, Salesforce og HubSpot. Den måler hvor stor andel av målene en agent klarer uten å bryte sikkerhetsregler.

Følg oss på X for å få de siste nyhetene idet de skjer

Grok 4.5: Billigere, raskere og stort sett samsvarende

Grok 4.5 sin pris på $ 0,34 per oppgave lå langt under Fable 5 på $ 1,35 og Opus 4.8 på $ 1,46. Gemini 3.5 Flash var nærmest med $ 0,49.

Modellen brukte omtrent 8000 utgangstokens per oppgave, cirka en fjerdedel av det Opus 4.8 brukte. Denne effektiviteten forklarer mye av kostnadsforskjellen, i tråd med hvordan Musk lanserte produktet.

“Total bruk av tokens på 0,44M per oppgave er blant de laveste på resultatlisten. Lave kostnader skyldes denne effektiviteten samt lave tokenpriser,” uttalte Artificial Analysis på X.

I tillegg fullførte Grok 4.5 79,9 % av målsettingene og besto 21,9 % av oppgavene helt. Innen finans, det vanskeligste området, ledet den med 71 %, foran Fable 5 med 64 % og Opus 4.8 med 62 %.

Modellen brøt imidlertid flere regler enn sine nærmeste konkurrenter. Den hadde 0,63 regelbrudd per oppgave, høyere enn Opus 4.8 med 0,55 og Gemini 3.5 Flash med 0,46.

Denne forskjellen har betydning for selskaper som bruker agenter i faktiske finanssystemer, der ett enkelt brudd kan medføre reelle kostnader.

Abonner på vår YouTube-kanal for å høre ledere og journalister gi ekspertinnsikt

Ansvarsfraskrivelse

BeInCrypto forplikter seg til upartisk og transparent rapportering. Denne nyhetsartikkelen har som mål å gi nøyaktig og aktuell informasjon. Lesere anbefales imidlertid å verifisere fakta på egen hånd og rådføre seg med en fagperson før de tar beslutninger basert på dette innholdet. Vær oppmerksom på at våre Vilkår og betingelser, vår Personvernerklæring og våre Ansvarsfraskrivelser er oppdatert.