Anthropic lanserte Claude Sonnet 5.5 den 28. september til samme listepris som Sonnet 5. Selskapet opplyser at modellen kjører over 30 % raskere og koster opptil 30 % mindre per oppgave.
Et uavhengig testfirma kom imidlertid til en annen konklusjon om kostnadene da det presset modellen til sitt ytterste.
Følg oss på X for å få de siste nyhetene når de skjer
Anthropic lanserer sin andre 5.5-modell kort tid etter Opus
Sonnet 5.5 er den andre modellen i Claude 5.5-familien. Anthropic lanserte Opus 5.5 den 22. september. På samme dag slapp også OpenAI GPT-6 Sol og Luna.
Den nye modellen beholder Sonnet 5 sine priser på $ 2 per million input-tokens og $ 10 per million output-tokens. Anthropic rapporterte en score på 70,6 % på Terminal-Bench 4.0, en agentisk kodetest. Sonnet 5 oppnådde kun 10,3 %, mens Opus 5.5 nådde 66,4 %.
“Mens Opus 5.5 er laget for komplekst arbeid som krever grundig vurdering, er Sonnet 5.5 best på veldefinerte dagligdagse oppgaver, feilretting og å lage polerte dokumenter, presentasjoner og regneark,” uttalte teamet.
Anthropic sa at Sonnet 5.5 ikke utvider modellens kapabilitetsgrense. Derfor fokuserte tilpasningsgjennomgangen på risikoer som å villede brukere og legge til rette for alvorlig misbruk.
Sonnet 5.5 leveres også med cybersikring og anti-destillasjonsklassifisering. Disse blokkerer forsøk på å trekke ut modellens resonnement for å trene konkurrerende systemer. Claude Haiku 5.5 kommer i løpet av de neste ukene.
I mellomtiden utsatte OpenAI en kommende modell, GPT-6.1 Astra, på grunn av sikkerhetshensyn. CNBC bekreftet mandag at modellen ikke oppfylte selskapets krav.
Artificial Analysis finner høyere token-bruk ved maksimal innsats
Artificial Analysis, testfirmaet som plasserte Grok 4.7 på fjerdeplass, ga Sonnet 5.5 en score på 56 på sin Intelligence Index. Det plasserer den på andreplass totalt, 2 poeng bak Opus 5.5 ved maksimal innsats.
Firmaet rapporterte 64 % for Sonnet 5.5 på Terminal-Bench 4.0, mot 60 % for Opus 5.5 og GPT-6 Astra. På kunnskapsbaserte tester som GDPval-AA, lå Sonnet 5.5 omtrent likt med Opus 5.5.
Firmaet opplyste at Sonnet 5.5 brukte betydelig flere tokens for å oppnå disse resultatene.
“Ved maksimal innsats, der den oppnår ytelse nær Opus 5.5, brukte Claude Sonnet 5.5 cirka 193 000 output-tokens per Intelligence Index-oppgave,” fremgår det av innlegget.
Dette volumet ligger omtrent 60 % over Opus 5.5 og Sonnet 5 ved maksimal innsats. Det er også rundt 7 ganger så mye som GPT-6 Astra sitt maksimale antall.
Kunder med tidlig tilgang som Anthropic har intervjuet, rapporterte det motsatte når det gjelder Sonnet 5, dog på andre oppgaver. Balyasny Asset Management opplevde langt lavere token-bruk på sine finansoppgaver.
“På vår private pakke med 2441 finansoppgaver innen spørsmål og svar, ekstraksjon, analyse og prognoser, scoret Claude Sonnet 5.5 bedre enn Sonnet 5 og brukte omtrent 121 000 tokens per svar, der Sonnet 5 brukte 497 000,” opplyser Joe Poirier, Senior AI-ingeniør hos Balyasny Asset Management.
Artificial Analysis testet en pre-release-versjon med en feil knyttet til strukturert output, som Anthropic nå har rettet. Firmaet planlegger å gjennomføre de relevante testene på nytt snart.
Abonner på vår YouTube-kanal for ledende eksperters og journalisters innsikt









