Zuckerbergs Muse Code taper mot Anthropic på Metas egne benchmark-diagrammer

  • Zuckerberg lanserte Muse Code, og Metas egne lister setter Claude Opus 5 først
  • Meta utelot OpenAIs beste kode-modell fra sine benchmark-sammenligninger
  • Uavhengige tester viser at den reelle lederen får 89,5 %, over alle Meta-tall.

Mark Zuckerberg lanserte Muse Code i beta onsdag, Metas første kunstige intelligens (AI) kodeagent. Anthropics Claude Opus 5 slår den i alle de fire sammenligningene Meta publiserte ved lansering.

Meta publiserte likevel disse diagrammene. Selskapet selger et billigere verktøy, ikke et bedre. Uavhengige testdata tyder på at forskjellen er større enn det Meta viste.

Følg oss på X for å få de siste nyhetene med en gang

Metas egne diagrammer gir Anthropic seier hver runde

Muse Spark 1.2 er modellen som brukes i Muse Code. Den fikk 82,9 % på Terminal-Bench 2.1.

Claude Opus 5 fikk 86,7 % på samme test. Terminal-Bench kommer fra Laude Institute og Stanford-forskere. Den inkluderer 89 reelle arbeidsoppgaver innen systemreparasjon, dataarbeid og sikkerhet.

Andreplass er respektabelt. Muse Code slo OpenAIs Codex med 81,8 % og Grok Build med 81,6 %.

Benchmark sammenligningsdiagram for Muse Spark 1.2
Benchmark sammenligningsdiagram for Muse Spark 1.2, Kilde: Zuckerberg

Det neste diagrammet var strengere. DeepSWE 1.1 gir 113 kodeoppgaver der nett-tilgang skrus av under vurdering. Muse Spark 1.2 falt til tredjeplass med 59,3 %.

Meta publiserte så en test de laget selv, basert på 440 ekte pull requests fra egne ingeniører. Muse Spark 1.2 fikk 70,6 % der, omtrent ni poeng bak Opus 5.

Muse Spark 1.2 kjørte en kernel-optimaliseringsoppgave i 24 timer på NVIDIA Hopper — over 1000 verktøy-kall — og fant fortløpende faktiske forbedringer lenge etter den første utforskningsfasen.
Muse Spark 1.2 kjørte en kernel-optimaliseringsoppgave i 24 timer på NVIDIA Hopper — over 1000 verktøy-kall — og fant fortløpende faktiske forbedringer lenge etter den første utforskningsfasen.

Den poengsummen ligger kun 2,3 poeng over Muse Spark 1.1, modellen Meta sendte ut i juli.

Modellen Meta utelot fra sine kode-diagrammer

Meta sammenlignet seg med GPT-5.6 Terra. OpenAI selger en sterkere modell kalt Sol, og Meta utelot den fra alle de tre kode-diagrammene.

Sol topper den uavhengige Terminal-Bench 2.1 topplisten med 89,5 %. Opus 5 følger med 89,1 %.

Begge resultatene slår de 86,7 % Meta rapporterte for Opus 5. Meta valgte en svakere versjon av sin sterkeste konkurrent og havnet likevel bak.

Sammenlignet med Sol, den virkelige lederen, henger Muse Spark 1.2 etter med 6,6 poeng i stedet for 3,8.

Meta inkluderte Sol ett sted. På en grafikkprosessor (GPU) kernel-oppgave som kjørte over 1000 verktøy-kall, forbedret Sol baseline med 71,2 %. Muse Spark 1.2 klarte 68,7 % og ble nummer fire av seks.

En ting trekker i motsatt retning. Muse Spark 1.2 vises ikke på den offentlige topplisten ennå, hvor kun 26 av 183 sporede modeller er testet. Sifrene 82,9 % forblir et Meta-resultat.

“Muse Spark 1.2 er vårt neste steg mot grenselandet, med større og mer kapable modeller på vei,” sa Zuckerberg i et innlegg.

Zuckerberg kan snart hoste modellen som slår hans egen

Meta er angivelig i samtaler om å leie ut datakraft til Anthropic. Avtalen kan bli verdt $ 10 milliarder over to år. Metas datasentre vil da bidra til å kjøre Claude-modellene Muse Code var laget for å fortrenge.

Ledelsen bak Muse Code var dyr. Zuckerberg betalte $ 14,3 milliarder i juni 2025 for Scale AI og dets grunnlegger Alexandr Wang, som nå leder Meta Superintelligence Labs.

Pris er det grepet Wang har igjen. Prisene matcher lanseringen av Metas første betalte API i juli til $ 1,25 per million input-tokens og $ 4,25 per million output-tokens.

Et contributor-nivå koster mer enn 10 ganger mindre. Utviklere kvalifiserer ved å la Meta trene på deres arbeid. Wang ville ikke opplyse hvor mange som har tatt i bruk Muse Spark-serien.

Metas regnskap forklarer rabatten. Inntektene økte med 28 % til $ 60,8 milliarder forrige kvartal, men driftsresultatet falt med 8 % til $ 18,8 milliarder.

Driftsmarginen falt til 31 % fra 43 % ett år tidligere. Meta brukte $ 31,08 milliarder på kapitalprosjekter bare i kvartalet, og anslår opptil $ 145 milliarder for året.

Muse Code tilbyr tekniske funksjoner Claude Code mangler. Bakgrunnsagenter holder kontekst gjennom en økt. Sub-agenter jobber i isolerte kopier av et repository.

Meta har laget en solid nest best koder og priset den som et billig-alternativ. Betaen vil vise om utviklere bytter bort noen prosentpoeng nøyaktighet mot en regning som er omtrent en tidel så stor.


For å lese de siste kryptomarkedsanalysene fra BeInCrypto, klikk her.

Ansvarsfraskrivelse

Alle informatie op onze website wordt te goeder trouw en uitsluitend voor algemene informatiedoeleinden gepubliceerd. Elke actie die de lezer onderneemt op basis van de informatie op onze website is strikt op eigen risico.