OpenAI en Anthropic hebben bijna tegelijkertijd drie nieuwe modellen gelanceerd, wat een nieuw hoofdstuk in hun rivaliteit illustreert. GPT-6 Sol en Luna verlagen de toegangskosten tot de GPT-6 familie sterk, terwijl Claude Opus 5.5 het high-end prestatiebereik van Anthropic toegankelijker maakt qua tarief. Achter de benchmarks wordt de concurrentie steeds meer bepaald door de hoeveelheid werk die daadwerkelijk per uitgegeven dollar kan worden gedaan.
Het Tijdschema en De Gemeenschappelijke Trend
De aankondigingen vonden plaats op 22 september met intervallen van ongeveer negentig minuten. Anthropic presenteerde eerst Claude Opus 5.5, waarna OpenAI zijn GPT-6 assortiment aanvulde met Sol en Luna. Hoewel de drie modellen niet exact dezelfde toepassingen beoogen, benadrukken hun nabije lanceringen één gemeenschappelijke trend: meer functionaliteit tegen een aanzienlijk lager operationeel kostenplaatje.
OpenAI positioneert GPT-6 Sol als een model voor complex professioneel werk, softwareontwikkeling, agents en taken die het gebruik van een computer vereisen. GPT-6 Luna richt zich daarentegen op snelheid, grote volumes en meer gerichte operaties. GPT-6 Astra blijft het meest capabele model binnen de familie voor de meest veeleisende taken. Reuters meldt dat OpenAI deze prijsdaling mede schrijft aan verbeteringen in hun cache- en inferentie-infrastructuur.
Vergelijking van Prijzen en Taxonomieën
Het tariefverschil tussen de modellen is significant. GPT-6 Sol kost $2 per miljoen input tokens en $10 per output token, terwijl Luna daalt tot $0,10 voor input en $0,50 voor output. OpenAI presenteert deze tarieven als een verlaging van 50% ten opzichte van de promotietarieven van de GPT-5.6 generatie. De officiële API-gegevens voegt bovendien een tarief toe van $0,20 per miljoen gecachede tokens voor Sol en slechts $0,01 voor Luna.
Anthropic volgt met een vergelijkbare strategie met Claude Opus 5.5, maar op een hoger segment. Dit model wordt gefactureerd tegen $4 per miljoen input tokens en $20 per output token, vergeleken met de tarieven van $5 en $25 voor Opus 5. Anthropic schat echter dat de werkelijke besparing bij gebruikelijke werkbelastingen ongeveer 40% bedraagt, omdat Opus 5.5 ook minder tokens gebruikt om bepaalde taken uit te voeren.
Prestatieverschuiving van Benchmarks naar Efficiëntie
De kostenverlaging gaat gepaard met geclaimde prestatieverbeteringen. Anthropic presenteert Opus 5.5 als in staat om het niveau van Claude Fable 5.1 te bereiken bij de meeste taken, en dit zelfs overtreffen op verschillende agentische evaluaties. Op Terminal-Bench 4.0 kondigt Anthropic bijvoorbeeld een score van 66,4% aan, vergeleken met 55,8% voor Fable 5.1 en 52,3% voor Opus 5. Deze resultaten zijn afkomstig van door Anthropic gepubliceerde evaluaties en vormen geen onafgeklede vergelijking met de nieuwe modellen van OpenAI.
VentureBeat wijst terecht op de moeilijkheid om een winnaar aan te wijzen op basis van de beschikbare benchmarks, aangezien beide bedrijven nog geen directe vergelijking hebben gepubliceerd tussen GPT-6 Sol en Claude Opus 5.5, uitgevoerd met dezelfde parameters en binnen hetzelfde evaluatie-omgeving. De beschikbare resultaten suggereren dat Opus 5.5 een bijzonder ambitieuze positie behoudt bij complexe agentische taken, terwijl Sol een bruttoprijs biedt die twee keer lager is ($2 en $10 tegenover $4 en $20 voor de concurrent).
De introductie van Luna maakt de vergelijking complexer nog. Met $0,10 per miljoen input tokens en $0,50 per output token richt dit model zich meer op routinematige taken en grote volumes dan op directe concurrentie met Opus 5.5. OpenAI streeft hiermee naar het aanbieden van meerdere modelniveaus binnen dezelfde familie: Astra voor de moeilijkste problemen, Sol voor complexe herhaalde taken en Luna voor operaties waarbij kosten en volume prioriteit krijgen.
Strategische Positionering van de Modellen
Anthropic richt zich daarentegen op de efficiëntie van agents die gedurende lange periodes werken. Het bedrijf citeert bijvoorbeeld een migratie van 680.000 regels code, uitgevoerd in minder dan een dag door een vroege gebruiker. Andere door Anthropic gemelde tests laten zien verminderingen in het aantal stappen, de uitvoertijd of benodigde tokens. Deze voorbeelden komen echter afkomstig van Anthropic en geselecteerde partners voor de eerste tests; ze moeten worden aangevuld met onafhankelijke evaluaties om de prestaties onder meer gevarieerde omstandigheden te meten.
Beide bedrijven leggen ook nadruk op veiligheid. Anthropic geeft aan dat Claude Opus 5.5 vóór de lancering is beoordeeld door externe instanties, waaronder METR en Frontier Design. In hun geautomatiseerde gedragsaudit die bijna 2.000 scenario's omspant, stelt het bedrijf dat Opus 5.5 zijn beste resultaten tot nu toe behaalt. Anthropic rapporteert tevens ongeveer 85% minder pogingen tot het overschrijden van de confinementgrenzen in vergelijking met Opus 5 en Mythos 5.1. OpenAI stelt daarentegen dat Sol en Luna profiteren van vooruitgang bereikt met Astra op het gebied van redenering, feitelijke betrouwbaarheid, code, computeralgebra en uitlijning (alignment).
Deze lanceringen vallen in een bijzonder context voor Anthropic, aangezien Claude Opus 5.5 het eerste model is dat gepubliceerd sinds de oproep van Dario Amodei om het tempo van progressie van de meest geavanceerde systemen collectief te modereren. Anthropic specificeert dat deze positie niet betekent dat de ontwikkeling stopt, maar dat men op zoek is naar een ritme dat veiligheidsontwikkelingen kan bijhouden in vergelijking met hun capaciteiten.
De Nieuwe Metriek van Concurrentie
De concurrentie tussen OpenAI en Anthropic komt dus niet langer neer op het zoeken naar de beste score op een benchmark. Met GPT-6 Sol, Luna en Claude Opus 5.5 benadrukken beide bedrijven nu primair de economische efficiëntie: tokenskosten, cachegebruik, aantal benodigde stappen, succesratio en hoeveelheid voltooerd werk. Voor ondernemingen die agents grootschalig inzetten, zou het ware vergelijkingskader daarmee minder gaan over de prijs van een miljoen tokens dan over de totale kosten om een taak correct af te ronden.