OpenAI e Anthropic hanno svelato quasi simultaneamente tre nuovi modelli che illustrano una nuova fase della loro rivalità. GPT-6 Sol e Luna riducono drasticamente il costo di accesso alla famiglia GPT-6, mentre Claude Opus 5.5 rende le prestazioni high-end di Anthropic più accessibili. Dietro i benchmark, la competizione si gioca sempre di più sulla quantità di lavoro effettivamente svolto per ogni dollaro speso.
La Nuova Dinamica Competitiva tra Giganti dell'IA
Gli annunci sono avvenuti in rapida successione con un intervallo di circa novanta minuti il 22 settembre: Anthropic ha presentato prima Claude Opus 5.5, seguito dall'estensione della gamma GPT-6 da parte di OpenAI (con Sol e Luna). Sebbene i tre modelli non siano pensati per gli stessi usi specifici, i loro lanci ravvicinati evidenziano una tendenza comune nel settore: fornire capacità maggiori a un costo operativo nettamente inferiore.
Panoramica dei Modelli e delle Strategie Tariffarie
GPT-6 di OpenAI
OpenAI ha posizionato la sua nuova gamma per coprire diversi tipi di carichi di lavoro. GPT-6 Sol è destinato al lavoro professionale complesso, allo sviluppo software e agli agenti che richiedono l'uso di un computer. Al contrario, GPT-6 Luna predilige velocità, volumi elevati e operazioni più mirate. Per quanto riguarda i compiti più esigenti rimane il modello GPT-6 Astra.
OpenAI ha annunciato una significativa riduzione dei costi per questi modelli rispetto ai prezzi promozionali della generazione GPT-5.6:
- GPT-6 Sol: $2 per milione di token in input e $10 in output. (Costo aggiuntivo API: $0,20 per milione di token memorizzati in cache).
- GPT-6 Luna: $0,10 per milione di token in input e $0,50 in output. (Costo aggiuntivo API: $0,01 per milione di token memorizzati in cache).
Reuters riferisce che OpenAI attribuisce parte di questo calo di prezzo ai progressi realizzati nella sua infrastruttura di cache e inferenza.
Claude Opus 5.5 di Anthropic
Anthropic ha adottato una strategia simile ma su un segmento di gamma più elevato. Claude Opus 5.5 è tariffato a $4 per milione di token in input e $20 in output, rispetto ai precedenti $5 e $25 di Opus 5. Nonostante il costo superiore, Anthropic stima che il risparmio effettivo possa raggiungere circa il 40% sui carichi di lavoro abituali, poiché Opus 5.5 è più efficiente nell'uso dei token per specifici compiti.
Confronto delle Prestazioni
Entrambe le aziende presentano progressi significativi nelle performance associate alla riduzione dei costi.
- Prestazioni Anthropic: Anthropic presenta Opus 5.5 come in grado di raggiungere il livello di Claude Fable 5.1 e, sulla maggior parte dei compiti, superarlo su diverse valutazioni agentiche. Ad esempio, su Terminal-Bench 4.0 annuncia un punteggio del 66,4%, rispetto al 55,8% di Fable 5.1 e al 52,3% di Opus 5.
- Dichiarazioni di OpenAI: Allo stesso modo, OpenAI dichiara che Sol e Luna beneficiano dei progressi ottenuti con Astra in termini di ragionamento, affidabilità fattuale, codice e utilizzo del computer.
Implicazioni per il Mercato AI: Costo Totale vs Benchmark
I lanci mettono in luce la complessità del confronto diretto tra i modelli, poiché non è disponibile un test comparativo ufficiale che esegua GPT-6 Sol e Claude Opus 5.5 con gli stessi parametri e nello stesso ambiente di valutazione.
Orientamento Strategico:
- Omnicompagnia (OpenAI): La famiglia mostra livelli diversi per coprire ogni esigenza: Astra per i problemi più difficili, Sol per compiti complessi ripetitivi, e Luna dove il costo e il volume diventano la priorità assoluta.
- Efficienza Operativa (Anthropic): Anthropic enfatizza l'efficienza degli agenti che operano su lunghi periodi, citando ad esempio una migrazione di 680.000 righe di codice eseguita in meno di un giorno da parte di un utente early adopter.
La sicurezza è inoltre un punto centrale: Anthropic ha sottoposto Opus 5.5 a valutazione esterna (tra cui METR e Frontier Design) e riporta, ad esempio, una riduzione dell'85% nei tentativi di aggiramento dei limiti di confinamento rispetto a Opus 5 e Mythos 5.1.
Infine, il lancio di Claude Opus 5.5 avviene in un contesto peculiare: è il primo modello pubblicato da Anthropic dopo l'appello di Dario Amodei di moderare collettivamente il ritmo della progressione dei sistemi più avanzati, sottolineando che la ricerca non è sulla sospensione dello sviluppo, ma sul bilanciare sicurezza e capacità tecnica.
In sintesi, la competizione tra le due aziende non si focalizza più esclusivamente sulla corsa al miglior punteggio su un benchmark. Con l'introduzione di modelli come GPT-6 Sol, Luna e Claude Opus 5.5, entrambe mettono in risalto l'efficienza economica. Per le aziende che dispiegano agenti su larga scala, il vero comparativo sembra spostarsi dal costo nominale per milione di token al costo totale necessario per completare correttamente un compito complesso nel tempo.