Un mese dopo il lancio di Claude Fable 5, è arrivata la risposta di OpenAI: GPT-5.6, uscito il 9 luglio in tre varianti con nomi celesti, Luna, Terra e Sol. Come sempre, lasciamo i benchmark ai thread e proviamo a leggere l’annuncio con gli occhi di chi deve decidere un budget e un’architettura.

Cosa è uscito davvero

Tre fatti. Il primo: la gamma è esplicitamente a tre livelli, dal più leggero al più capace, e OpenAI descrive Sol come il suo “cavallo da lavoro” e “miglior modello di coding di sempre”, orientato a ragionamento complesso e flussi agentici. Il secondo: Sol ha un contesto da 1,05 milioni di token con output fino a 128 mila, a 5 dollari per milione in input e 30 in output, il listino della generazione precedente. Il terzo, meno raccontato: OpenAI lo definisce il proprio modello più forte sulla cybersecurity difensiva, con supporto esplicito a threat modeling, revisione del codice, patching e attività da blue team.

La strategia commerciale è chiara e opposta a quella di Anthropic: dove Fable 5 ha alzato il prezzo insieme alle capacità, OpenAI tiene il listino fermo e allarga il contesto.

Il contesto da un milione di token: a cosa serve davvero

Un milione di token sono circa 1.500 pagine. I casi d’uso che si aprono sono concreti: il contratto quadro con tutti gli allegati letto insieme, il fascicolo di gara completo, un anno di verbali di cantiere, una codebase media intera. Sparisce (per molti casi) l’ingegneria di spezzatura e ricucitura che oggi occupa metà del lavoro di integrazione.

Due avvertenze da consulente, però. La prima è economica: il contesto lungo si paga a consumo, e riempirlo tutto costa 5 dollari a chiamata solo di input; una pipeline disegnata male può bruciare in una settimana il budget di un mese. La seconda è di qualità: la capacità dichiarata sul contesto e la resa effettiva in fondo al contesto non sempre coincidono, e prima di costruirci sopra un processo va misurata sui tuoi documenti.

Il quadro competitivo per chi decide adesso

Per la prima volta da mesi la scelta tra i due frontier è davvero interessante. Fable 5 tiene la punta sulle capacità pure e sui compiti lunghi in autonomia, ma costa il doppio ($10/$50 contro $5/$30). Sol risponde con il contesto più ampio e il prezzo fermo, e sulla cybersecurity difensiva si posiziona su un terreno dove i team di sicurezza aziendali hanno appetito e budget. Per il coding, dove entrambi dichiarano il primato, l’unica risposta onesta è il test sui compiti tuoi: la nostra griglia aggiornata è nella guida ai migliori LLM per il coding.

Per chi è già in uno dei due ecosistemi, il costo di cambio (prompt, integrazioni, valutazioni rifatte) resta quasi sempre superiore al beneficio. Per chi entra ora, il confronto strutturato tra i due mondi è nel nostro ChatGPT contro Claude per l’azienda.

In sostanza: GPT-5.6 non vince la gara dei benchmark, vince quella del listino: più contesto e più capacità allo stesso prezzo, con una gamma che premia chi instrada i compiti con criterio. Se vuoi capire quale mix di varianti (o di fornitori) ha senso per i tuoi volumi, parlaci del tuo progetto.

Domande frequenti

Sono tre livelli di capacità e costo, dal più leggero al più potente. Luna è la variante economica per compiti semplici e volumi alti, Terra la via di mezzo per il lavoro quotidiano, Sol il flagship per ragionamento complesso, coding e flussi agentici. La logica per un'azienda è la stessa che applichiamo da tempo: instradare ogni compito sulla variante più economica che lo risolve bene, non mandare tutto al modello di punta.

5 dollari per milione di token in input e 30 in output, in linea con la generazione precedente: la capacità in più arriva a parità di prezzo. Il dato nuovo è il contesto: 1,05 milioni di token in ingresso e fino a 128 mila in uscita, cioè la possibilità di lavorare su interi archivi, codebase o fascicoli in una sessione sola. Per confronto, Claude Fable 5 costa il doppio ($10/$50).

Circa 1.500 pagine di testo in una singola richiesta. In pratica: un contratto quadro con tutti gli allegati, un anno di verbali, una codebase media, un fascicolo di gara completo, analizzati insieme senza spezzarli. Attenzione però al costo: riempire il contesto costa (un milione di token in input sono 5 dollari a chiamata) e la qualità sull'estremo del contesto va verificata sul tuo caso, non data per scontata.

Se sei già nell'ecosistema OpenAI, l'aggiornamento è naturale: più capacità e contesto allo stesso prezzo. Se sei su Claude, il quadro è competitivo: Fable 5 tiene la punta sulle capacità pure ma costa il doppio; Sol vince su prezzo e contesto. La risposta seria dipende dal caso d'uso e si ottiene con un test comparativo sui tuoi compiti reali, che costa mezza giornata e vale più di qualsiasi benchmark.