Il nuovo modello di punta della serie 6.1 doveva essere GPT-6.1 Astra, ma OpenAI ne ha fermato il rilascio poche ore prima del DevDay sembra per problemi legati ai controlli di sicurezza del modello. Il 29 settembre, sul palco della conferenza per sviluppatori, è arrivato così GPT-6.1 Sol, l’aggiornamento della fascia intermedia uscito appena una settimana dopo GPT-6 Sol.
Il listino resta lo stesso, cioè 2 dollari per milione di token in input e 10 in output, mentre la lettura dalla cache scende a 0,10. La promessa di OpenAI è ambiziosa, perché parla di prestazioni vicine ad Astra a circa un quinto del costo su coding, uso del computer e flussi di lavoro aziendali. GPT-6.1 Sol è in concorrenza diretta con Claude Sonnet 5.5 (hanno lo stesso prezzo) e si rivolge soprattutto a chi sviluppa agenti, automatizza processi d’ufficio o usa Codex e GitHub Copilot ogni giorno.
Artificial Analysis colloca il modello a un punto da Astra nel suo indice, mentre Bridgebench, con prove pratiche di grafica 3D, lo posiziona appena sopra GPT-6 Sol.
Nuovi modelli che durano una settimana
Il 22 settembre OpenAI ha presentato GPT-6 Sol e GPT-6 Luna, in risposta all’uscita di Claude Opus 5.5 arrivato poche ore prima. Il 29 settembre, alla DevDay, GPT-6 Sol era già stato rimpiazzato da 6.1 Sol. Il predecessore ha quindi circolato sette giorni: il tempo di informarsi, di provarlo, e di scoprire che non esiste più.
Per te che usi questi strumenti la conseguenza è pratica. Il primo step di ogni famiglia di modelli sta diventando un banco di prova: i numeri di lancio sono buoni, l’esperienza d’uso spesso di meno, e la correzione arriva con il suffisso .1. Chi ha costruito processi, prompt o automationi agganciandosi a GPT-6 Sol si è ritrovato, in sette giorni, con un modello già andato.
Meno passaggi, più cache e l’API che cambia
OpenAI non ha diffuso dettagli sull’architettura, ma i dati tecnici sono chiari. La finestra di contesto arriva a 1,05 milioni di token, una risposta può contenere fino a 128.000 token e le conoscenze del modello si fermano al 30 aprile 2026. Il ragionamento si regola con il parametro reasoning effort su cinque livelli, da low a max, con medium come valore predefinito, e a differenza di GPT-6 Sol non esistono più le opzioni none e minimal.
Il modello completa i compiti con meno turni, cioè meno scambi tra una chiamata e l’altra, e quindi rilegge meno testo in input, mentre la cache costa la metà. In compenso produce dal 10 al 30% di token in output in più rispetto al predecessore, una spesa extra che riduce solo in parte il vantaggio.
Per chi sviluppa cambia anche il modo di usare gli strumenti. Per la ricerca web, l’interprete di codice e il computer use serve la Responses API, mentre la vecchia Chat Completions funziona ancora ma senza strumenti. Oltre i 272.000 token in ingresso, inoltre, scatta una soglia che raddoppia la tariffa dell’input e moltiplica per 1,5 quella dell’output.
Sul fronte dell’affidabilità OpenAI dichiara un tasso di errori fattuali sceso dall’11,4% al 7,7% al livello low, mentre i casi in cui il modello non ammette che uno strumento di ricerca è guasto passano dal 4,9% al 2,1%. La system card segnala però un dato meno favorevole, con l’1,50% di inganni nei compiti di programmazione contro lo 0,51% di Astra.
DeepSWE, AutomationBench e OSWorld premiano Sol
I numeri di OpenAI partono da DeepSWE v1.1, un test che richiede di correggere bug reali in progetti software e verifica la soluzione con la suite di test del codice. Qui GPT-6.1 Sol eguaglia Astra con un costo di circa un quinto e supera GPT-6 Sol di 6,4 punti. Su AutomationBench, che misura la capacità di portare a termine processi aziendali con strumenti reali, ottiene 2,2 punti più di Claude Opus 5.5 al livello medium e 4,8 più di GPT-6 Sol.
Nell’uso del computer, misurato da OSWorld 2.0 tra finestre, menu e applicazioni, guadagna 7 punti sul predecessore e resta a 2,1 da Astra con un settimo della spesa. Su Terminal-Bench Science, una prova di ricerca scientifica da terminale, più che raddoppia il punteggio di GPT-6 Sol con 5,47 dollari per compito, contro i 23,21 di Opus 5.5 e i 23,80 di Astra.
Artificial Analysis misura invece l’intelligenza generale con il suo Intelligence Index, che riunisce dieci prove diverse. GPT-6.1 Sol al livello max ottiene 52 punti, quattro più di GPT-6 Sol e uno meno di Astra, ma resta dietro a Claude Sonnet 5.5 (56) e Opus 5.5 (58). Migliora anche nella conoscenza fattuale, con 8 punti di accuratezza in più su AA-Omniscience e 6 punti in meno di allucinazioni.
Le prove più lunghe raccontano un’altra storia. Su AA-Briefcase, dedicato a progetti di più ore, guadagna circa 80 punti Elo ma si ferma a 1564 contro i 1822 di Opus 5.5. Su Humanity’s Last Exam ottiene il 52,9% contro il 61,4% di Opus, e su Terminal-Bench 4.0 il 56,1% contro il 59,6%.
Stesso listino di Sonnet 5.5, ma un costo per attività dieci volte più basso
Le tariffe API di GPT-6.1 Sol restano a 2 e 10 dollari per milione di token, come quelle di GPT-6 Sol, mentre la lettura dalla cache passa da 0,20 a 0,10 dollari e la scrittura costa 2,50.
Chi non ha bisogno di risposte immediate può dimezzare la spesa con due opzioni. Batch raccoglie molte richieste in un unico invio e restituisce i risultati entro 24 ore, mentre Flex funziona come una chiamata normale ma con priorità bassa, quindi con tempi più lunghi e qualche richiesta respinta nei momenti di carico. La modalità Fast, al contrario, raddoppia il prezzo in cambio di risposte più rapide. In arrivo c’è una versione Gpt-6 Sol Ultrafast per Codex, che secondo l’azienda genererà token otto volte più in fretta.
| Modello | Input ($/M token) | Output ($/M token) | Lettura cache ($/M token) |
|---|---|---|---|
| GPT-6.1 Sol | 2 | 10 | 0,10 |
| GPT-6 Sol | 2 | 10 | 0,20 |
| GPT-6 Astra | 10 | 50 | 0,50 |
| Claude Sonnet 5.5 | 2 | 10 | 0,20 |
| Claude Opus 5.5 | 4 | 20 | 0,20 |
Il dato che conta di più è il costo per attività, cioè la spesa media per completare le prove dell’indice di Artificial Analysis. Al livello max GPT-6.1 Sol costa 0,72 dollari, il 31% meno di GPT-6 Sol e meno di un quarto di Astra, mentre con low scende a 0,13. Il confronto con Sonnet 5.5 è il più eloquente, perché a parità di listino il modello di Anthropic usa circa 193.000 token di output per prova contro 38.000, e spende oltre dieci volte tanto per quattro punti di indice in più.
Il modello è disponibile nell’API come gpt-6.1-sol, in ChatGPT Work e in Codex per gli abbonamenti Plus, Pro, Business, Enterprise ed Edu, mentre la versione standard del chatbot lo riceverà più avanti. Su GitHub Copilot è in rilascio graduale per i piani Pro+, Max e per le aziende, e si trova anche su OpenRouter e Vercel AI Gateway.
GPT-6.1 Sol conviene ma con un criterio
GPT-6.1 Sol non è il modello più intelligente della sua fascia, ma è quello che oggi costa meno per arrivare a un risultato vicino al vertice. Nell’indice di Artificial Analysis ogni livello di ragionamento si colloca sulla frontiera di Pareto, cioè la curva delle migliori combinazioni tra intelligenza e costo, e su automazioni d’ufficio, analisi di documenti e uso del computer insidia Opus 5.5 con una frazione della spesa. Per chi gestisce migliaia di chiamate al giorno, la differenza si vede subito nei costi.
I limiti, però, emergono proprio dove servono autonomia e giudizio. Sui progetti lunghi, sul ragionamento più difficile e sul lavoro da terminale Opus 5.5 e Sonnet 5.5 restano davanti. Se costruisci agenti per processi aziendali, estrazione di dati o analisi di documenti, conviene partire dal livello medium e salire a high solo dove la qualità non basta.













